Skip to main content

模型、速度与限制

每个口型同步层级在速度、质量和项目规模之间都有不同的权衡。

模型差异概览

各模型的擅长领域

Lip Sync

Lip Sync 是许多项目最实用的默认选择。 当您需要以下内容时,它是最佳选择:
  • 快速交付
  • 普通谈话类视频的良好质量
  • 强大的质量与成本平衡
对于简单的视频,这通常已经足够。

Lip Sync Pro

Lip Sync Pro 比标准口型同步更注重面部细节。 其主要优势包括:
  • 更强的胡须渲染
  • 更好的牙齿生成
  • 更清晰的嘴部区域细节
  • 更好地处理画面中较大的脸部区域
这就是为什么 Pro 版本通常更适合以下场景:
  • 更紧凑的特写镜头
  • 高端创作者内容
  • 优质营销视频
  • 对面部细节要求高于处理速度的项目
其代价是处理速度比标准 Lip Sync 更慢且成本更高。

Lip Sync Studio

当拍摄本身难度较大或输出标准特别高时,Lip Sync Studio 是最强大的模型。 它最大的区别在于:
  • 它能对整个镜头建立更全面的理解,而不是依赖较小的独立片段
  • 它能原生处理遮挡问题,而无需依赖额外设置
  • 它在侧面视角、肩部以上构图和非正面口型位置的表现要强得多
  • 它能更好地保留说话者的语调、情感和表演细节
  • 它是为更高质量的输出而构建的,包括更强的 4K 定位能力
这就是为什么 Lip Sync Studio 在以下方面优于 Lip Sync Pro
  • 高难度摄像机角度
  • 面部有部分遮挡的镜头
  • 在较长的不间断镜头中一致性至关重要的场景
  • 对视觉伪影容忍度较低的优质短视频作品

为什么有些视频处理时间更长

两个时长相同的视频,其处理过程可能大不相同。 常见原因:
  • 一个视频包含许多场景切换,而另一个大多是一个稳定的镜头
  • 一个视频屏幕上有多个面孔
  • 一个视频有更多的侧面视角或极端角度
  • 一个视频在嘴部或面部有更多的部分遮挡
  • 一个视频中说话者清晰可见且正在积极说话的帧数较少
  • 一个视频的分辨率更高
  • 处理时的队列负载不同
对于 Lip SyncLip Sync Pro,包含许多场景变化或许多没有清晰说话面孔帧的视频,其高效处理难度会大大增加。这可能会增加运行时间,并使长篇内容在处理困难时更容易失败。 Lip Sync Studio 在处理这些高难度镜头时通常更具韧性,但它仍然是最慢的层级,因为模型在每个镜头上执行的工作量更大。

为什么有些片段会失败或效果不佳

当源素材包含以下内容时,质量可能会下降:
  • 静止或几乎静止且看起来不像在说话的面孔
  • 许多快速剪辑
  • 画面中过小的面孔
  • 低层级下的强侧面镜头
  • 严重的遮挡
  • 非人类或非类人面孔
原则上:
  • Lip Sync 适用于大多数标准视频
  • Lip Sync Pro 可改善优质面部细节
  • 当素材难度大、价值高或视觉要求高时,Lip Sync Studio 是最佳选择

典型性能

这些时间仅为估算值,而非保证。实际运行时间取决于队列负载、视频时长、分辨率和源素材的复杂程度。

当前时长限制

口型同步限制可能会随时间变化。如果您正在规划大型制作工作流,请在开始长任务之前在应用中确认当前限制。 长任务。

影响速度的因素

  • 视频时长
  • 分辨率
  • 当前队列深度
  • 面部角度复杂度
  • 场景切换次数
  • 可见人脸数量
  • 说话人脸被遮挡的频率
  • 说话者在整个镜头中是否清晰可见
  • 音频清晰度
根据经验,1080p 通常是速度与质量之间的最佳平衡点。4K 可以使用,但会增加处理时间。

当前计费影响

以下是除翻译视频时长外,当前额外计费的分钟数:
  • Lip Sync: +4
  • Lip Sync Pro: +9
  • Lip Sync Studio: +14

套餐可用性

  • Beginner:不可用
  • Starter: Lip Sync
  • Creator:Lip SyncLip Sync Pro
  • Pro:Lip SyncLip Sync Pro
  • Scale:Lip SyncLip Sync ProLip Sync Studio

相关页面