模型、速度与限制
每个口型同步层级在速度、质量和项目规模之间都有不同的权衡。模型差异概览
各模型的擅长领域
Lip Sync
Lip Sync 是许多项目最实用的默认选择。
当您需要以下内容时,它是最佳选择:
- 快速交付
- 普通谈话类视频的良好质量
- 强大的质量与成本平衡
Lip Sync Pro
Lip Sync Pro 比标准口型同步更注重面部细节。
其主要优势包括:
- 更强的胡须渲染
- 更好的牙齿生成
- 更清晰的嘴部区域细节
- 更好地处理画面中较大的脸部区域
- 更紧凑的特写镜头
- 高端创作者内容
- 优质营销视频
- 对面部细节要求高于处理速度的项目
Lip Sync 更慢且成本更高。
Lip Sync Studio
当拍摄本身难度较大或输出标准特别高时,Lip Sync Studio 是最强大的模型。
它最大的区别在于:
- 它能对整个镜头建立更全面的理解,而不是依赖较小的独立片段
- 它能原生处理遮挡问题,而无需依赖额外设置
- 它在侧面视角、肩部以上构图和非正面口型位置的表现要强得多
- 它能更好地保留说话者的语调、情感和表演细节
- 它是为更高质量的输出而构建的,包括更强的 4K 定位能力
Lip Sync Studio 在以下方面优于 Lip Sync Pro:
- 高难度摄像机角度
- 面部有部分遮挡的镜头
- 在较长的不间断镜头中一致性至关重要的场景
- 对视觉伪影容忍度较低的优质短视频作品
为什么有些视频处理时间更长
两个时长相同的视频,其处理过程可能大不相同。 常见原因:- 一个视频包含许多场景切换,而另一个大多是一个稳定的镜头
- 一个视频屏幕上有多个面孔
- 一个视频有更多的侧面视角或极端角度
- 一个视频在嘴部或面部有更多的部分遮挡
- 一个视频中说话者清晰可见且正在积极说话的帧数较少
- 一个视频的分辨率更高
- 处理时的队列负载不同
Lip Sync 和 Lip Sync Pro,包含许多场景变化或许多没有清晰说话面孔帧的视频,其高效处理难度会大大增加。这可能会增加运行时间,并使长篇内容在处理困难时更容易失败。
Lip Sync Studio 在处理这些高难度镜头时通常更具韧性,但它仍然是最慢的层级,因为模型在每个镜头上执行的工作量更大。
为什么有些片段会失败或效果不佳
当源素材包含以下内容时,质量可能会下降:- 静止或几乎静止且看起来不像在说话的面孔
- 许多快速剪辑
- 画面中过小的面孔
- 低层级下的强侧面镜头
- 严重的遮挡
- 非人类或非类人面孔
Lip Sync适用于大多数标准视频Lip Sync Pro可改善优质面部细节- 当素材难度大、价值高或视觉要求高时,
Lip Sync Studio是最佳选择
典型性能
这些时间仅为估算值,而非保证。实际运行时间取决于队列负载、视频时长、分辨率和源素材的复杂程度。当前时长限制
口型同步限制可能会随时间变化。如果您正在规划大型制作工作流,请在开始长任务之前在应用中确认当前限制。
长任务。
影响速度的因素
- 视频时长
- 分辨率
- 当前队列深度
- 面部角度复杂度
- 场景切换次数
- 可见人脸数量
- 说话人脸被遮挡的频率
- 说话者在整个镜头中是否清晰可见
- 音频清晰度
当前计费影响
以下是除翻译视频时长外,当前额外计费的分钟数:- Lip Sync:
+4 - Lip Sync Pro:
+9 - Lip Sync Studio:
+14
套餐可用性
- Beginner:不可用
- Starter:
Lip Sync - Creator:
Lip Sync和Lip Sync Pro - Pro:
Lip Sync和Lip Sync Pro - Scale:
Lip Sync、Lip Sync Pro和Lip Sync Studio

