语音克隆
语音克隆可以重现原始来源中的说话者,使配音更贴近视频的原始身份。在 VoiceCheap 中如何运作
启用语音克隆后,VoiceCheap 会首先分离说话者的声音,然后生成试图保留原始表演特征的翻译语音。 质量在很大程度上取决于:- 源语音的清晰度
- 所选的语音分离方法
- 源音频是否包含噪音、音乐或重叠的语音
主要控件
稳定性
稳定性控制生成的语音在多次生成之间保持的平稳程度。- 较低的值允许更广泛的情感表达
- 极低的值可能会听起来仓促或不连贯
- 极高的值可能会听起来平淡或单调
相似度
相似度控制生成的语音与原始声纹的贴合程度。- 更高的数值可以更接近原始说话者
- 如果源音频有噪音,过高的相似度也可能引入不必要的伪影
说话者增强
说话者增强功能会促使模型更贴近原始说话者的身份特征。- 它通常比较微妙
- 它会增加计算量和延迟
- 当您希望克隆结果更接近源音频时,它会很有用
预览和重新生成
VoiceCheap 让您可以在自定义流程中预览语音示例。这是在进行完整翻译运行前验证语音克隆质量的最佳方式。 良好的工作流程:- 选择
Studio或Realistic - 预览说话者样本
- 调整稳定性、相似度或增强设置
- 如有需要,重新生成预览
- 预览听起来没问题后,启动翻译版本
何时避免使用语音克隆
在以下情况下,使用语音库或自定义语音可能效果更好:- 原始音频有噪音
- 多个说话者经常重叠
- 源音频中几乎没有清晰的语音
- 您希望在多个项目中保持一致的旁白语音
已知的口音限制(目前正在改进中)
对于某些语言,克隆输出的口音质量可能不够稳定。这种情况在以下语言中更为常见:- 越南语
- 泰语
- 他加禄语(菲律宾语)
- 一些资源较少或较罕见的语言对

