Skip to main content

语音克隆

语音克隆可以重现原始来源中的说话者,使配音更贴近视频的原始身份。

在 VoiceCheap 中如何运作

启用语音克隆后,VoiceCheap 会首先分离说话者的声音,然后生成试图保留原始表演特征的翻译语音。 质量在很大程度上取决于:
  • 源语音的清晰度
  • 所选的语音分离方法
  • 源音频是否包含噪音、音乐或重叠的语音

主要控件

稳定性

稳定性控制生成的语音在多次生成之间保持的平稳程度。
  • 较低的值允许更广泛的情感表达
  • 极低的值可能会听起来仓促或不连贯
  • 极高的值可能会听起来平淡或单调

相似度

相似度控制生成的语音与原始声纹的贴合程度。
  • 更高的数值可以更接近原始说话者
  • 如果源音频有噪音,过高的相似度也可能引入不必要的伪影

说话者增强

说话者增强功能会促使模型更贴近原始说话者的身份特征。
  • 它通常比较微妙
  • 它会增加计算量和延迟
  • 当您希望克隆结果更接近源音频时,它会很有用

预览和重新生成

VoiceCheap 让您可以在自定义流程中预览语音示例。这是在进行完整翻译运行前验证语音克隆质量的最佳方式。 良好的工作流程:
  1. 选择 StudioRealistic
  2. 预览说话者样本
  3. 调整稳定性、相似度或增强设置
  4. 如有需要,重新生成预览
  5. 预览听起来没问题后,启动翻译版本

何时避免使用语音克隆

在以下情况下,使用语音库或自定义语音可能效果更好:
  • 原始音频有噪音
  • 多个说话者经常重叠
  • 源音频中几乎没有清晰的语音
  • 您希望在多个项目中保持一致的旁白语音

已知的口音限制(目前正在改进中)

对于某些语言,克隆输出的口音质量可能不够稳定。这种情况在以下语言中更为常见:
  • 越南语
  • 泰语
  • 他加禄语(菲律宾语)
  • 一些资源较少或较罕见的语言对
在这些情况下,发音和口音可能听起来还不够地道。如果口音质量至关重要,目前建议优先选择语音库中的语音,同时我们正在持续改进此行为。 另一个已知行为:如果您克隆了一位英语说话者,翻译后的输出仍可能带有英语口音特征。例如,法语输出有时听起来更接近加拿大风格的口音。为了降低这种风险,通常最好选择目标语言的语音库语音。我们正在积极解决此问题。

相关页面