Skip to main content

音声クローニングのベストプラクティス

より良いクローニングは、より良いソース素材から始まります。ソース音声のわずかな改善が、最終的な音声に顕著な違いをもたらすことがあります。

サンプルをクリーンに保つ

以下のような音声を目指してください:
  • クリアであること
  • ドライであること(残響がない)
  • 低ノイズであること
  • 激しい音楽や群衆の音が含まれていないこと
ファイル形式そのものよりも、録音の品質が重要です。

一貫した音声を使用する

サンプル素材が統一された話し方であるほど、モデルはより良く反応します。 以下を維持するように努めてください:
  • 同様の録音環境
  • 同様の話し方のトーン
  • 同様のエネルギーレベル
ソース音声がささやき声、叫び声、ノイズの多いクリップ、クリアなナレーションの間で変動する場合、クローンされた結果が不安定になる可能性があります。

求めるパフォーマンスに合わせる

クローンされた音声は、サンプル素材のスタイルを引き継ぐ傾向があります。
  • 落ち着いたサンプルは、より落ち着いた出力を生成します
  • 表現力豊かなサンプルは、より表現力豊かな出力を生成します
  • 早口の話し方は、早口の出力を生成する可能性があります
クリアで安定したナレーターの雰囲気を求める場合は、同じスタイルのソースクリップを使用する方が通常はうまくいきます。

十分な量の音声を使用するが、多すぎないようにする

経験則として:
  • 可能な場合は、少なくとも1分程度の有効な音声を使用してください
  • 1〜2分のクリアな素材が、通常は強力な範囲です
  • ほとんどの場合、5分を超えても実用的な利点はほとんどありません

音量を一定に保つ

以下のようなサンプルは避けてください:
  • 音量が小さすぎる
  • クリップしている、または歪んでいる
  • 不自然に聞こえるほど過度にノーマライズされている
過度に大きな音量よりも、バランスの取れた録音レベルの方が適しています。

適切な分離モードを選択する

ほとんどのプロジェクトでは:
  • Studioから開始してください
  • 環境の特性が体験の一部である場合にのみ、Realisticに切り替えてください

関連ページ