リップシンクの仕組み
リップシンクは、ソース動画と新しい音声トラックを取り込み、翻訳された音声とより一致するように話者の口の動きを更新します。変化するものと維持されるもの
VoiceCheapは話者の顔の領域に焦点を当てます。実際には:- 口と顔の下部の動きが更新されます
- ターゲット音声が新しい口の動きを駆動します
- フレームの残りの部分は可能な限りそのまま維持されます
高レベルのパイプライン
1
顔の検出
VoiceCheapは話者の顔を特定し、口と顔の下部周辺の関連する顔のランドマークを追跡します。
2
翻訳された音声の分析
システムはターゲット音声を聴き取り、音声に合わせるために必要な口の形を計算します。
3
新しいリップシンクの生成
翻訳された音声により正確に一致するように、発話領域がフレームごとに再生成されます。
4
結果を動画に合成
生成された口元領域が元のフレームに合成され、視覚的な整合性が保たれます。
ワークフローにおけるリップシンクの位置付け
リップシンクは品質向上の最初のステップではありません。通常の手順は以下の通りです:- 文字起こしを正確にする
- 音声戦略を選択する
- 吹き替え音声が自然に聞こえるようにする
- プロジェクトに効果的であればリップシンクを追加する
予想される制限事項
- 真横からのアングルは正面からのショットよりも困難です
- 口元に大きな障害物があると品質が低下します
- 映像の揺れは顔認識の信頼性を低下させます
- ノイズの多い音声や重なった音声は、最終結果の自然さを損なう可能性があります

