Come funziona la sincronizzazione labiale
La sincronizzazione labiale prende un video sorgente e una nuova traccia audio, quindi aggiorna i movimenti della bocca dell’oratore in modo che corrispondano meglio al parlato tradotto.Cosa cambia e cosa rimane uguale
VoiceCheap si concentra sulla regione del viso che parla. In pratica:- il movimento della bocca e della parte inferiore del viso vengono aggiornati
- l’audio di destinazione guida il nuovo movimento della bocca
- il resto del fotogramma rimane il più intatto possibile
La pipeline di alto livello
1
Rileva il viso
VoiceCheap identifica il viso che parla e traccia i punti di riferimento facciali rilevanti attorno alla bocca e alla parte inferiore del viso.
2
Analizza l'audio tradotto
Il sistema ascolta l’audio di destinazione e calcola le forme della bocca necessarie per corrispondere al parlato.
3
Genera un nuovo movimento labiale
La regione del parlato viene rigenerata fotogramma per fotogramma per corrispondere più fedelmente all’audio tradotto.
4
Unisci il risultato al video
La regione della bocca generata viene ricomposta nel fotogramma originale in modo che il risultato rimanga visivamente coerente.
Dove si inserisce la sincronizzazione labiale nel flusso di lavoro
La sincronizzazione labiale non è il primo passaggio di qualità. L’ordine abituale è:- correggere la trascrizione
- scegliere la strategia vocale
- assicurarsi che l’audio del doppiaggio suoni naturale
- aggiungere la sincronizzazione labiale se il progetto ne trae beneficio
Limitazioni da aspettarsi
- le inquadrature di profilo sono più difficili rispetto alle riprese frontali
- forti ostruzioni attorno alla bocca riducono la qualità
- i filmati mossi riducono l’affidabilità del tracciamento facciale
- un audio rumoroso o sovrapposto può ridurre la naturalezza del risultato finale

