Wie Lippensynchronisation funktioniert
Die Lippensynchronisation nimmt ein Quellvideo und eine neue Audiospur und aktualisiert dann die Mundbewegungen des Sprechers, damit sie besser zur übersetzten Sprache passen.Was sich ändert und was gleich bleibt
VoiceCheap konzentriert sich auf den Bereich des sprechenden Gesichts. In der Praxis:- Die Bewegung von Mund und unterem Gesicht wird aktualisiert
- Das Ziel-Audio steuert die neue Mundbewegung
- Der Rest des Bildes bleibt so intakt wie möglich
Die Pipeline auf hoher Ebene
1
Das Gesicht erkennen
VoiceCheap identifiziert das sprechende Gesicht und verfolgt die relevanten Gesichtspunkte um den Mund und das untere Gesicht.
2
Das übersetzte Audio analysieren
Das System hört sich das Ziel-Audio an und berechnet die Mundformen, die erforderlich sind, um der Sprache zu entsprechen.
3
Neue Lippenbewegung generieren
Der Sprechbereich wird Bild für Bild neu generiert, um ihn präziser an die synchronisierte Audiospur anzupassen.
4
Das Ergebnis wieder in das Video einfügen
Der generierte Mundbereich wird wieder in das Originalbild eingefügt, damit das Ergebnis visuell stimmig bleibt.
Wo sich die Lippensynchronisation in den Arbeitsablauf einfügt
Die Lippensynchronisation ist nicht der erste Qualitätsschritt. Die übliche Reihenfolge ist:- das Transkript korrigieren
- die Stimmstrategie wählen
- sicherstellen, dass das synchronisierte Audio natürlich klingt
- Lippensynchronisation hinzufügen, wenn das Projekt davon profitiert
Zu erwartende Einschränkungen
- starke Profilansichten sind schwieriger als Frontalaufnahmen
- starke Hindernisse um den Mund verringern die Qualität
- wackliges Filmmaterial verringert die Zuverlässigkeit der Gesichtsverfolgung
- verrauschtes oder überlappendes Audio kann die Natürlichkeit des Endergebnisses verringern

