립싱크 작동 방식
립싱크는 소스 영상과 새로운 오디오 트랙을 가져와 번역된 음성에 더 잘 맞도록 화자의 입 모양을 업데이트합니다.변경되는 것과 유지되는 것
VoiceCheap는 말하는 얼굴 영역에 집중합니다. 실제로는 다음과 같습니다:- 입과 하관의 움직임이 업데이트됩니다
- 대상 오디오가 새로운 입 모양 움직임을 유도합니다
- 프레임의 나머지 부분은 가능한 한 그대로 유지됩니다
상위 수준 파이프라인
1
얼굴 감지
VoiceCheap는 말하는 얼굴을 식별하고 입과 하관 주변의 관련 얼굴 랜드마크를 추적합니다.
2
번역된 오디오 분석
시스템은 대상 오디오를 듣고 음성에 맞추는 데 필요한 입 모양을 계산합니다.
3
새로운 립싱크 움직임 생성
말하는 영역을 프레임별로 다시 생성하여 번역된 오디오와 더 밀접하게 일치시킵니다.
4
결과를 비디오에 다시 합성
생성된 입 영역을 원래 프레임에 다시 합성하여 결과물이 시각적으로 일관성을 유지하도록 합니다.
워크플로우에서 립싱크가 차지하는 위치
립싱크는 품질 향상을 위한 첫 번째 단계가 아닙니다. 일반적인 순서는 다음과 같습니다:- 정확한 대본 확보
- 음성 전략 선택
- 더빙된 오디오가 자연스럽게 들리는지 확인
- 프로젝트에 도움이 되는 경우 립싱크 추가
예상되는 제한 사항
- 측면 프로필 뷰는 정면 샷보다 어렵습니다
- 입 주변의 심한 장애물은 품질을 저하시킵니다
- 흔들리는 영상은 얼굴 추적의 신뢰성을 떨어뜨립니다
- 잡음이 많거나 겹치는 오디오는 최종 결과물의 자연스러움을 감소시킬 수 있습니다

