Skip to main content

Zamiana tekstu na mowę

Użyj zamiany tekstu na mowę, gdy chcesz uzyskać dźwięk z tekstu bez przechodzenia przez pełny proces dubbing wideo. VoiceCheap generuje dźwięk za pomocą Fish Audio S2.1 Pro przez Vercel AI Gateway. To narzędzie ma jeden stały model produkcyjny i nie używa modelu zapasowego.

Publiczna wersja zapoznawcza i narzędzie obszaru roboczego

Publiczna strona docelowa pozwala odwiedzającym wyszukiwać i słuchać wielojęzycznej biblioteka głosów. Generowanie dźwięku, pobieranie plików MP3, przeglądanie historii i zapisywanie klonowanie głosu wymagają konta VoiceCheap. Uwierzytelnione narzędzie obsługuje:
  • 41 wyselekcjonowanych wielojęzycznych głosów z różnymi akcentami
  • wyszukiwalne nazwy głosów, akcenty i style mówienia
  • siedem ustawień dostarczania: domyślne, radosne, spokojne, narrator, dramatyczne, szept i energiczne
  • klonowanie głosu wielokrotnego użytku w płatnych planach
  • wyszukiwalny wybór głosów ze zintegrowanym odtwarzaniem podglądu
  • odtwarzacz audio z priorytetem transkrypcji oparty na wzorcu interakcji ElevenLabs UI
  • podświetlanie zsynchronizowane z odtwarzaniem, oparte na znacznikach czasu mierzonych z wygenerowanego dźwięku
  • historia generowania i pobieranie plików MP3
Ustawienia dostarczania są tłumaczone na tagi akcji w języku naturalnym S2.1 Pro. Na przykład, Szept wysyła wyraźną instrukcję w nawiasach kwadratowych przed każdym wygenerowanym fragmentem tekstu, aby model zastosował żądany sposób dostarczenia. Odtwarzalny wynik pojawia się, gdy tylko generowanie się zakończy. VoiceCheap następnie analizuje zapisany plik MP3 w tle, aby uzyskać rzeczywiste znaczniki czasu rozpoczęcia i zakończenia dla wypowiedzianych słów. Te znaczniki czasu są buforowane wraz z elementem historii, więc jednoczesne żądania współdzielą jedną analizę, a ponowne odtwarzanie istniejącego wyniku nie przetwarza wielokrotnie tego samego dźwięku. Jeśli synchronizacja jest tymczasowo niedostępna lub języka mówionego nie można niezawodnie dopasować, odtwarzanie i pobieranie nadal działają, a transkrypcja pozostaje statyczna zamiast wyświetlać szacowane podświetlenie.

Zapisane klonowanie głosu

Klonowanie głosu wykorzystuje specyficzny dla dostawcy model API Fish Audio, ponieważ generowanie mowy przez AI Gateway nie udostępnia tworzenia modeli. Próbki głosu muszą zawierać 10–120 sekund wyraźnej mowy jednego mówcy. Użytkownicy muszą potwierdzić, że mają uprawnienia do klonowania głosu. Gdy wybrane próbki przekraczają łącznie 120 sekund, użytkownicy mogą zdecydować się na automatyczne przycinanie. VoiceCheap skraca każdy wybrany plik w razie potrzeby, aby wszystkie próbki przyczyniały się do wyniku, podczas gdy przesłana suma mieści się w limicie 120 sekund. Panel klonowania pozostaje zablokowany w pozycji otwartej podczas tworzenia głosu. Przycisk tworzenia zachowuje widoczny wskaźnik ładowania, a kontrolki formularza pozostają wyłączone, dopóki żądanie nie powiedzie się lub nie zakończy sukcesem. Mowa AI Gateway jest obecnie skonfigurowana na $0 za milion bajtów UTF-8, podczas gdy promocja Fish Audio jest aktywna. Ustaw FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES na stawkę obowiązującą po promocji, gdy rozliczenia Gateway zostaną wznowione; publiczna stawka standardowa wynosi obecnie 15 USD za milion bajtów UTF-8. Limity zapisanych głosów są oddzielone od limitów niestandardowe głosy w dubbing:
  • Darmowy: 0 zapisanych głosów
  • Tester, Beginner i Starter: 3 zapisane głosy
  • Creator i Worldwide: 5 zapisanych głosów
  • Scale, Pro, Entrepreneur i Enterprise: 10 zapisanych głosów

Dobre przypadki użycia

  • lektorzy
  • mówione fragmenty
  • sprawdzanie wymowy
  • wstępne testy narracji

Kiedy zamiast tego użyć pełnego projektu

Użyj pełnego projektu dubbing, gdy dźwięk powinien pozostać powiązany z:
  • istniejącą transkrypcją
  • przetłumaczonym wideo
  • napisy
  • synchronizacja ruchu ust
  • Smart Publish

Powiązane strony