Skip to main content

Text-zu-Sprache

Verwenden Sie Text-zu-Sprache, wenn Sie gesprochenes Audio aus Text wünschen, ohne den vollständigen Video-Synchronisations-Workflow zu durchlaufen. VoiceCheap generiert das Audio mit Fish Audio S2.1 Pro über das Vercel AI Gateway. Dieses Tool verfügt über ein festes Produktionsmodell und verwendet kein Fallback-Modell.

Öffentliche Vorschau und Arbeitsbereich-Tool

Die öffentliche Landingpage ermöglicht es Besuchern, die mehrsprachige Stimmenbibliothek zu durchsuchen und anzuhören. Das Generieren von Audio, das Herunterladen von MP3-Dateien, das Anzeigen des Verlaufs und das Speichern einer geklonten Stimme erfordern ein VoiceCheap-Konto. Das authentifizierte Tool unterstützt:
  • 41 kuratierte mehrsprachige Stimmen mit verschiedenen Akzenten
  • durchsuchbare Stimmennamen, Akzente und Sprechstile
  • sieben Liefer-Presets: Standard, fröhlich, ruhig, Erzähler, dramatisch, Flüstern und energisch
  • wiederverwendbare Stimmklone in kostenpflichtigen Tarifen
  • eine durchsuchbare Stimmenauswahl mit integrierter Vorschau-Wiedergabe
  • einen transkriptbasierten Audio-Player, der auf dem Interaktionsmuster der ElevenLabs-Benutzeroberfläche basiert
  • wiedergabesynchronisierte Hervorhebung basierend auf Zeitstempeln, die aus dem generierten Audio gemessen wurden
  • Generierungsverlauf und MP3-Downloads
Liefer-Presets werden in S2.1 Pro natürlichsprachliche Aktions-Tags übersetzt. Zum Beispiel sendet „Flüstern“ vor jedem generierten Textabschnitt eine explizite Anweisung in eckigen Klammern, damit das Modell die gewünschte Darstellungsweise anwendet. Das abspielbare Ergebnis erscheint, sobald die Generierung abgeschlossen ist. VoiceCheap analysiert dann die gespeicherte MP3-Datei im Hintergrund, um echte Start- und Endzeitstempel für die gesprochenen Wörter zu erhalten. Diese Zeitstempel werden mit dem Verlaufselement zwischengespeichert, sodass gleichzeitige Anfragen eine Analyse teilen und das erneute Abspielen eines vorhandenen Ergebnisses nicht wiederholt dasselbe Audio verarbeitet. Wenn die Synchronisation vorübergehend nicht verfügbar ist oder die gesprochene Sprache nicht zuverlässig ausgerichtet werden kann, funktionieren Wiedergabe und Download weiterhin und das Transkript bleibt statisch, anstatt eine geschätzte Hervorhebung anzuzeigen.

Gespeichertes Stimmklonen

Stimmklonen verwendet die anbieterspezifische Modell-API von Fish Audio, da die Sprachgenerierung des AI Gateways keine Modellerstellung offenlegt. Stimmproben müssen 10–120 Sekunden klare Sprache von einem Sprecher enthalten. Benutzer müssen bestätigen, dass sie die Erlaubnis haben, die Stimme zu klonen. Wenn die ausgewählten Proben insgesamt 120 Sekunden überschreiten, können Benutzer sich für das automatische Zuschneiden entscheiden. VoiceCheap kürzt jede ausgewählte Datei nach Bedarf, sodass alle Proben beitragen, während die eingereichte Gesamtsumme innerhalb des 120-Sekunden-Limits bleibt. Das Klon-Menü bleibt gesperrt geöffnet, während eine Stimme erstellt wird. Die Erstellen-Schaltfläche behält einen sichtbaren Spinner bei und Formularsteuerelemente bleiben deaktiviert, bis die Anfrage erfolgreich ist oder fehlschlägt. AI Gateway-Sprache ist derzeit auf $0 pro Million UTF-8-Bytes konfiguriert, während die Fish Audio-Aktion aktiv ist. Setzen Sie FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES auf die Live-Rate nach der Aktion, wenn die Gateway-Abrechnung wieder aufgenommen wird; der öffentliche Standardtarif beträgt derzeit 15 $ pro Million UTF-8-Bytes. Limits für gespeicherte Stimmen sind von den Limits für benutzerdefinierte Stimmen bei der Synchronisation getrennt:
  • Kostenlos: 0 gespeicherte Stimmen
  • Tester, Beginner und Starter: 3 gespeicherte Stimmen
  • Creator und Worldwide: 5 gespeicherte Stimmen
  • Scale, Pro, Entrepreneur und Enterprise: 10 gespeicherte Stimmen

Gute Anwendungsfälle

  • Voiceovers
  • gesprochene Schnipsel
  • Ausspracheprüfungen
  • grobe Erzähltests

Wann stattdessen ein vollständiges Projekt verwendet werden sollte

Verwenden Sie ein vollständiges Synchronisationsprojekt, wenn das Audio verbunden bleiben soll mit:
  • einem vorhandenen Transkript
  • einem übersetzten Video
  • Untertiteln
  • Lippensynchronisation
  • Smart Publish

Verwandte Seiten