Text-zu-Sprache
Verwenden Sie Text-zu-Sprache, wenn Sie gesprochenes Audio aus Text wünschen, ohne den vollständigen Video-Synchronisations-Workflow zu durchlaufen. VoiceCheap generiert das Audio mit Fish Audio S2.1 Pro über das Vercel AI Gateway. Dieses Tool verfügt über ein festes Produktionsmodell und verwendet kein Fallback-Modell.Öffentliche Vorschau und Arbeitsbereich-Tool
Die öffentliche Landingpage ermöglicht es Besuchern, die mehrsprachige Stimmenbibliothek zu durchsuchen und anzuhören. Das Generieren von Audio, das Herunterladen von MP3-Dateien, das Anzeigen des Verlaufs und das Speichern einer geklonten Stimme erfordern ein VoiceCheap-Konto. Das authentifizierte Tool unterstützt:- 41 kuratierte mehrsprachige Stimmen mit verschiedenen Akzenten
- durchsuchbare Stimmennamen, Akzente und Sprechstile
- sieben Liefer-Presets: Standard, fröhlich, ruhig, Erzähler, dramatisch, Flüstern und energisch
- wiederverwendbare Stimmklone in kostenpflichtigen Tarifen
- eine durchsuchbare Stimmenauswahl mit integrierter Vorschau-Wiedergabe
- einen transkriptbasierten Audio-Player, der auf dem Interaktionsmuster der ElevenLabs-Benutzeroberfläche basiert
- wiedergabesynchronisierte Hervorhebung basierend auf Zeitstempeln, die aus dem generierten Audio gemessen wurden
- Generierungsverlauf und MP3-Downloads
Gespeichertes Stimmklonen
Stimmklonen verwendet die anbieterspezifische Modell-API von Fish Audio, da die Sprachgenerierung des AI Gateways keine Modellerstellung offenlegt. Stimmproben müssen 10–120 Sekunden klare Sprache von einem Sprecher enthalten. Benutzer müssen bestätigen, dass sie die Erlaubnis haben, die Stimme zu klonen. Wenn die ausgewählten Proben insgesamt 120 Sekunden überschreiten, können Benutzer sich für das automatische Zuschneiden entscheiden. VoiceCheap kürzt jede ausgewählte Datei nach Bedarf, sodass alle Proben beitragen, während die eingereichte Gesamtsumme innerhalb des 120-Sekunden-Limits bleibt. Das Klon-Menü bleibt gesperrt geöffnet, während eine Stimme erstellt wird. Die Erstellen-Schaltfläche behält einen sichtbaren Spinner bei und Formularsteuerelemente bleiben deaktiviert, bis die Anfrage erfolgreich ist oder fehlschlägt. AI Gateway-Sprache ist derzeit auf$0 pro Million UTF-8-Bytes konfiguriert, während die Fish Audio-Aktion aktiv ist. Setzen Sie FISH_AUDIO_TTS_PRICE_PER_MILLION_UTF8_BYTES auf die Live-Rate nach der Aktion, wenn die Gateway-Abrechnung wieder aufgenommen wird; der öffentliche Standardtarif beträgt derzeit 15 $ pro Million UTF-8-Bytes.
Limits für gespeicherte Stimmen sind von den Limits für benutzerdefinierte Stimmen bei der Synchronisation getrennt:
- Kostenlos: 0 gespeicherte Stimmen
- Tester, Beginner und Starter: 3 gespeicherte Stimmen
- Creator und Worldwide: 5 gespeicherte Stimmen
- Scale, Pro, Entrepreneur und Enterprise: 10 gespeicherte Stimmen
Gute Anwendungsfälle
- Voiceovers
- gesprochene Schnipsel
- Ausspracheprüfungen
- grobe Erzähltests
Wann stattdessen ein vollständiges Projekt verwendet werden sollte
Verwenden Sie ein vollständiges Synchronisationsprojekt, wenn das Audio verbunden bleiben soll mit:- einem vorhandenen Transkript
- einem übersetzten Video
- Untertiteln
- Lippensynchronisation
- Smart Publish

