Wie wähle ich bei einem Text-to-Speech-Modell eine Stimme aus?
Wähle im Workspace das TTS-Modell und öffne im Parameter-Panel das Dropdown Stimme – ElevenLabs v3 bietet 21 benannte Stimmen mit Geschlecht und Akzent, Standard ist Bella (weiblich, amerikanisch); tippe den Text in die Prompt-Box und drücke Generieren.
Wohin der Text kommt
Text-to-Speech-Modelle haben keinen Bild-Prompt: Die Prompt-Box ist das Skript. Schreibe genau das, was gesprochen werden soll; LUVI sendet es als Texteingabe des Modells. Seitenverhältnis und negativer Prompt sind ausgeblendet, weil sie hier nicht gelten.
Die Stimme wählen
Unter dem Prompt zeigt das Parameter-Panel ein Dropdown Stimme. Bei ElevenLabs v3 listet es 21 Stimmen mit Namen, Geschlechtssymbol und Akzent, zum Beispiel Roger (männlich, amerikanisch), Sarah (weiblich, amerikanisch), Charlie (männlich, australisch); Standard ist Bella (weiblich, amerikanisch). Hinter jedem Namen sendet LUVI die Voice-ID des Anbieters, du hörst also exakt die Stimme des Herstellers mit diesem Namen.
Gemini TTS und MiniMax Speech zeigen an derselben Stelle ihre eigenen Stimmlisten; Grok Speech hat eine kleinere Auswahl.
Preis
Sprache wird nach der Länge des Textes abgerechnet:
| Modell | Startpreis |
|---|---|
| ElevenLabs v3 | 200 Credits pro 1.000 Zeichen |
| Gemini 2.5 Flash TTS | 80 |
| Gemini 2.5 Pro TTS | 160 |
| Gemini 3.1 Flash TTS | 300 |
| MiniMax Speech | 96 |
| Grok Speech (xAI TTS) | 30 |
Die Abrechnung ist linear, ohne Rundung auf Blöcke, und der Text wird nach dem Abschneiden von Leerzeichen gemessen. Die Schätzung unter dem Button Generieren folgt deinem Skript, während du tippst.
Nach dem Generieren
Das Ergebnis ist eine Audiodatei in deinem Projekt, mit Player. Nutze sie als Audio-Referenz für ein Lippensynchronisations-Modell, lade sie herunter oder schicke sie einem Teammitglied. Über den Claude-Connector wird das Audio direkt im Chat abgespielt.
Häufige Fragen
Was kostet Sprache?
ElevenLabs v3 startet bei 200 Credits pro 1.000 Zeichen und rechnet linear ab, 250 Zeichen kosten also ein Viertel davon. Gemini 2.5 Flash TTS startet bei 80, Grok Speech bei 30.
Kann ich meine eigene Stimme klonen?
Auf LUVI derzeit nicht. Wähle aus den Stimmen, die jedes Modell mitbringt.
Welche Sprachen funktionieren?
ElevenLabs v3 und Gemini TTS sprechen viele Sprachen direkt aus dem Text heraus; schreibe den Text in der Sprache, die gesprochen werden soll.