Wie wähle ich bei einem Text-to-Speech-Modell eine Stimme aus?

Wähle im Workspace das TTS-Modell und öffne im Parameter-Panel das Dropdown Stimme – ElevenLabs v3 bietet 21 benannte Stimmen mit Geschlecht und Akzent, Standard ist Bella (weiblich, amerikanisch); tippe den Text in die Prompt-Box und drücke Generieren.

Zuletzt aktualisiert:

Wohin der Text kommt

Text-to-Speech-Modelle haben keinen Bild-Prompt: Die Prompt-Box ist das Skript. Schreibe genau das, was gesprochen werden soll; LUVI sendet es als Texteingabe des Modells. Seitenverhältnis und negativer Prompt sind ausgeblendet, weil sie hier nicht gelten.

Die Stimme wählen

Unter dem Prompt zeigt das Parameter-Panel ein Dropdown Stimme. Bei ElevenLabs v3 listet es 21 Stimmen mit Namen, Geschlechtssymbol und Akzent, zum Beispiel Roger (männlich, amerikanisch), Sarah (weiblich, amerikanisch), Charlie (männlich, australisch); Standard ist Bella (weiblich, amerikanisch). Hinter jedem Namen sendet LUVI die Voice-ID des Anbieters, du hörst also exakt die Stimme des Herstellers mit diesem Namen.

Gemini TTS und MiniMax Speech zeigen an derselben Stelle ihre eigenen Stimmlisten; Grok Speech hat eine kleinere Auswahl.

Preis

Sprache wird nach der Länge des Textes abgerechnet:

ModellStartpreis
ElevenLabs v3200 Credits pro 1.000 Zeichen
Gemini 2.5 Flash TTS80
Gemini 2.5 Pro TTS160
Gemini 3.1 Flash TTS300
MiniMax Speech96
Grok Speech (xAI TTS)30

Die Abrechnung ist linear, ohne Rundung auf Blöcke, und der Text wird nach dem Abschneiden von Leerzeichen gemessen. Die Schätzung unter dem Button Generieren folgt deinem Skript, während du tippst.

Nach dem Generieren

Das Ergebnis ist eine Audiodatei in deinem Projekt, mit Player. Nutze sie als Audio-Referenz für ein Lippensynchronisations-Modell, lade sie herunter oder schicke sie einem Teammitglied. Über den Claude-Connector wird das Audio direkt im Chat abgespielt.

Häufige Fragen

Was kostet Sprache?

ElevenLabs v3 startet bei 200 Credits pro 1.000 Zeichen und rechnet linear ab, 250 Zeichen kosten also ein Viertel davon. Gemini 2.5 Flash TTS startet bei 80, Grok Speech bei 30.

Kann ich meine eigene Stimme klonen?

Auf LUVI derzeit nicht. Wähle aus den Stimmen, die jedes Modell mitbringt.

Welche Sprachen funktionieren?

ElevenLabs v3 und Gemini TTS sprechen viele Sprachen direkt aus dem Text heraus; schreibe den Text in der Sprache, die gesprochen werden soll.

Weitere Fragen