Comment choisir une voix sur un modèle de synthèse vocale ?
Sélectionnez le modèle TTS dans l'espace de travail et ouvrez la liste Voix du panneau de paramètres : ElevenLabs v3 propose 21 voix nommées avec genre et accent, Bella (femme, américaine) par défaut ; tapez le texte dans la zone de prompt et appuyez sur Générer.
Où va le texte
Les modèles de synthèse vocale n'ont pas de prompt d'image : la zone de prompt est le script. Écrivez exactement ce qui doit être dit ; LUVI l'envoie comme entrée texte du modèle. Le format d'image et le prompt négatif sont masqués parce qu'ils ne s'appliquent pas.
Choisir la voix
Sous le prompt, le panneau de paramètres affiche une liste Voix. Sur ElevenLabs v3, elle propose 21 voix par nom, avec une icône de genre et l'accent, par exemple Roger (homme, américain), Sarah (femme, américaine), Charlie (homme, australien) ; la voix par défaut est Bella (femme, américaine). Derrière chaque nom, LUVI envoie l'identifiant de voix du fournisseur, si bien que vous entendez exactement la voix de ce nom chez l'éditeur.
Gemini TTS et MiniMax Speech exposent leurs propres listes de voix au même endroit ; Grok Speech a un jeu plus réduit.
Prix
La voix est facturée sur la longueur du texte :
| Modèle | Prix de départ |
|---|---|
| ElevenLabs v3 | 200 crédits pour 1 000 caractères |
| Gemini 2.5 Flash TTS | 80 |
| Gemini 2.5 Pro TTS | 160 |
| Gemini 3.1 Flash TTS | 300 |
| MiniMax Speech | 96 |
| Grok Speech (xAI TTS) | 30 |
La facturation est linéaire, sans arrondi par blocs, et le texte est mesuré après suppression des espaces superflus. L'estimation sous le bouton Générer suit votre script au fil de la saisie.
Après la génération
Le résultat est un fichier audio dans votre projet, avec un lecteur. Utilisez-le comme référence audio pour un modèle de synchronisation labiale, téléchargez-le ou envoyez-le à un coéquipier. Via le connecteur Claude, l'audio se lit directement dans la conversation.
Questions fréquentes
Combien coûte la synthèse vocale ?
ElevenLabs v3 démarre à 200 crédits pour 1 000 caractères et facture de façon linéaire : 250 caractères coûtent donc le quart. Gemini 2.5 Flash TTS démarre à 80, Grok Speech à 30.
Puis-je cloner ma propre voix ?
Pas sur LUVI aujourd'hui. Choisissez parmi les voix livrées avec chaque modèle.
Quelles langues fonctionnent ?
ElevenLabs v3 et Gemini TTS parlent de nombreuses langues à partir du texte lui-même ; écrivez le texte dans la langue que vous voulez entendre.