¿Cómo elijo una voz en un modelo de texto a voz?
Selecciona el modelo TTS en el espacio de trabajo y abre el desplegable Voz en el panel de parámetros: ElevenLabs v3 ofrece 21 voces con nombre, género y acento, y la predeterminada es Bella (female, American); escribe el texto en la caja del prompt y presiona Generar.
Dónde va el texto
Los modelos de texto a voz no tienen prompt de imagen: la caja del prompt es el guion. Escribe exactamente lo que debe decirse; LUVI lo envía como entrada de texto del modelo. La relación de aspecto y el prompt negativo están ocultos porque no aplican.
Elegir la voz
Bajo el prompt, el panel de parámetros muestra un desplegable Voz. En ElevenLabs v3 lista 21 voces por nombre, con icono de género y acento, por ejemplo Roger (male, American), Sarah (female, American), Charlie (male, Australian); la predeterminada es Bella (female, American). Detrás de cada nombre LUVI envía el id de voz del propio proveedor, así que lo que oyes es exactamente la voz del proveedor con ese nombre.
Gemini TTS y MiniMax Speech exponen sus propias listas de voces en el mismo sitio; Grok Speech tiene un conjunto más pequeño.
Precio
La voz se factura por la longitud del texto:
| Modelo | Precio de partida |
|---|---|
| ElevenLabs v3 | 200 créditos por 1,000 caracteres |
| Gemini 2.5 Flash TTS | 80 |
| Gemini 2.5 Pro TTS | 160 |
| Gemini 3.1 Flash TTS | 300 |
| MiniMax Speech | 96 |
| Grok Speech (xAI TTS) | 30 |
La facturación es lineal, sin redondeo a bloques, y el texto se mide después de recortar los espacios. La estimación bajo el botón Generar sigue tu guion mientras escribes.
Después de generar
El resultado es un archivo de audio en tu proyecto, con reproductor. Úsalo como referencia de audio para un modelo de lip-sync, descárgalo o envíaselo a un compañero de equipo. A través del conector de Claude, el audio se reproduce en línea dentro del chat.
Preguntas frecuentes
¿Cuánto cuesta la voz?
ElevenLabs v3 parte de 200 créditos por 1,000 caracteres y factura de forma lineal, así que 250 caracteres cuestan una cuarta parte. Gemini 2.5 Flash TTS parte de 80 y Grok Speech de 30.
¿Puedo clonar mi propia voz?
Hoy no en LUVI. Elige entre las voces que trae cada modelo.
¿Qué idiomas funcionan?
ElevenLabs v3 y Gemini TTS hablan muchos idiomas a partir del propio texto; escribe el texto en el idioma en que quieres que se hable.