Cómo usar Veo 3.1: prompts que funcionan, videos con sonido y qué pasa con el español

Para usar Veo 3.1, arma el prompt empezando por la cámara: plano, sujeto, acción, contexto y estilo, con diálogos y efectos dentro de la escena. En LUVI activa la Generación de audio, que viene apagada; Veo 3.1 Lite no tiene sonido. Un clip de 8 segundos a 720p cuesta desde 800 créditos.

Publicado:

El iris de una lente de cine en primer plano encuadra una silueta que habla, con ondas de sonido cálidas expandiéndose y un interruptor ámbar encendido.

Con Veo 3.1, el modelo de video de Google DeepMind, puedes sacar imagen y sonido de una sola generación: diálogos, efectos, ambiente y música. Que el resultado salga como lo imaginaste depende de dos cosas: en qué orden escribes el prompt (la instrucción que le das al modelo) y si en LUVI prendiste el audio antes de generar. La familia Veo en LUVI reúne siete modelos, y el más económico, Veo 3.1 Lite, cuesta desde 800 créditos por un clip de 8 segundos a 720p (precios al 16 de septiembre de 2026). Todo lo que sigue sale de la guía de prompts para Veo que usamos dentro de LUVI y de la documentación de Google.

¿Cómo se arma un prompt para Veo 3.1?

Un prompt para Veo 3.1 arranca por la cámara y después describe, en este orden, al sujeto, la acción, el contexto y el estilo con su ambiente. Es la fórmula de cinco partes que Google publica en su guía de prompts para Veo 3.1 (en inglés). Nuestra guía para Veo sigue ese mismo orden con un agregado: quién aparece y qué hace tiene que quedar en la primera frase, porque esa frase marca qué tan fielmente Veo respeta todo lo demás.

  1. Cámara. Nombra el movimiento y el encuadre con los términos clásicos: dolly shot, tracking shot, crane shot, slow pan, close-up, low angle. Pide un solo movimiento por tramo; dos movimientos juntos se estorban.
  2. Sujeto. Dale detalles que se vean: edad, ropa, desgaste.
  3. Acción. Elige una sola acción que se desarrolle a lo largo del clip y cuéntala como movimiento, no como pose. El peso y el contacto ayudan; con verbos vagos la escena se va para otro lado.
  4. Contexto. Di dónde pasa y de dónde viene la luz, con su dirección y su color.
  5. Estilo y ambiente. Quédate con un solo look dominante, como un tipo de película o una época, y deja las palabras de ánimo para el final.

Así queda un prompt de un solo tramo para Veo 3.1 Fast Text-to-Video, con la Generación de audio activada:

Slow dolly shot, medium close-up: an elderly clockmaker in a worn leather apron lifts a brass gear toward the lamp and turns it between two fingers, squinting at its teeth. A cramped workshop at night, walls lined with ticking clocks, one warm desk lamp from the left and the rest in shadow. He says quietly, "There you are." SFX: a soft metallic click as the gear seats. Ambient noise: dozens of clocks ticking out of step. Shot on 35mm film, warm tungsten grade, calm and intimate.

Primero va la cámara, luego el relojero con el engranaje en la mano, y la frase llega recién cuando la acción ya la justifica.

¿Por qué mi video de Veo 3.1 sale sin sonido?

En LUVI, un video de Veo 3.1 sale mudo si no activas la Generación de audio antes de generar. Ese interruptor viene apagado en todos los modelos Veo que lo tienen, porque el sonido cambia el precio, y escribir un diálogo en el prompt no lo prende. Para un clip de 8 segundos a 720p:

  • Veo 3.1 Fast (texto a video e imagen a video): 1,280 créditos sin audio y 1,536 con audio.
  • Veo 3.1 (imagen a video y referencia a video): 3,200 créditos sin audio y 6,400 con audio.
  • Veo 3.1 Lite no tiene interruptor de audio. Sus clips salen siempre en silencio, sin importar lo que diga el prompt.

Hay una segunda regla que suele tomar a la gente por sorpresa. Si a Veo 3.1 o Veo 3.1 Fast les das un fotograma final además del inicial, LUVI apaga el audio en esa generación, porque estos modelos no pueden crear sonido cuando reciben un fotograma final. ¿Te importa más la banda sonora que el cuadro exacto con el que termina el clip? Entonces no subas el fotograma final.

¿Veo 3.1 funciona en español?

Para el prompt, no conviene: la ficha de Veo 3.1 en Google Cloud indica el inglés como único idioma de las instrucciones, tanto para Veo 3.1 como para Veo 3.1 Fast. Por eso los ejemplos de esta guía están en inglés, y lo más seguro es escribir en inglés la cámara, la escena y los sonidos. No generamos videos para esta guía, así que tampoco probamos diálogos en español y no afirmamos nada sobre cómo suenan.

¿Cómo se escriben diálogos y efectos de sonido en Veo 3.1?

Veo 3.1 entiende el sonido como parte de la descripción del plano y lo reparte en tres tipos, cada uno con su etiqueta. Según la guía de Google, la frase hablada va entre comillas después de nombrar a quien la dice, los efectos van después de SFX: y el fondo sonoro después de Ambient noise:. La música se describe con palabras, por ejemplo un piano suave que va creciendo por debajo de la escena.

  • Frases cortas. En un clip de 8 segundos entran una o dos oraciones. Describe primero la acción y después la frase que esa acción provoca.
  • Un personaje distinto por frase. Veo 3.1 sincroniza los labios del personaje al que le atribuyes la línea.
  • ¿Comillas o dos puntos? En esto los documentos de Google no coinciden. El blog de Google Cloud pone la frase entre comillas, y la guía de instrucciones para la generación de videos de Vertex AI la escribe después de dos puntos: The seasoned detective says: Your story has holes. Nuestra guía para Veo usa comillas.
  • El silencio también se dirige. En lugar de prohibir el sonido en una escena tranquila, di qué se tiene que oír: "no music, only the wind".

Nada de esto se escucha si la Generación de audio está apagada.

¿Cómo evito que algo aparezca en el plano?

Veo 3.1 no tiene campo de prompt negativo en LUVI, así que lo que no quieres ver se resuelve describiendo lo que sí hay. El ejemplo de Google es pedir "a desolate landscape with no buildings or roads" en vez de "no man-made structures". La guía de Vertex AI, en su apartado sobre instrucciones negativas, pide evitar fórmulas como "no paredes" o "no mostrar paredes". Si quieres una playa sin gente, describe la playa vacía.

¿Cómo meto más de una acción en 8 segundos?

Divide el clip en tramos con marca de tiempo, cada uno con un plano y un sonido. En LUVI los clips de Veo 3.1 duran 4, 6 u 8 segundos (referencia a video, solo 8), y cuando describes toda la escena de corrido el resultado tiende a verse borroso. Google le llama timestamp prompting y escribe cada tramo entre corchetes, así: [00:00-00:02].

[00:00-00:04] Wide shot, slow pan across an empty beach at dawn, smooth wet sand with no footprints, low pink light from the horizon. Ambient noise: small waves folding onto the shore. [00:04-00:08] Close-up as a dog's paw presses the first print into the sand. SFX: a soft wet thud, then distant gulls.

Fíjate en que la playa vacía no se consigue con una prohibición, sino describiendo la arena lisa y sin huellas.

¿Qué modelo de Veo 3.1 me conviene?

Depende de con qué material empiezas y de si necesitas sonido. Todos los modelos Veo 3.1 generan en 16:9 o 9:16, a 720p por defecto.

Google hoy recomienda Gemini Omni Flash como modelo de video predeterminado en la API de Gemini y deja Veo 3.1 para "la extensión de escenas, el control del último fotograma o la integración con canalizaciones heredadas". Si no necesitas nada de eso, compara con Gemini Omni 1.1 Flash en LUVI y con nuestra comparación de H3, Omni y Wan 3.0.

¿Cómo lo comprobamos?

  • Qué revisamos: los parámetros de los siete modelos Veo de LUVI y la guía de prompts para Veo de LUVI, el 16 de septiembre de 2026.
  • Precios: la estimación de LUVI para clips de 8 segundos a 720p, con y sin Generación de audio, el 16 de septiembre de 2026. Con más duración, 1080p o 4K, el precio sube.
  • Prompts de ejemplo: revisados contra la guía para Veo. No generamos videos para esta guía, así que no afirma nada sobre la calidad de los resultados.

Cómo hacerlo en LUVI

En el espacio de trabajo, elige un modelo Veo, decide si vas a usar la Generación de audio antes de escribir y arma el prompt en el orden de arriba. El botón de la pluma junto al prompt reescribe tu borrador al estilo de Veo sin costo, y la página qué es una guía de prompts explica de dónde salen estas reglas. Si trabajas desde Claude o ChatGPT, el conector de LUVI te devuelve los parámetros exactos de cada modelo Veo, interruptor de audio incluido. Para probarlo, crea tu cuenta en LUVI.

Fuentes

Más de Guías