MiniMax H3, Gemini Omni 1.1 o Wan 3.0: tres modelos de video con sonido y tres formas de escribirles el prompt

Los tres generan imagen y sonido en una sola pasada, y los tres leen el prompt de forma distinta: H3 quiere un documento por campos, Omni un pie de foto con cláusula de continuidad y Wan una fórmula aditiva. Precios, límites y la regla que rompe a cada uno.

Publicado:

Tres ondas de sonido brillantes sobre fondo negro: una cuadrícula de celdas índigo, un trazo de tinta turquesa y seda ámbar, que convergen en un punto luminoso a la derecha.

En septiembre llegaron a LUVI tres modelos de video con una semana de diferencia, y los tres comparten titular: el sonido se genera junto con la imagen, diálogos incluidos. Lo que no comparten es el lenguaje del prompt (la instrucción que le das al modelo). Escribimos una guía de prompts para cada uno a partir de la documentación de sus fabricantes; esta comparación es lo que salió de ese trabajo.

Los números

  • Precio base en LUVI. H3 desde 2,080 créditos por 8 s (H3 Max, 1,216). Omni 1.1 Flash desde 2,200 créditos por 10 s. Wan 3.0 desde 2,000 créditos por 5 s (Prime, 2,800).
  • Resoluciones nativas. H3: 480P, 768P y 2K. Omni: 360p y 720p; 1080p y 4K son el escalador de Google. Wan: 480p, 720p y 1080p.
  • Duración del clip. H3: de 4 a 15 s. Omni: de 3 a 10 s, ampliable hasta 40 s. Wan: hasta 30 s.
  • Modos en LUVI. H3: texto, imagen y referencia. Omni: texto, imagen, referencia, edición y extensión. Wan: texto, imagen y referencia.
  • Idiomas del diálogo. H3: 11 (el turco no está entre ellos). Omni: evaluado en inglés; otros pueden funcionar. Wan: chino e inglés.
  • Medios de referencia. H3: hasta 9 imágenes, 3 clips y 3 audios, 12 archivos en total. Omni: imágenes y hasta 3 clips cortos, sin audio. Wan: hasta 10 imágenes, 5 clips y 5 audios, 20 archivos.

MiniMax H3: ¿por qué el prompt es un documento?

Porque H3 no quiere un pie de foto: quiere tres campos con nombre —integrated_multimodal_description, overall_soundscape y non_diegetic_music— y los quiere los tres siempre. Si omites un campo de audio, el modelo no se queda en silencio: inventa. La cámara es prosa construida con doce verbos exactos y cuatro modificadores (“The camera pushes in with small amplitude at slow speed toward…”), los cortes llevan marca de tiempo al milisegundo (“[Shot 2] At 00:03.500, the camera cuts to…”) y el diálogo va dentro de una etiqueta con su idioma: <d>[English] I get off at the next station.</d>. Un nombre propio —una celebridad, una película, una marca— bloquea la petición entera. Las órdenes de cámara entre corchetes de la antigua línea Hailuo son sintaxis muerta aquí.

Donde brilla: secuencias de varios planos con diálogo guionizado, y paquetes de referencia que fijan una cara y una voz a la vez.

Gemini Omni 1.1: ¿por qué hay que pedirle un plano único?

Porque Omni corta por defecto. Su temperamento es el contrario al de H3: el prompt ideal es un pie de foto de unas 45 palabras en prosa llana, y el modelo rellena el mundo. La trampa es que, si pides un plano junto a un lago, puedes recibir un montaje de tres planos. Todo prompt de toma única necesita una cláusula de continuidad en la primera frase (“In a single unbroken scene…”). El sonido va en su propia frase detrás de “Sound design:”, la música hay que pedirla y el diálogo se escribe con dos puntos y sin comillas: las comillas queman las palabras en el fotograma como texto en pantalla. No hay campo negativo; las exclusiones son fragmentos al final (“No dialogue. No text overlay on screen.”). Las ediciones son una sola cláusula más “Keep everything else the same”.

Donde brilla: clips rápidos, baratos y de aspecto natural; ediciones conversacionales; ampliar un clip que ya tienes.

Wan 3.0: ¿qué es la fórmula aditiva?

Alibaba publica el prompt como una fórmula, y el modelo lo lee en ese orden: entidad + escena + movimiento; después control estético + estilización; después sonido (voz = frases + emoción + tono + velocidad + timbre + acento; efecto = fuente + acción + ambiente; música = partitura + estilo); y, por último, los planos múltiples como “Shot 1 [0–3 s] … Shot 2 [4–6 s] Hard cut transition, fixed camera…”. Los medios subidos se nombran y se usan como sustantivo: “The cat in Image 1 plays in the room in Image 2”. Su propia lista de prohibiciones es corta y merece memorizarse: nada de personas reales por su nombre, nada de cambios rápidos de escena dentro de un clip y ningún plano que dependa de un texto exacto o de una sincronía labial palabra por palabra.

Donde brilla: clips largos (30 s), paquetes de referencia mixtos con audio y diálogo en chino.

La regla que rompe a cada uno

  • H3: omite un campo de audio. Obtienes sonido inventado, no silencio.
  • Omni: olvida la cláusula de continuidad. Obtienes cortes.
  • Wan: nombra a una persona real. La petición falla.

¿Cuál elijo?

Una escena de diálogo con un reparto fijo: H3. Un borrador rápido o una edición de algo que ya existe: Omni. Un clip largo o un paquete de referencia que incluya una voz: Wan 3.0. Las tres guías están en las páginas de los modelos —MiniMax H3, Gemini Omni y Wan— y el espacio de trabajo las aplica cuando el interruptor de la guía está activado. Para saber cómo se construyen los precios en créditos de arriba, consulta cómo funcionan los créditos.

Preguntas

¿Cuál es el más barato?

Para un clip corto en la resolución base: Wan 3.0 desde 2,000 créditos (5 s), MiniMax H3 desde 2,080 créditos (8 s) y Gemini Omni 1.1 desde 2,200 créditos (10 s). Por segundo, Omni es el más barato de los tres en su configuración por defecto.

¿Cuál mantiene a un personaje entre planos?

Los tres aceptan medios de referencia. Wan 3.0 admite hasta 20 archivos, audio incluido; H3 hasta 12 entre imágenes, clips y voces; Omni acepta imágenes y clips cortos, pero no audio.

¿Cuál se puede editar después?

Omni 1.1 tiene un modo de edición de video en LUVI y Wan 3.0 también (en la línea 2.7); H3 no: hay que volver a generar.