Cómo escribir prompts para Seedance 2.5 (y por qué los hábitos de Seedance 2.0 lo estropean)

Seedance 2.5 lee marcas de tiempo en segundos enteros, canales de audio tipados y un solo movimiento de cámara por plano. La mayoría de los malos resultados vienen de tratarlo como Seedance 2.0. Esta es la estructura que funciona, sacada de la guía que aplicamos dentro de LUVI.

Publicado:

Cinco pequeños fotogramas de película en fila, cada uno con un solo trazo de luz cálida, sobre una línea de tiempo con marcas ámbar en segundos enteros.

Seedance 2.5 es el modelo de ByteDance que genera imagen y sonido en un mismo render. En LUVI está disponible en tres modos —texto a video, imagen a video y referencia a video— a 480p, 720p y 1080p, desde 3,030 créditos por un clip de cinco segundos. También es el caso más claro que hemos visto de reglas invertidas dentro de una misma familia: varias cosas que son ley en Seedance 2.0 están mal en 2.5. Esta es la estructura que impone nuestra guía de prompts (el prompt es la instrucción que le das al modelo), con los motivos de cada regla.

La estructura en cuatro partes

Un prompt para 2.5 no es un pie de foto. Tiene cuatro partes, en este orden:

  1. Línea de recursos (solo en los modos con medios). Numera cada imagen, video o audio que hayas subido, en el orden de subida, y di qué aporta cada uno: “@Image 1 defines the artist's face, hair and dark green apron — only her face, hair and clothing, never its background”.
  2. Resumen en una línea. Sujeto, lugar, acción, género o estilo y cualquier movimiento de cámara especial.
  3. Cuerpo por tramos, divididos en segundos enteros.
  4. Audio, escrito como contenido en canales tipados.

Entre sesenta y cien palabras bastan para un solo tramo; una secuencia de varios planos con tiempos ocupa entre 150 y 250. El techo duro está en 1,000 palabras en inglés, pero pasadas las 300 no sale nada bueno.

¿Funcionan las marcas de tiempo en Seedance 2.5?

Sí, y la propia documentación de ByteDance lo dice sin rodeos: 2.0 no responde a las marcas de tiempo y solo obedece a los números de plano; 2.5 admite marcas en segundos enteros. Respeta tres formas: intervalos (“0–3 seconds… 3–7 seconds…”, continuos y sin huecos), puntos (“at the 5-second mark”) y marcas relativas (“after 3 seconds”).

El encabezado híbrido que ByteDance usa en sus ejemplos es la forma más segura para varios planos:

Shot 1 (0-3s): extreme wide shot, ultra-low camera position, a lone cyclist crests a ridge at golden hour…
Shot 2 (3-7s): medium close-up, the camera pushes in slowly…

Dale a cada intervalo suficiente acción para llenarlo. Con muy poca, el modelo improvisa; con demasiada, se pierden tramos.

¿Cómo escribo el audio?

El sonido se genera a la vez que la imagen, así que lo escribes en vez de pedirlo, y cada canal tiene su propio tipo de paréntesis: la música va en paréntesis de ancho completo (…), los efectos de sonido en ASCII <…>, los diálogos en ASCII {…} y los subtítulos en pantalla en corchetes lenticulares 【…】. Confundirlos es el fallo silencioso más frecuente: el modelo lee el canal equivocado y el sonido vuelve genérico.

El diálogo sigue una fórmula —idioma, acento o variedad regional, forma de decirlo, quién habla y, por último, la frase—: says in English, calm and low, the older man {We should have left an hour ago}. Cualquier idioma que no sea chino o inglés hay que etiquetarlo, y el inglés conviene etiquetarlo también; las frases sin etiqueta se van a la deriva.

¿Cuántos movimientos de cámara por plano?

Uno, y la documentación lo dice literalmente: “Do not require push, pull, pan, and move at the same time, as this will increase image instability”. Reparte los movimientos entre tramos, nunca dentro de uno, y deja la cámara en su propia oración para que su movimiento no se lea como movimiento del sujeto. Usa el vocabulario documentado —push in, pull out, pan, track, follow, orbit, dive, pull back, tilt up, handheld shake— y describe el encuadre como intención (“wide shot”, “shallow focus”), nunca como distancias focales ni números f: el modelo agrupa por categorías, y su propia documentación llama gran angular a un 45 mm.

¿Hay prompt negativo?

No hay prompt negativo. “No cape” produce capas. Escribe el estado final en su lugar: “the shoulder line is clean and unbroken”. Las únicas negaciones que funcionan son las de audio y subtítulos —“no bgm”, “no subtitles”—, y hasta esas son probabilísticas, así que nunca pongas texto en pantalla y suprimas texto en el mismo plano.

¿Qué cambia respecto a Seedance 2.0?

  • Ritmo. Seedance 2.0: solo el orden de los planos; las marcas de tiempo se ignoran. Seedance 2.5: las marcas en segundos enteros se respetan.
  • Estructura. 2.0: un guion gráfico de planos. 2.5: línea de recursos → resumen → tramos con tiempos → audio.
  • Cámara. Un movimiento por plano en ambos: la misma ley.
  • Audio. Canales tipados en ambos: los mismos paréntesis.
  • Resoluciones en LUVI. 2.0: de 480p a 4K (niveles de superresolución). 2.5: 480p, 720p y 1080p.

Si te quedas con una sola idea: en 2.5, los segundos que escribes son los segundos que obtienes. En 2.0 son decoración.

En LUVI

Activa el interruptor de la guía de prompts en el espacio de trabajo y tu borrador se reescribe con esta estructura antes de ejecutarse. Claude y ChatGPT hacen lo mismo a través del conector, con get_prompt_manual y check_prompt (cómo conectar LUVI con Claude). El conjunto completo de reglas está en la página de la familia Seedance; lo que cuesta un clip se explica en cómo funcionan los créditos.

Preguntas

¿Seedance 2.5 genera sonido?

Sí, en la misma pasada y activado por defecto. Escribe el sonido como contenido en los canales tipados en lugar de pedirlo en prosa.

¿Puedo reutilizar mis prompts de Seedance 2.0 en 2.5?

Casi nunca. 2.0 marca el ritmo por número de plano e ignora las marcas de tiempo; 2.5 respeta las marcas en segundos enteros. Un guion gráfico al estilo 2.0 se ejecuta en 2.5, pero renuncias a su principal ventaja.

¿Cuánto cuesta un clip de 5 segundos?

Desde 3,030 créditos en la resolución base de LUVI; 720p y 1080p cuestan más, y el espacio de trabajo muestra la estimación exacta antes de confirmar.

Más de Guías