Cómo usar Kling 3: la fórmula del plano, el límite de 2,500 caracteres y el audio que ya viene prendido
En Kling 3 un plano se escribe en este orden: sujeto, movimiento, escenario y recién después cámara, luz y atmósfera. Entre 60 y 100 palabras, un solo movimiento de cámara y una sola acción. El prompt completo tiene un tope de 2,500 caracteres y pasarse cancela el envío.

Kling 3 es el modelo de video de Kuaishou y en LUVI la familia Kling llega en dos ramas: los modelos v3.0, pensados para la imagen, y los modelos Video O3, que generan su propio audio. Los clips duran de 3 a 15 segundos, salen en 16:9, 9:16 o 1:1, y el sonido viene prendido de fábrica. Antes de generar, el Espacio de trabajo te muestra la estimación en créditos de la configuración que elegiste. Lo que sigue viene de la guía de prompts que corremos dentro de LUVI y del contrato de parámetros del modelo, que es el que decide si tu prompt siquiera se envía.
¿En qué orden se escribe un prompt de Kling 3?
Un plano de Kling 3 se arma de izquierda a derecha: sujeto, movimiento del sujeto, escenario y después lenguaje de cámara, iluminación y atmósfera. La guía lo dice sin rodeos: "A muddy clip is a missing slot, not a bad seed", o sea que un clip turbio casi siempre es un espacio que dejaste vacío, no un problema del seed. Mantén cada plano entre 60 y 100 palabras, en dos a cinco oraciones, con una sola tarea por oración.
- Primero el sujeto y su movimiento. Carga el verbo con velocidad, dirección y contacto: en vez de "moves", algo como "races down a rain-soaked street, weaving between cars".
- Un movimiento de cámara por plano, nombrado con el término del oficio: "slow push-in", "smooth 180° orbit", "handheld with subtle shake". La guía es tajante con la alternativa: "'Push in then pan right' never works: two moves means two shots."
- Nombra la fuente de luz y su dirección, nunca la sensación. "Rim light from top-right" funciona; "dramatic lighting" no.
- Saca los adornos. "Cinematic, 4K, dramatic, trending" no aportan nada. Una o dos palabras de ambiente pueden ir al final, cuando la dirección ya está escrita.
- El color va al final y en palabras: temperatura, contraste y formato, por ejemplo "warm tones, high contrast, 35mm film grain".
Los prompts de ejemplo quedan en inglés porque la guía de Kling 3 publica ahí sus reglas y sus ejemplos. Así se ve un plano único para Kling v3.0 Pro Text-to-Video:
A cellist in a grey wool coat draws a slow bow across the strings, shoulders easing down with the phrase. She sits alone on the stage of an empty theatre, rows of red velvet seats fading into the dark behind her. Slow push-in from the third row. Hard key from a single overhead work light, rim light from top-right, dust drifting through the beam. Warm tones, high contrast, 35mm film grain.
¿Por qué mi prompt de Kling 3 ni siquiera se envía?
Kling 3 corta el prompt en 2,500 caracteres y pasarse no recorta el texto: cancela el envío. Cada tarjeta de plano conviene dejarla en unos 512 caracteres; si un plano no entra ahí, en realidad son dos planos. Esta es la única regla que la máquina revisa por ti: pasamos un prompt de 2,565 caracteres por check_prompt en el conector y volvió con pass: false y un solo aviso char-cap que cita la guía de Kling: "2565 characters — Kling 3 hard-caps the prompt at 2500; overrun fails. Tighten it."
Las reglas de oficio no se revisan igual. El 16 de septiembre de 2026 pasamos por el mismo verificador un prompt escrito mal a propósito ("Cinematic 4K dramatic shot of a man walking down a street, no rain, no cars, push in then pan right, beautiful dramatic lighting, trending, masterpiece, highly detailed, 8k") y devolvió pass: true sin ninguna corrección, aunque rompe cuatro reglas que la propia guía enumera. Toma el verificador como un control de largo y la guía como la parte que hay que leer.
¿Cómo dejo algo afuera del plano?
Déjalo afuera del prompt, literalmente. Kling 3 no tiene campo de prompt negativo en LUVI y la guía pide no escribir nunca "no X" en el cuerpo: lo que no quieres, simplemente no se describe. Describe la calle vacía, no los autos ausentes. Nombrar lo que no quieres se lo pone enfrente al modelo, y el verificador no te lo va a señalar.
¿Cómo se escriben los diálogos y el sonido?
Arma primero la acción física y recién después la línea, para que el modelo sepa a quién mover la boca. Los modelos Video O3 generan el audio en la misma pasada que la imagen, y el patrón de la guía es: acción, después el hablante y su tono entre corchetes, y al final la línea.
[Sound: rain on a tin roof, the low hum of a chest freezer.] The Night Clerk slides a paper bag across the counter and lets go of it. [Night Clerk, flat and tired]: "You're the third one tonight." Pause. The Night Clerk wipes both hands on a green apron. Locked-off wide from behind the register, one fluorescent tube overhead with a flickering bulb. Cool tones, high contrast.
- El ambiente va primero, en su propio corchete, antes de que alguien hable.
- Cada hablante lleva una etiqueta única y se repite igual. Un sinónimo se lee como una persona nueva, así que "the clerk" y "the man" te rompen la voz que acabas de armar.
- Ordena los turnos con "Immediately," y sostén las pausas con "Pause." o "Silence."
- Ajusta la cantidad de palabras al largo. Un plano de cinco segundos aguanta una o dos líneas cortas.
- El sonido ambiente vive en el escenario ("rain tapping on the roof"), porque las palabras de contacto también generan efectos.
En esto Kling 3 se separa de la otra familia sobre la que escribimos: en los modelos de texto a video, tanto v3.0 como Video O3 traen sound en true por defecto, mientras que en Veo 3.1 el audio queda apagado hasta que tú lo prendes. Kuaishou anunció el 3.0 con "native audio generation across multiple languages, dialects, and accents"; no medimos qué idiomas sostiene de verdad, así que no afirmamos nada sobre el español hablado.
¿Cómo saco más de un plano en una sola generación?
Prende el modo de varios planos y dale a Kling 3 un momento limpio por tarjeta. El contrato de parámetros acompaña a la guía: multi_shot prende el modo, shot_type elige entre customize (escribes cada plano) e intelligence (el modelo reparte tu prompt), y multi_prompt lleva el storyboard, con un máximo de seis planos cuyas duraciones deben sumar exactamente la duración del clip. El "techo de seis planos" de la guía es el mismo seis que acepta el contrato.
- Ordena cada línea igual: encuadre, sujeto, movimiento del sujeto, movimiento de cámara.
- Une los cortes con palabras: "Continuing…" o "then" para un corte por coincidencia, "Immediately" para un corte seco, "Camera cuts to…" cuando lo quieres explícito.
- Repite letra por letra las descripciones que sostienen al personaje. "Man in red suit" sigue siendo "man in red suit" en cada corte, porque la identidad viaja en la etiqueta exacta y no en los pronombres.
Kuaishou describe la misma función desde su lado: el modelo Video 3.0 Omni suma una función de storyboard de varios planos donde puedes fijar duración, escala de plano, punto de vista, contenido narrativo y movimientos de cámara para cada plano.
¿Qué modelo de Kling 3 conviene elegir?
Elige según lo que necesitas controlar, porque los cuatro modelos de texto a video se diferencian en un solo parámetro y en para qué sirve el audio.
- Imagen cinematográfica con apego al prompt regulable: Kling v3.0 Pro Text-to-Video y Kling v3.0 Std Text-to-Video traen
cfg_scale, un control de 0 a 1 que arranca en 0.5 y cambia cuánta libertad se toma el modelo frente al prompt. - Diálogo y audio propio: Kling Video O3 Pro Text-to-Video y Kling Video O3 Std Text-to-Video no tienen
cfg_scaley se apoyan en el lado Omni de la familia, que la guía describe como "native lip-synced audio". - Si partes de una imagen, la división se repite en los modelos de imagen a video, y la rama O3 agrega referencia a video y edición de video.
- En todos, la duración va de 3 a 15 segundos con 16:9, 9:16 o 1:1, sin parámetro de resolución para tocar ni seed para fijar.
Std y Pro tienen precios distintos en cada modo, y la estimación de la configuración que elegiste aparece antes de que arranque la generación.
Cómo lo verificamos
- Qué leímos: la guía pública de prompts de LUVI para Kling 3 y el contrato de parámetros de los cuatro modelos de texto a video de Kling 3 a través del conector, el 16 de septiembre de 2026.
- Qué medimos:
check_promptsobre cuatro prompts enkwaivgi/kling-v3.0-pro/text-to-videoykwaivgi/kling-video-o3-pro/text-to-video: los dos ejemplos de arriba (ambospass: true, sin correcciones), uno de 2,565 caracteres (pass: false,char-cap) y uno con adornos y negaciones (pass: true, sin correcciones). - Valores por defecto del audio: leídos ese mismo día en los esquemas de los modelos de texto a video de Kling 3 y de Veo 3.1 Fast.
- Límites: no generamos ninguna salida para este artículo, así que no hace ninguna afirmación sobre la calidad del resultado, y el tope de caracteres es la única regla que vimos que el verificador aplica.
En LUVI
En el Espacio de trabajo, elige un modelo Kling, escribe el plano en el orden de arriba y lee la estimación antes de generar. El botón de la pluma junto al prompt reescribe tu borrador al dialecto de Kling sin costo, y qué es una guía de prompts explica de dónde salen estas reglas. Si trabajás desde Claude o ChatGPT, el conector de LUVI te devuelve la misma guía y los parámetros exactos, multi_prompt incluido. Para probarlo, crea una cuenta en LUVI.
Fuentes
- Kling AI Launches 3.0 Model, Ushering in an Era Where Everyone Can Be a Director (en inglés). Comunicado de Kuaishou Technology vía GLOBE NEWSWIRE en Nasdaq, 5 de febrero de 2026. Consultado el 16 de septiembre de 2026.
- Prompting guide for Kling 3 (en inglés). LUVI Creator, página de la familia de modelos. Consultado el 16 de septiembre de 2026.
Más de Guías
- Cómo escribir prompts para Seedance 2.5 (y por qué los hábitos de Seedance 2.0 lo estropean)Seedance 2.5 lee marcas de tiempo en segundos enteros, canales de audio tipados y un solo movimiento de cámara por plano. La mayoría de los malos resultados vienen de tratarlo como Seedance 2.0. Esta es la estructura que funciona, sacada de la guía que aplicamos dentro de LUVI.
- Cómo usar Veo 3.1: prompts que funcionan, videos con sonido y qué pasa con el españolPara usar Veo 3.1, arma el prompt empezando por la cámara: plano, sujeto, acción, contexto y estilo, con diálogos y efectos dentro de la escena. En LUVI activa la Generación de audio, que viene apagada; Veo 3.1 Lite no tiene sonido. Un clip de 8 segundos a 720p cuesta desde 800 créditos.