Prompts für Kling 3: Aufbau, Zeichenlimit und warum der Ton schon an ist

Eine Einstellung schreibst du bei Kling 3 in dieser Reihenfolge: Subjekt, Bewegung, Schauplatz, danach Kamera, Licht und Atmosphäre. 60 bis 100 Wörter, eine Kamerabewegung, eine Handlung. Der ganze Prompt ist bei 2.500 Zeichen gedeckelt, und darüber scheitert schon das Absenden.

Veröffentlicht:

Sechs durchscheinende Karten ziehen in einer Reihe durch ein fast schwarzes Bild, jede mit einem einzigen türkisen Lichtstrich; die letzte bleibt an einer indigofarbenen Schwelle stehen, während warme Wellen durch die Szene laufen.

Kling 3 ist das Videomodell von Kuaishou, und auf LUVI kommt die Kling-Familie in zwei Zweigen: die v3.0-Modelle fürs Bild, die Video-O3-Modelle für den Ton aus demselben Durchlauf. Clips laufen 3 bis 15 Sekunden in 16:9, 9:16 oder 1:1, und der Ton ist von Haus aus eingeschaltet. Bevor du etwas startest, zeigt dir der Arbeitsbereich die Schätzung in Credits für deine Einstellungen. Was jetzt kommt, stammt aus dem Prompting-Guide, den wir in LUVI fahren, und aus dem Parametervertrag des Modells – der entscheidet nämlich, ob dein Prompt überhaupt losgeschickt wird.

In welcher Reihenfolge schreibt man einen Kling-3-Prompt?

Eine Einstellung wird von links nach rechts gebaut: Subjekt, Bewegung des Subjekts, Schauplatz, dann Kamerasprache, Licht und Atmosphäre. Der Guide bringt es auf einen Satz: „A muddy clip is a missing slot, not a bad seed.“ Ein matschiger Clip kommt also fast immer von einem leer gelassenen Platz, nicht vom Seed. Halte eine Einstellung bei 60 bis 100 Wörtern in zwei bis fünf Sätzen, und gib jedem Satz genau eine Aufgabe.

  • Subjekt und Bewegung zuerst. Lade das Handlungsverb mit Tempo, Richtung und Kontaktpunkt: statt „moves“ lieber „races down a rain-soaked street, weaving between cars“.
  • Eine Kamerabewegung pro Einstellung, benannt mit dem Begriff vom Set: „slow push-in“, „smooth 180° orbit“, „handheld with subtle shake“. Der Guide wird hier deutlich: „'Push in then pan right' never works: two moves means two shots.“
  • Nenne die Lichtquelle und ihre Richtung, nie das Gefühl. „Rim light from top-right“ trägt, „dramatic lighting“ nicht.
  • Streich die Deko. „Cinematic, 4K, dramatic, trending“ bringen nichts. Ein, zwei Stimmungswörter dürfen ans Ende, wenn die Regie steht.
  • Die Farbstimmung kommt zum Schluss und in Worten: Temperatur, Kontrast und Format, etwa „warm tones, high contrast, 35mm film grain“.

Die Beispiel-Prompts bleiben auf Englisch, weil der Kling-3-Guide seine Regeln und Beispiele in dieser Sprache veröffentlicht. So sieht eine einzelne Einstellung für Kling v3.0 Pro Text-to-Video aus:

A cellist in a grey wool coat draws a slow bow across the strings, shoulders easing down with the phrase. She sits alone on the stage of an empty theatre, rows of red velvet seats fading into the dark behind her. Slow push-in from the third row. Hard key from a single overhead work light, rim light from top-right, dust drifting through the beam. Warm tones, high contrast, 35mm film grain.

Warum wurde mein Kling-3-Prompt gar nicht erst abgeschickt?

Kling 3 deckelt den Prompt bei 2.500 Zeichen, und darüber wird nichts gekürzt: die Anfrage scheitert. Jede Einstellungskarte sollte bei rund 512 Zeichen bleiben; passt eine Einstellung da nicht hinein, sind es in Wahrheit zwei. Das ist die einzige Regel, die die Maschine für dich prüft: Ein Prompt mit 2.565 Zeichen kommt aus check_prompt über den Connector mit pass: false zurück, und zwar mit genau einem char-cap-Hinweis, der den Kling-Guide zitiert: „2565 characters — Kling 3 hard-caps the prompt at 2500; overrun fails. Tighten it.“

Die handwerklichen Regeln werden so nicht geprüft. Am 16. September 2026 haben wir einen absichtlich schlechten Prompt durch denselben Prüfer geschickt („Cinematic 4K dramatic shot of a man walking down a street, no rain, no cars, push in then pan right, beautiful dramatic lighting, trending, masterpiece, highly detailed, 8k“): Er kam mit pass: true und ohne eine einzige Korrektur zurück, obwohl er gegen vier Regeln aus dem Guide verstößt. Nimm den Prüfer als Längenkontrolle und den Guide als den Teil, den du liest.

Wie halte ich etwas aus der Einstellung heraus?

Lass es ganz aus dem Prompt weg. Kling 3 hat auf LUVI kein Feld für einen negativen Prompt, und der Guide verlangt, im Fließtext nie „no X“ zu schreiben: Was du nicht willst, wird schlicht nicht beschrieben. Beschreib die leere Straße, nicht die fehlenden Autos. Wer benennt, was er nicht will, hält es dem Modell hin – und der Prüfer fängt das nicht ab.

Wie schreibe ich Dialog und Ton?

Setz zuerst die körperliche Handlung, dann die Zeile: So weiß das Modell, wessen Mund sich bewegen soll. Die Video-O3-Modelle erzeugen den Ton im selben Durchlauf wie das Bild, und das Muster des Guides ist immer gleich – Handlung, dann Sprecher und Tonfall in eckigen Klammern, zum Schluss die Zeile.

[Sound: rain on a tin roof, the low hum of a chest freezer.] The Night Clerk slides a paper bag across the counter and lets go of it. [Night Clerk, flat and tired]: "You're the third one tonight." Pause. The Night Clerk wipes both hands on a green apron. Locked-off wide from behind the register, one fluorescent tube overhead with a flickering bulb. Cool tones, high contrast.

  • Die Atmo steht zuerst, in ihrer eigenen Klammer, bevor jemand spricht.
  • Jede Figur bekommt ein eindeutiges Label, das du wortgleich wiederholst. Ein Synonym liest sich als neue Person: „the clerk“ und danach „the man“ zerlegen die Stimme, die du gerade aufgebaut hast.
  • Reihe die Sprechwechsel mit „Immediately,“ und halte die Pausen mit „Pause.“ oder „Silence.“
  • Pass die Wortmenge an die Länge an. Ein 5-Sekunden-Clip trägt ein bis zwei kurze Zeilen.
  • Die Atmo gehört in den Schauplatz („rain tapping on the roof“), denn Kontaktwörter erzeugen zugleich die Geräusche.

Beim Ton weicht Kling 3 von der anderen Familie ab, über die wir geschrieben haben: In den Text-zu-Video-Modellen steht sound sowohl bei v3.0 als auch bei Video O3 standardmäßig auf true, während bei Veo 3.1 der Ton aus bleibt, bis du ihn einschaltest. Kuaishou hat 3.0 mit „native audio generation across multiple languages, dialects, and accents“ angekündigt; welche Sprachen wirklich tragen, haben wir nicht gemessen, also behaupten wir dazu nichts.

Wie bekomme ich mehrere Einstellungen aus einer Generierung?

Schalte den Mehrfach-Modus ein und gib Kling 3 pro Karte genau einen sauberen Moment. Der Parametervertrag deckt sich mit dem Guide: multi_shot schaltet den Modus ein, shot_type wählt zwischen customize (du schreibst jede Einstellung) und intelligence (das Modell teilt deinen Prompt auf), und multi_prompt trägt das Storyboard – höchstens sechs Einstellungen, deren Einzeldauern zusammen exakt die Clip-Länge ergeben müssen. Die „roughly 6 shots ceiling“ aus dem Guide ist dieselbe Sechs, die der Vertrag annimmt.

  • Ordne jede Zeile gleich: Bildausschnitt, Subjekt, Bewegung des Subjekts, Kamerabewegung.
  • Verbinde die Schnitte mit Worten: „Continuing…“ oder „then“ für einen Match Cut, „Immediately“ für einen harten Schnitt, „Camera cuts to…“, wenn du es ausdrücklich willst.
  • Wiederhole tragende Beschreibungen buchstabengleich. Aus „man in red suit“ wird im nächsten Schnitt wieder „man in red suit“, denn die Identität reist über das exakte Label und nicht über Pronomen.

Kuaishou beschreibt dieselbe Funktion von seiner Seite: Das Modell Video 3.0 Omni bringt ein Mehrfach-Storyboard, in dem sich für jede Einstellung Dauer, Einstellungsgröße, Perspektive, erzählter Inhalt und Kamerabewegungen festlegen lassen.

Welches Kling-3-Modell soll ich nehmen?

Entscheide danach, was du steuern willst, denn die vier Text-zu-Video-Modelle unterscheiden sich in genau einem Parameter und darin, wozu der Ton da ist.

  • Kinobild mit regelbarer Prompt-Treue: Kling v3.0 Pro Text-to-Video und Kling v3.0 Std Text-to-Video haben cfg_scale, einen Regler von 0 bis 1, standardmäßig auf 0,5, der zwischen Freiheit des Modells und Nähe zum Prompt abwägt.
  • Dialog und eigener Ton: Kling Video O3 Pro Text-to-Video und Kling Video O3 Std Text-to-Video haben kein cfg_scale und stützen sich auf die Omni-Seite der Familie, die der Guide als „native lip-synced audio“ beschreibt.
  • Wenn du von einem Bild ausgehst, gilt dieselbe Teilung bei den Bild-zu-Video-Modellen, und der O3-Zweig bringt zusätzlich Referenz-zu-Video und Bearbeitung.
  • Bei allen liegt die Dauer zwischen 3 und 15 Sekunden bei 16:9, 9:16 oder 1:1, ohne Auflösungsparameter zum Einstellen und ohne Seed zum Festhalten.

Std und Pro kosten je nach Modus unterschiedlich, und die Schätzung für deine Einstellungen erscheint, bevor der Lauf startet.

Wie wir das geprüft haben

  • Gelesen: der öffentliche Prompting-Guide von LUVI für Kling 3 und der Parametervertrag der vier Text-zu-Video-Modelle von Kling 3 über den Connector, am 16. September 2026.
  • Gemessen: check_prompt für vier Prompts auf kwaivgi/kling-v3.0-pro/text-to-video und kwaivgi/kling-video-o3-pro/text-to-video – die beiden Beispiele oben (beide pass: true, ohne Korrektur), ein Prompt mit 2.565 Zeichen (pass: false, char-cap) und ein Prompt voller Deko und Verneinungen (pass: true, ohne Korrektur).
  • Ton-Standardwerte: am selben Tag aus den Schemata der Text-zu-Video-Modelle von Kling 3 und Veo 3.1 Fast gelesen.
  • Grenzen: Für diesen Beitrag wurde nichts generiert, er sagt also nichts über die Qualität der Ergebnisse; und das Zeichenlimit ist die einzige Regel, die wir den Prüfer anwenden gesehen haben.

In LUVI

Wähle im Arbeitsbereich ein Kling-Modell, schreib die Einstellung in der Reihenfolge von oben und lies die Schätzung, bevor du startest. Der Feder-Button neben dem Prompt schreibt deinen Entwurf kostenlos in den Kling-Dialekt um, und was ein Prompting-Guide ist erklärt, woher diese Regeln kommen. Wenn du von Claude oder ChatGPT aus arbeitest, liefert der LUVI-Connector denselben Guide und die genauen Parameter, multi_prompt inbegriffen. Zum Ausprobieren leg dir ein LUVI-Konto an.

Quellen

Mehr aus Guides