Seedance 2.5 richtig prompten – und warum die Gewohnheiten aus Seedance 2.0 schaden

Seedance 2.5 liest Zeitmarken in ganzen Sekunden, typisierte Audiokanäle und eine Kamerabewegung pro Einstellung. Die meisten schlechten Ergebnisse entstehen, weil das Modell wie Seedance 2.0 gepromptet wird. Hier ist die Struktur, die funktioniert – aus dem Leitfaden, den wir in LUVI einsetzen.

Veröffentlicht:

Fünf kleine Filmkader in einer Reihe, jeder mit einer einzelnen warmen Lichtspur, darunter eine Zeitleiste mit bernsteinfarbenen Markierungen auf ganzen Sekunden.

Seedance 2.5 ist ByteDances Modell für Bild und Ton aus einem Guss: Video und Tonspur entstehen in einem einzigen Rendering. Auf LUVI läuft es als Text zu Video, Bild zu Video und Referenz zu Video, in 480p, 720p und 1080p, ab 3.030 Credits für einen Fünf-Sekunden-Clip. Zugleich stellt keine andere Modellfamilie ihre eigenen Prompt-Regeln so scharf auf den Kopf: Mehreres, was auf Seedance 2.0 Gesetz ist, ist auf 2.5 falsch. Das hier ist die Struktur, die unser Prompt-Leitfaden durchsetzt – samt Begründung.

Die vier Teile eines Prompts

Ein Prompt für 2.5 ist keine Bildunterschrift. Er besteht aus vier Teilen, in dieser Reihenfolge:

  1. Asset-Zeile (nur bei Modi mit Medien). Nummeriere jedes Bild, Video und Audio, das du mitgegeben hast, in Upload-Reihenfolge, und sag, was es beiträgt: „@Image 1 defines the artist's face, hair and dark green apron — only her face, hair and clothing, never its background.“
  2. Kurzzusammenfassung in einem Satz. Motiv, Ort, Ereignis, Genre oder Stil und eine eventuelle besondere Kamerabewegung.
  3. Ablauf in Zeitabschnitten, unterteilt nach ganzen Sekunden.
  4. Audio, als Inhalt in typisierten Kanälen geschrieben.

Sechzig bis hundert Wörter tragen einen einzelnen Abschnitt; eine getaktete Sequenz mit mehreren Einstellungen kommt auf 150–250. Die harte Grenze liegt bei 1.000 englischen Wörtern, aber jenseits von 300 passiert nichts Gutes mehr.

Funktionieren Zeitmarken auf Seedance 2.5?

Ja, und ByteDances eigene Dokumentation sagt es unmissverständlich: 2.0 reagiert nicht auf Zeitmarken, sondern nur auf Einstellungsnummern; 2.5 unterstützt Zeitmarken in ganzen Sekunden. Drei Formen werden befolgt: Intervalle („0–3 Sekunden … 3–7 Sekunden …“, lückenlos aneinander), Zeitpunkte („bei Sekunde 5“) und relative Marken („nach 3 Sekunden“).

Am sichersten für mehrere Einstellungen ist die Mischform, die ByteDance in seinen Beispielen verwendet:

Shot 1 (0-3s): extreme wide shot, ultra-low camera position, a lone cyclist crests a ridge at golden hour…
Shot 2 (3-7s): medium close-up, the camera pushes in slowly…

Gib jedem Zeitfenster genug Handlung, um es zu füllen. Zu wenig, und das Modell improvisiert; zu viel, und Abschnitte fallen weg.

Wie schreibe ich den Ton?

Der Ton wird mitgeneriert, also schreibst du ihn, statt ihn anzufordern – und jeder Kanal hat seine eigene Klammer: Musik in vollbreiten (…), Geräusche in ASCII <…>, Dialog in ASCII {…}, eingeblendete Untertitel in 【…】. Die Klammern zu vertauschen ist der häufigste stille Fehler: Das Modell liest den falschen Kanal, und der Ton kommt generisch zurück.

Dialog folgt einer Formel – Sprache, Akzent oder regionale Färbung, Vortragsweise, Sprecher, dann der Satz: says in English, calm and low, the older man {We should have left an hour ago}. Jede Sprache außer Chinesisch und Englisch muss markiert werden, und auch Englisch solltest du markieren; unmarkierte Sätze driften.

Wie viele Kamerabewegungen pro Einstellung?

Eine. Wörtlich aus der Dokumentation: „Do not require push, pull, pan, and move at the same time, as this will increase image instability.“ Verteile Bewegungen auf mehrere Abschnitte, nie innerhalb von einem, und gib der Kamera ihren eigenen Teilsatz, damit ihre Bewegung nicht als Bewegung des Motivs gelesen wird. Bleib beim dokumentierten Vokabular – push in, pull out, pan, track, follow, orbit, dive, pull back, tilt up, handheld shake – und beschreib die Kadrierung als Absicht („wide shot“, „shallow focus“), nie als Brennweite oder Blendenzahl: Das Modell sortiert in grobe Klassen, und seine eigene Doku nennt 45 mm ein Weitwinkelobjektiv.

Gibt es einen negativen Prompt?

Nein. „No cape“ erzeugt Umhänge. Beschreib stattdessen den Zielzustand: „the shoulder line is clean and unbroken.“ Die einzigen Verneinungen, die funktionieren, betreffen Ton und Untertitel – „no bgm“, „no subtitles“ –, und selbst die sind Wahrscheinlichkeitssache. Setz also nie in derselben Einstellung eigenen Bildtext und unterdrück zugleich Text.

Was ändert sich gegenüber Seedance 2.0?

  • Takt. Seedance 2.0: nur die Reihenfolge der Einstellungen, Zeitmarken werden ignoriert. Seedance 2.5: Zeitmarken in ganzen Sekunden werden befolgt.
  • Aufbau. 2.0: ein Storyboard aus Einstellungen. 2.5: Asset-Zeile → Zusammenfassung → getaktete Abschnitte → Audio.
  • Kamera. Eine Bewegung pro Einstellung, bei beiden – dieselbe Regel.
  • Audio. Typisierte Kanäle, bei beiden – dieselben Klammern.
  • Auflösungen auf LUVI. 2.0: 480p bis 4K (SR-Stufen). 2.5: 480p, 720p, 1080p.

Wenn du dir nur eines merkst: Auf 2.5 sind die Sekunden, die du schreibst, die Sekunden, die du bekommst. Auf 2.0 sind sie Dekoration.

In LUVI

Schalte im Arbeitsbereich den Prompt-Leitfaden ein, und dein Entwurf wird vor dem Start in diese Struktur umgeschrieben. Claude und ChatGPT machen dasselbe über get_prompt_manual und check_prompt des Connectors (Wie verbinde ich LUVI mit Claude?). Das vollständige Regelwerk steht auf der Seite der Seedance-Familie; was ein Clip kostet, erklärt Wie funktionieren Credits und was kostet eine Generierung?.

Fragen

Erzeugt Seedance 2.5 auch Ton?

Ja, im selben Durchgang, und standardmäßig eingeschaltet. Schreib den Ton als Inhalt in die typisierten Kanäle, statt ihn im Fließtext zu erbitten.

Kann ich meine Prompts aus Seedance 2.0 auf 2.5 weiterverwenden?

Meistens nicht. 2.0 taktet nach Einstellungsnummer und ignoriert Zeitmarken; 2.5 hält sich an Zeitmarken in ganzen Sekunden. Ein Storyboard im Stil von 2.0 läuft auf 2.5 zwar, verschenkt aber dessen größten Vorteil.

Was kostet ein 5-Sekunden-Clip?

Auf LUVI ab 3.030 Credits in der Basisauflösung; 720p und 1080p kosten mehr, und der Arbeitsbereich zeigt die genaue Schätzung, bevor du bestätigst.

Mehr aus Guides