Welche LUVI-Videomodelle Ton erzeugen – und was du dafür schreiben musst

Die meisten Videomodelle auf LUVI erzeugen den Ton inzwischen im selben Durchgang wie das Bild, sind sich sonst aber über fast nichts einig: ob der Schalter an ist, ob er extra kostet und wie du den Ton schreibst. Hier stehen Schalter und Syntax jeder Familie, gegen ihre Schemata geprüft.

Veröffentlicht:

Eine Reihe Kippschalter auf einer schwarzen Konsole: Drei leuchten bernsteinfarben und über jedem steigt eine andere Klangform auf, einer bleibt dunkel und trägt nichts über sich, und an der letzten Stelle sitzt statt eines Schalters nur eine glatte Platte.

Die meisten Videofamilien im LUVI-Katalog erzeugen inzwischen ihren eigenen Ton: Dialog, Effekte, Atmo und Musik entstehen im selben Durchgang wie das Bild. Was sie nicht teilen, ist die Art, wie du danach fragst. Manche kommen mit eingeschaltetem Ton, eine kommt stumm und berechnet mehr, sobald du den Ton einschaltest, und mehrere haben überhaupt keinen Schalter – dort entscheidet allein der Prompt, ob du etwas hörst. Der Veo-Leitfaden von Google DeepMind formuliert die allgemeine Regel klar: „Explicitly define the sounds you want to hear, to match the audio to your visuals“, also: Benenne ausdrücklich die Klänge, die du hören willst. Dieser Beitrag ist diese eine Zeile, aufgeschlüsselt nach Familien.

Welche Modelle haben gar keinen Tonschalter?

Fünf Familien zeigen auf LUVI keinen einzigen Audioparameter, der Ton hängt dort also vollständig am Prompt: MiniMax H3, Grok Imagine Video, Gemini Omni 1.1 Flash, HappyHorse und Veo 3.1 Lite. Vier davon erzeugen immer Ton. Veo 3.1 Lite ist die Ausnahme in die andere Richtung – dort gibt es keinen Audioparameter zum Einschalten.

„Kein Schalter“ heißt nicht „gleiches Verhalten“, und der Unterschied zeigt sich genau dann, wenn du die Tonangabe vergisst:

  • HappyHorse liefert einen fast stummen Clip. Es leitet den Ton nicht aus dem Bild ab.
  • MiniMax H3 erfindet Ton. Ein ausgelassenes Audiofeld wird gefüllt, nie stumm gelassen.
  • Grok Imagine Video gibt dir Stille oder zufälligen Ton, und du kannst weder das eine noch das andere anfordern.

Drei Familien, drei verschiedene Strafen für dasselbe Versäumnis.

Ist der Ton ab Werk an, und kostet er extra?

Sechs Familien kommen mit eingeschaltetem Ton, und bei den gemessenen ändert das nichts am Preis. Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling, PixVerse und Vidu Q3 haben den Ton standardmäßig an. Zwei sagen das im Parameter selbst: Das generate_audio von Seedance 2.5 ist mit „Does not affect price“ dokumentiert, das audio von Wan 3.0 mit „Same price either way“. Wir haben beides gegen Live-Schätzungen geprüft: Ein Seedance-2.5-Clip von fünf Sekunden in 720p wird mit eingeschaltetem Ton auf 3030 Credits geschätzt und ausgeschaltet ebenfalls auf 3030 Credits; ein FLUX-3-Video-Clip von fünf Sekunden in 720p liegt in beiden Fällen bei 1870 Credits.

Veo ist in beiden Punkten die Ausnahme. Sein generate_audio steht ab Werk auf false, und die Beschreibung sagt selbst, dass Ton die Kosten pro Sekunde erhöht. Ein Veo-3.1-Fast-Clip von acht Sekunden in 720p wird ohne Ton auf 1280 Credits geschätzt und mit Ton auf 1536 Credits (geprüft am 22. September 2026). Ausgerechnet das Modell, das „schon vertont“ ankommt, ist also das einzige, das stumm startet und fürs Einschalten mehr berechnet.

Innerhalb einer Familie, die sonst eingeschaltet ankommt, lauert zudem eine Falle. Bei den Omni-O3-Varianten von Kling steht sound für Text zu Video und Bild zu Video auf true, für Referenz zu Video aber auf false, und dort gibt es zusätzlich ein eigenes keep_original_sound für den Ton, der in der Referenz mitkommt. Wenn eine Kling-Referenzeinstellung stumm zurückkam, liegt es daran.

Und eine Familie macht nur Bild: Hailuo erzeugt weder Dialog noch Sounddesign noch Musik, jedes Wort für Ton in einem Hailuo-Prompt ist also verschenkt.

Wie will jede Familie den Ton geschrieben haben?

Hier gehen die Dialekte am weitesten auseinander. Alles Folgende stammt aus den Prompting Guides, die LUVI für die jeweilige Familie einsetzt.

  • Veo 3.1. Der Ton wird beschriftet in die Einstellung geschrieben: die Replik in Anführungszeichen und einer Person zugeordnet, SFX: thunder cracks in the distance, Ambient noise: the quiet hum of a starship bridge, Musik in Prosa benannt. Stille lässt sich als Inhalt steuern: „no music, only the wind“.
  • Seedance 2.5. Typisierte Kanäle, mit exakt diesen Zeichenbreiten: Musik in breiten Klammern (…), Effekte in ASCII <…>, Dialog in ASCII {…}, Untertitel in Linsenklammern 【…】. Die Atmo bleibt in normaler Prosa.
  • MiniMax H3. Ein Dokument mit Feldern. Schreib immer overall_soundscape: und non_diegetic_music:, denn ein ausgelassenes Feld wird mit erfundenem Ton gefüllt. Dialog ist ein ausgezeichneter Block: <d>[German] Ich steige an der nächsten Station aus.</d>.
  • Gemini Omni 1.1 Flash. Ein einziger Satz hinter der Beschriftung Sound design: …, der Effekte, Atmo und Dialog abdeckt. Musik muss eigens verlangt werden, und zwar über Quelle und Klangcharakter statt über das Genre: „a low tinny radio broadcast in the background, playing a song“.
  • FLUX 3 Video. Vier Schichten: Sprache, Atmo, Effekte an einer sichtbaren Handlung, Musik mit ihrem Platz in der Mischung. Eine oder zwei sind meist richtig, eine überladene Mischung ist ein dokumentierter Fehler.
  • HappyHorse. Eine benannte Tonangabe in drei Stufen: Vordergrund (Dialog, Haupteffekt), Mitte (Geräusche an etwas Sichtbarem), Hintergrund (Atmo, Raumton, Musik).
  • Wan 3.0. Der Tonteil steht am Ende der additiven Formel und zerfällt in Stimme, Geräusch und Hintergrundmusik, jeweils beschrieben statt aufgezählt.
  • Vidu Q3 und PixVerse. Ton wird als Inhalt neben dem Bild geschrieben, das ihn auslöst: audio includes soft room tone and faint spoon clink.

Warum bedeuten Anführungszeichen bei manchen Modellen das Gegenteil?

Weil Anführungszeichen bei zwei dieser Familien die Anweisung sind, Wörter auf den Bildschirm zu setzen statt in einen Mund – und beide sind in Typografie gut genug, dass daraus ein echtes Risiko wird.

Bei Gemini Omni 1.1 Flash steht der Dialog mit Doppelpunkt und ganz ohne Anführungszeichen: In a crisp, thoughtful tone, Clara says: It has to be here. Die Anführungszeichen bleiben dem Text vorbehalten, der wirklich zu sehen sein soll, etwa einem Schild mit einer Aufschrift. Die Veo-Gewohnheit hierher mitzunehmen ist genau der Weg, auf dem aus einer Replik eine Bauchbinde wird.

Bei FLUX 3 Video sind Anführungszeichen richtig, aber nur mit sichtbarer sprechender Person. Eine Replik in Anführungszeichen, zu der niemand im Bild ist und bei der weder „voiceover“ noch „narration“ steht, kann als eingebrannter Text herauskommen – eine direkte Folge davon, dass Black Forest Labs damit wirbt, FLUX 3 setze Typografie als natürlichen Teil der Szene.

Überall sonst, bei Veo, Kling, Wan, Vidu Q3 und HappyHorse, ist eine Replik in Anführungszeichen gesprochener Text. Kling will zuerst die körperliche Handlung, um zu wissen, wessen Mund sich bewegt, und Wan will die Stimme rund um die Replik beschrieben haben. Zwei Google-Modelle mit gegensätzlichen Konventionen: Das ist in dieser Liste der teuerste Irrtum.

Wie bittet man um Stille?

Jede Familie beantwortet das anders, und das Wort „Stille“ zu schreiben ist bei allen falsch.

  • Über einen Parameter. Veo, Seedance 2.5, Wan 3.0, FLUX 3, Kling, PixVerse und Vidu Q3 haben einen Schalter. Das ist der verlässliche Weg.
  • Über einen ausgelassenen Kanal. Bei Seedance 2.5 bittest du nicht um „keine Musik“, sondern lässt den Kanal () einfach weg.
  • Über einen wörtlichen Wert. Bei MiniMax H3 schreibt man Stille als N/A ins Musikfeld. Das Feld wegzulassen erzeugt stattdessen erfundenen Ton.
  • Über einen Satz. Wan unterdrückt am Ende per Satz („No dialogue.“ „No background music.“), und Gemini Omni stellt nackte Fragmente ans Ende: „No dialogue.“ „No music, just realistic real world sound.“
  • Gar nicht. Grok Imagine Video hat kein Stille-Flag. Wenn du von dort einen stummen Clip brauchst, entfernst du den Ton hinterher.

Eine Regel gilt überall: Bei einem Modell mit Schalter per Prosa um Stille zu bitten erzeugt meist Rauschen oder tote Luft, weil du das Tonmodell weiterhin um etwas bittest. Teilweise Stille ist etwas anderes und funktioniert überall als Inhalt: „for the final two seconds, only rain against the window.“

Was wir geprüft haben

  • Modelle: die aktiven Varianten für Text zu Video, Bild zu Video und Referenz zu Video von Veo 3.1, 3.1 Fast und Lite, Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling v3.0 und Omni O3, PixVerse v6 und c1, Vidu Q3, MiniMax H3, Gemini Omni 1.1 Flash, HappyHorse 1.1 und Hailuo.
  • Gelesene Quellen: die Parameterschemata und Standardwerte all dieser Varianten, die Prompting Guides, die LUVI je Familie einsetzt, und die unten verlinkten Google-Seiten.
  • Datum: 22. September 2026. Die Credit-Angaben stammen aus Live-Schätzungen auf LUVI mit den im Text genannten Einstellungen.
  • Ergebnisse: Seedance 2.5 wurde für fünf Sekunden in 720p mit und ohne Ton auf 3030 Credits geschätzt; FLUX 3 Video in beiden Fällen auf 1870 Credits; Veo 3.1 Fast für acht Sekunden in 720p auf 1280 Credits ohne und 1536 Credits mit Ton.
  • Grenzen: Für diesen Beitrag wurde nichts generiert, er behauptet also nichts über die Qualität der Ergebnisse. Die Standardwerte und Preise oben sind eine Momentaufnahme – schau vor dem Start auf die Schätzung und das Parameterfeld im Arbeitsbereich, denn ein Anbieter kann einen Standardwert ändern.

Welches soll ich nehmen?

Geh davon aus, was der Ton leisten soll, nicht vom Bild.

  • Eine Figur, die bestimmte Sätze sagt, gehört zu der Familie, deren Dialogkonvention du bereit bist genau einzuhalten: Veo 3.1 für Repliken in Anführungszeichen mit benannten Effekten und Atmo, HappyHorse, wenn die Replik auf Mandarin, Kantonesisch, Japanisch, Koreanisch, Deutsch oder Französisch läuft und Lippensynchronität auf Phonem-Ebene braucht, MiniMax H3, wenn du Sprechende, Atmo und Musik lieber in getrennten Feldern hast.
  • Wenn auf Deutsch gesprochen wird, bist du gut versorgt: Deutsch steht sowohl in den sieben Sprachen von HappyHorse als auch in der Liste der stabilen Dialogsprachen von MiniMax H3. Die Entscheidung fällt also über die Syntax, nicht über die Sprache.
  • Ein Musikbett unter einer wortlosen Einstellung braucht eine Musikangabe und einen genannten Platz in der Mischung. Bei FLUX 3 Video ist das keine Kür: Eine Mischung nur aus Atmo und Effekten rutscht Richtung unhörbar.
  • Effekte an einer sichtbaren Handlung wirken überall, und am besten, wenn du sie an das hängst, was die Kamera sieht, statt nur den Klang zu benennen.
  • Einen Clip, den du selbst vertonst, regelst du über den Schalter und nicht über einen Satz im Prompt – und meidest dafür eher Grok Imagine Video, das keinen hat.

Im Arbeitsbereich wendet der Feder-Button den Dialekt des gerade gewählten Modells an, und das ist der schnellste Weg, die Tonsyntax einer Familie nicht länger in eine andere zu schleppen: was der Feder-Button macht und was ein Prompting Guide ist. Das Handbuch lässt sich auch aus Claude oder ChatGPT abrufen, über den LUVI-Connector.

Neu hier? Leg ein LUVI-Konto an und probier deine Tonangabe am günstigsten kurzen Clip der Familie aus, für die du dich entschieden hast.

Quellen

Mehr aus Vergleiche