Welche Modelle erzeugen Ton zusammen mit dem Video?

Seedance 2.0 und 2.5, Veo 3.1, Gemini Omni, MiniMax H3, HappyHorse, FLUX 3 Video, Grok Imagine Video und Kling 3 erzeugen die Tonspur im selben Durchlauf wie das Bild – Dialog, Effekte, Atmosphäre und Musik –, unterscheiden sich aber darin, ob Audio standardmäßig an ist und ob es extra kostet.

Zuletzt aktualisiert:

Die Familien mit gemeinsamer Audio-Video-Erzeugung

FamilieAudio standardmäßigPreiswirkungSo forderst du Ton an
Seedance 2.0 / 2.5aninklusivetypisierte Audiokanäle im Prompt
Veo 3.1ausStandard ×2, Fast ×1,2, Lite hat kein Audiogenerate_audio einschalten, den Ton beschreiben
Gemini Omni 1.1an, kein Schalterinklusiveim Fließtext beschreiben
MiniMax H3immer aninklusiveDialog-Tags und eine Soundscape-Zeile
HappyHorse 1.0 / 1.1aninklusivemuss in Worten benannt werden, sonst nahezu stumm
FLUX 3 Videoan, abschaltbarinklusivefür gesprochene Zeilen muss ein Sprecher sichtbar sein
Grok Imagine Videoimmer aninklusiveden Ton benennen, Verneinung wird ignoriert
Kling 3 (v3.0, O3)anje nach Zeile, in der Schätzung sichtbarSprecherlabels für Dialog

Jede dieser Familien hat einen Prompting-Guide auf ihrer Modellseite; die Audio-Syntax ist der Teil, der sich zwischen ihnen am stärksten unterscheidet.

Drei Dinge, die du vor der Generierung wissen solltest

  1. Stille ist ein Parameter, kein Satz. „Keine Musik“ im Prompt schaltet ein Modell nicht stumm; bei Grok und H3 wird es ignoriert, bei anderen kann es Musik herbeirufen. Nutze den Schalter, wo es einen gibt.
  2. Dialog braucht einen sichtbaren Sprecher bei FLUX 3 Video und funktioniert überall am besten so; eine zitierte Zeile ohne jemanden im Bild kann als Bildschirmtext gerendert werden.
  3. Veo liefert stumm, wenn du nicht danach fragst. Sein Audio-Schalter ist auf LUVI aus, weil er den Preis ändert; die Schätzung aktualisiert sich, wenn du ihn einschaltest.

Alternativen mit der Stimme zuerst

Brauchst du eine bestimmte Stimme, erzeuge die Sprache mit einem Text-zu-Sprache-Modell (ElevenLabs, Gemini TTS, MiniMax Speech, Grok Speech) und steuere damit ein Lip-Sync-Modell. Die Länge des Audios bestimmt dann den Preis.

Häufige Fragen

Kann ich den Ton abschalten?

Nur wo das Modell einen Schalter hat: Veo und FLUX 3 Video haben generate_audio. H3, Grok Video und Gemini Omni erzeugen immer Audio; bei Seedance lässt du den Audiokanal im Prompt weg.

Warum kam mein Clip fast stumm zurück?

Die meisten dieser Modelle brauchen den Ton im Prompt benannt. Vor allem HappyHorse liefert nahezu Stille, wenn keine Audiozeile geschrieben ist; der Prompting-Guide der Familie zeigt die Syntax.

Kann ich stattdessen eine echte Stimmspur einsetzen?

Ja – Lip-Sync-Modelle wie OmniHuman, VEED und sync nehmen deine eigene Audiodatei und animieren den Mund dazu.

Weitere Fragen