MiniMax H3, Gemini Omni 1.1 und Wan 3.0 im Vergleich: drei Audio-Video-Modelle, drei Prompt-Dialekte
Alle drei erzeugen Bild und Ton in einem Durchgang, und alle drei lesen einen Prompt anders: H3 will ein Dokument mit Feldern, Omni eine Bildbeschreibung mit Kontinuitätsklausel, Wan eine additive Formel. Preise, Grenzen und die eine Regel, an der jedes von ihnen scheitert.

Innerhalb einer Septemberwoche sind drei Videomodelle auf LUVI angekommen, und sie teilen sich die Schlagzeile: Der Ton entsteht zusammen mit dem Bild, Dialog inklusive. Eine gemeinsame Prompt-Sprache haben sie nicht. Für jedes haben wir aus der Dokumentation des Herstellers einen Prompt-Leitfaden geschrieben; dieser Vergleich ist das Nebenprodukt dieser Arbeit.
Die Zahlen
- Startpreis auf LUVI. H3 ab 2.080 Credits für 8 s (H3 Max 1.216). Omni 1.1 Flash ab 2.200 Credits für 10 s. Wan 3.0 ab 2.000 Credits für 5 s (Prime 2.800).
- Native Auflösungen. H3: 480P, 768P, 2K. Omni: 360p, 720p; 1080p und 4K stammen aus Googles Upscaler. Wan: 480p, 720p, 1080p.
- Cliplänge. H3: 4–15 s. Omni: 3–10 s, verlängerbar auf 40 s. Wan: bis 30 s.
- Modi auf LUVI. H3: Text, Bild, Referenz. Omni: Text, Bild, Referenz, Bearbeitung, Verlängerung. Wan: Text, Bild, Referenz.
- Dialogsprachen. H3: 11 (Türkisch nicht darunter). Omni: für Englisch evaluiert, andere können funktionieren. Wan: Chinesisch und Englisch.
- Referenzmedien. H3: bis zu 9 Bilder, 3 Clips, 3 Audiodateien, insgesamt 12 Dateien. Omni: Bilder und bis zu 3 kurze Clips, kein Audio. Wan: bis zu 10 Bilder, 5 Clips, 5 Audiodateien, 20 Dateien.
MiniMax H3: warum ist der Prompt ein Dokument?
Weil H3 keine Bildbeschreibung will, sondern drei benannte Felder – integrated_multimodal_description, overall_soundscape, non_diegetic_music – und zwar jedes Mal alle drei. Lässt du ein Audiofeld weg, wird das Modell nicht stumm; es erfindet. Die Kamera ist Prosa aus zwölf festen Verben und vier Modifikatoren („The camera pushes in with small amplitude at slow speed toward…“), Schnitte werden auf die Millisekunde gesetzt („[Shot 2] At 00:03.500, the camera cuts to…“), Dialog steht in einem Tag mit seiner Sprache: <d>[English] I get off at the next station.</d>. Ein Eigenname – ein Star, ein Film, eine Marke – blockiert die gesamte Anfrage. Kamerabefehle in eckigen Klammern aus der älteren Hailuo-Linie sind hier tote Syntax.
Stärke: durchgeschriebene Sequenzen mit mehreren Einstellungen und Dialog, und Referenzpakete, die Gesicht und Stimme zugleich festlegen.
Gemini Omni 1.1: warum muss eine Bildbeschreibung um eine einzige Einstellung bitten?
Weil Omni von sich aus schneidet. Das Modell ist vom Temperament her das Gegenteil von H3: Eine Bildbeschreibung von rund 45 Wörtern in schlichter Prosa ist der ideale Prompt, den Rest der Welt füllt es selbst. Die Falle: Bittest du um eine Einstellung am Seeufer, bekommst du womöglich eine Montage aus drei. Jeder Prompt für eine durchgehende Einstellung braucht im ersten Satz eine Kontinuitätsklausel („In a single unbroken scene…“). Der Ton steht in einem eigenen Satz hinter „Sound design:“, Musik muss ausdrücklich verlangt werden, und Dialog wird mit Doppelpunkt geschrieben – ohne Anführungszeichen, denn Anführungszeichen brennen die Wörter als Bildtext ins Bild. Ein Negativfeld gibt es nicht; Ausschlüsse sind knappe Fragmente am Ende („No dialogue. No text overlay on screen.“). Bearbeitungen bestehen aus einem Teilsatz plus „Keep everything else the same.“
Stärke: schnelle, günstige, natürlich wirkende Clips; Bearbeitung per Anweisung; das Verlängern eines Clips, den du schon hast.
Wan 3.0: was ist die additive Formel?
Alibaba veröffentlicht den Prompt als Formel, und das Modell liest ihn in genau dieser Reihenfolge: Entität + Szene + Bewegung, dann Ästhetik + Stilisierung, dann Ton (Stimme = Text + Emotion + Tonfall + Tempo + Klangfarbe + Akzent; Geräusch = Quelle + Aktion + Atmo; Musik = Score + Stil), dann mehrere Einstellungen als „Shot 1 [0–3 s] … Shot 2 [4–6 s] Hard cut transition, fixed camera…“. Hochgeladene Medien werden beim Namen genannt und wie ein Substantiv benutzt: „The cat in Image 1 plays in the room in Image 2.“ Die eigene Verbotsliste ist kurz und lohnt das Auswendiglernen: keine realen Personen beim Namen, keine schnellen Szenenwechsel innerhalb eines Clips, keine Einstellung, die auf exaktem Text oder wortgenauer Lippensynchronisation aufbaut.
Stärke: lange Clips (30 s), gemischte Referenzpakete mit Audio und Dialog auf Chinesisch.
Die Regel, an der jedes scheitert
- H3: Lass ein Audiofeld weg. Du bekommst erfundenen Ton, keine Stille.
- Omni: Vergiss die Kontinuitätsklausel. Du bekommst Schnitte.
- Wan: Nenn eine reale Person. Die Anfrage schlägt fehl.
Welches soll ich nehmen?
Eine Dialogszene mit festem Ensemble: H3. Ein schneller Entwurf oder die Bearbeitung von etwas, das schon existiert: Omni. Ein langer Clip oder ein Referenzpaket mit Stimme: Wan 3.0. Alle drei Leitfäden stehen auf den Modellseiten – MiniMax H3, Gemini Omni, Wan – und der Arbeitsbereich wendet sie an, sobald der Leitfaden eingeschaltet ist. Wie die Credit-Preise oben zustande kommen, erklärt Wie funktionieren Credits und was kostet eine Generierung?.
Fragen
Welches ist am günstigsten?
Für einen kurzen Clip in der Basisauflösung: Wan 3.0 ab 2.000 Credits (5 s), MiniMax H3 ab 2.080 Credits (8 s), Gemini Omni 1.1 ab 2.200 Credits (10 s). Pro Sekunde ist Omni in seiner Standardeinstellung das günstigste der drei.
Welches hält eine Figur über mehrere Einstellungen?
Alle drei nehmen Referenzmedien an. Wan 3.0 akzeptiert bis zu 20 Dateien inklusive Audio; H3 nimmt bis zu 12 mit Bildern, Clips und Stimmen; Omni nimmt Bilder und kurze Clips, aber kein Audio.
Welches lässt sich nachträglich bearbeiten?
Omni 1.1 hat auf LUVI eine Variante für die Videobearbeitung, Wan 3.0 ebenfalls (Linie 2.7); H3 nicht – dort generierst du neu.