Sechs Wege, auf LUVI ein Gesicht sprechen zu lassen – und der Unterschied, der den Preis bestimmt

LUVI hat sechs Lipsync-Familien, und sie erledigen zwei verschiedene Aufgaben: Vier animieren ein Standbild aus einer Tonspur, zwei synchronisieren den Mund in einem Video, das du schon hast. Welche Aufgabe es ist, entscheidet auch, welche Uhr abgerechnet wird.

Veröffentlicht:

Links steht in einem dunklen Studio ein gerahmtes Porträt, in das eine bernsteinfarbene Klangwelle läuft; rechts zieht ein Streifen mit Einzelbildern desselben Gesichts über eine Schiene, während darunter eine türkise Welle entlanggleitet, und dazwischen liegt eine Stoppuhr.

Im LUVI-Katalog stehen sechs Lipsync-Familien, und der häufigste Fehler ist, eine davon für eine Aufgabe zu wählen, die sie nicht erledigt. Vier nehmen ein Standbild und eine Tonspur und animieren das Gesicht. Zwei nehmen ein bereits vorhandenes Video und synchronisieren dessen Mund neu auf eine andere Tonspur. Die eine Gruppe ersetzt die andere nicht, und in welcher du bist, entscheidet zugleich, gegen welche Uhr deine Credits gezählt werden.

Welche Aufgabe hast du?

Schau, was du in der Hand hast. Ein Foto führt in die erste Gruppe, ein Clip von jemandem, der spricht, in die zweite.

Porträt plus Ton, animiert zum sprechenden Video:

  • OmniHuman 1.5: das Modell von ByteDance, Ton bis 60 Sekunden. Die Autoren beschreiben es über die Mundbewegung hinaus: Es liest den semantischen Kontext des Tons, geht über bloße Lippensynchronität hinaus und lässt Figuren echte emotionale Wechsel zeigen und ihre Gesten zu Worten und Absicht passen.
  • VEED Fabric 1.0 und die schnelle Variante: Ton von einer Sekunde bis 300, mit Auflösungsstufen.
  • InfiniteTalk: die Langform-Option, mit Ton bis zu zehn Minuten, in 480p oder 720p.
  • Kling Avatar, in einer Standard- und einer Pro-Stufe, gedacht für Profilclips, Intros und Social Posts.

Vorhandenes Video plus neuer Ton, Lippen neu angetrieben:

  • Sync Lipsync v3: das Modell von sync.so, für Synchronisation und Voice-over, Video bis 60 Sekunden.
  • VEED Lipsync: der günstige Synchronweg, ebenfalls auf 60 Sekunden Video begrenzt.

Welche Uhr bezahlst du?

Das ist der überraschende Teil. In der ersten Gruppe läuft der Zähler über den Ton, in der zweiten über das Video. Dem Sinn nach dieselbe Arbeit, zwei verschiedene gemessene Größen.

Bei fünf Sekunden, geprüft am 22. September 2026, ist die Spanne groß:

  • VEED Lipsync: ab 130 Credits.
  • InfiniteTalk: ab 60 Credits pro Generierung.
  • OmniHuman 1.5: ab 1200 Credits.
  • VEED Fabric 1.0: ab 1650 Credits, in der schnellen Variante ab 2200.
  • Sync Lipsync v3: ab 2200 Credits.

Daraus folgen zwei praktische Dinge. Erstens: Einen vorhandenen Clip über VEED Lipsync zu synchronisieren ist eine Größenordnung billiger, als ein Porträt auf denselben Text neu zu animieren – wenn du das Material schon hast, nutz es. Zweitens: Bei den Porträtmodellen ist die Länge deiner Sprachspur die Länge deiner Rechnung, zwei Sekunden Stille am Anfang wegzuschneiden ist also eine echte Ersparnis, und bei OmniHuman ist genau das die Größe, die der Zähler misst.

Wie lang darf die Eingabe sein?

Die Obergrenzen unterscheiden sich stärker, als die Preise vermuten lassen, und es sind harte Grenzen des Eingabeplatzes, keine Empfehlungen.

  • 60 Sekunden: OmniHuman 1.5 (Ton), Sync Lipsync v3 (Video), VEED Lipsync (Video).
  • 300 Sekunden: VEED Fabric 1.0 und Fabric 1.0 Fast (Ton).
  • Zehn Minuten: InfiniteTalk (Ton).

Läuft dein Text über eine Minute, schrumpfen sechs Optionen allein durch diese Zeile auf drei. Läuft er über fünf Minuten, bleibt eine.

Was gibst du ihnen genau?

Jedes davon nimmt genau zwei Eingaben, und die Plätze sind typisiert: Der Bildplatz nimmt kein Video, und der Tonplatz ist Pflicht.

  • Die Porträtgruppe will ein klares, frontales Gesicht. Dieselbe Disziplin, die aus einem Foto ein brauchbares 3D-Mesh macht, hilft hier: gleichmäßiges Licht, kein harter Schatten quer über dem Mund, nichts, was die Kieferlinie schneidet.
  • Die Videogruppe will einen sprechenden Kopf, der schon ungefähr zu etwas synchron ist. Die Lippen einer Einstellung neu anzutreiben, in der die Person weggedreht oder halb aus dem Bild ist, ist die übliche Ursache für ein Ergebnis, das aufgeklebt wirkt.
  • OmniHuman nimmt einen optionalen Textprompt zur Feinsteuerung, InfiniteTalk ebenfalls und zusätzlich einen Seed und eine Auflösungswahl. Die beiden videogetriebenen Modelle nehmen gar keinen Prompt – die Anweisung ist der Ton.

Was wir geprüft haben

  • Modelle: bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video und die schnelle Variante, veed/lipsync, sync/lipsync-v3, die InfiniteTalk-Variante und die Avatar-Varianten von Kling v2.6.
  • Gelesene Quellen: je Variante die Referenzplätze, die Grenzen der Eingabedauer, die Parameter und der Preis, entnommen sowohl dem Katalog-Code der App als auch den öffentlichen Modellseiten.
  • Datum: 22. September 2026.
  • Ergebnisse: Die Startbeträge oben stimmten für jede Familie in beiden Quellen überein. Die Dauergrenzen stammen aus den Platzdefinitionen: 60 Sekunden bei OmniHuman, Sync und VEED Lipsync, 300 bei VEED Fabric, zehn Minuten bei InfiniteTalk.
  • Grenzen: Für diesen Beitrag wurde nichts generiert, er behauptet also nichts über Synchronqualität oder Ähnlichkeit. Die Beträge sind Untergrenzen: Bei den sekundenweise abgerechneten Familien kostet längerer Ton oder längeres Video mehr – schau vor einer langen Aufnahme auf die Schätzung im Arbeitsbereich.

Welches soll ich nehmen?

  • Du hast Material und brauchst es in einer anderen Sprache. Zuerst VEED Lipsync, wegen der Kosten; Sync Lipsync v3, wenn der Mund einer Großaufnahme standhalten muss.
  • Du hast ein Foto und einen kurzen Text. OmniHuman 1.5, wegen der Gestik- und Ausdrucksarbeit, die die Autoren beschreiben, nicht nur wegen der Mundbewegung.
  • Du hast ein Foto und einen langen Text. InfiniteTalk, denn nur dieses Modell nimmt zehn Minuten Ton in einem Durchgang.
  • Du brauchst eine Serie kurzer Social-Clips aus einem Porträt. Kling Avatar oder VEED Fabric, und prüf vor dem Einreihen die Schätzung für deine genaue Länge.

Auf LUVI stehen sie im Arbeitsbereich wie jedes andere Modell: auswählen, die beiden Plätze füllen, und die Credit-Schätzung erscheint vor dem Start. Wenn du die Sprachspur erst noch bauen musst, erledigen das die Audiomodelle im selben Konto, und die ganze Kette lässt sich als Workflow bauen oder aus Claude heraus über den LUVI-Connector steuern.

Neu hier? Leg ein LUVI-Konto an und teste mit fünf Sekunden Ton, bevor du einen ganzen Text einsetzt.

Quellen

  • OmniHuman-1.5 – OmniHuman Lab, Projektseite (auf Englisch). Abgerufen am 22. September 2026.
  • sync.so – sync.so, Produktseite (auf Englisch). Abgerufen am 22. September 2026.
  • VEED – VEED, Produktseite (auf Englisch). Abgerufen am 22. September 2026.

Mehr aus Vergleiche