Sprechende Avatare und Lippensynchronisation
Lass ein Porträt aus einem Bild und einer Audiodatei sprechen oder gib einem vorhandenen Video mit Modellen für Lippensynchronisation eine neue Stimme.
Was dieses Video zeigt
In LUVI kannst du Porträts sprechen lassen oder einem Video eine neue Stimme geben. Beides machen Modelle für Lippensynchronisation.
Such in der Modellliste nach „lipsync“. Modelle mit Bild und Audio erzeugen einen sprechenden Avatar, Modelle mit Video passen dessen Lippen an eine neue Stimme an.
Wir beginnen mit einem sprechenden Avatar. Hier nutzen wir OmniHuman 1.5.
Unter Referenz öffnen sich zwei Slots: einer fürs Bild, einer für die Audiodatei. Beide sind Pflicht.
Nimm fürs Bild ein Porträt mit gut sichtbarem Gesicht. Klick es in der Bibliothek mit rechts an und wähl Als Referenz verwenden (Use as Reference).
Noch keine Audiodatei? Erstell eine in LUVI mit einem Text-to-Speech-Modell – so ist dieser Satz entstanden. Das Audio kommt genauso in seinen eigenen Slot.
Das Video ist so lang wie das Audio, OmniHuman nimmt davon bis zu 60 Sekunden. Der Preis richtet sich nach Audiosekunden und erscheint, sobald beide Slots belegt sind.
Beschreib im Prompt Emotion, Tempo und Vortragsstil. Wir wollten einen warmen Ton, ein Lächeln und den Blick in die Kamera.
Klick auf Generieren (Generate). Das Ergebnis landet in deiner Bibliothek: ein Video, das mit deinem Audio spricht.
Jetzt geben wir demselben Video eine neue Stimme, etwa eine türkische. Dafür nehmen wir Sync Lipsync; VEED Lipsync ist günstiger.
Hier gibt es Slots für ein Video und eine Audiodatei, aber keinen Prompt. Leg Video und neues Audio hinein; beide dürfen bis zu 60 Sekunden dauern.
Auch hier richtet sich der Preis nach den Audiosekunden. Klick auf Generieren, und die Lippen werden neu an das Audio angepasst.
Kurz gesagt: Bild und Audio für einen sprechenden Avatar, Video und Audio für eine neue Stimme – und der Preis folgt der Audiolänge.
Weitere Videos aus „Einen Schritt weiter“
Alle Tutorials
1:43Tutorial 14Bilder bearbeiten
Bearbeite ein Bild per Bearbeitungsmodell: Leg es in den Referenz-Slot, sag, was sich ändern und was bleiben soll, behalte das Seitenverhältnis und kombiniere mehrere Bilder.
1:31Tutorial 15aDein erster Workflow
Bau deine erste Kette im Workflow: Füge Knoten hinzu, wähl Modelle, verbinde ein Bild mit einem Video, prüf den Preis und führ die Kette aus.
1:50Tutorial 15bBatch-Generierung im Workflow
Führ eine Kette mit vielen Eingaben aus – mit Batch, Dice und Stack – und sieh, wie sich jeder dieser Knoten auf den Preis auswirkt.
1:49Tutorial 15cWorkflow-Operatoren
Bring den Text in Form, bevor er den Generator erreicht – mit den Operatoren Merge, Caption, Style und Pose.
1:49Tutorial 15dWorkflow-Läufe steuern
Der Preflight-Check, Teile eines Graphen ausführen, Gruppen, Abbrechen, Workflows speichern und die Panels rechts neben der Arbeitsfläche.
1:24Tutorial 16aKI-Voice-over
Mach in LUVI aus Text gesprochene Sprache: Wähl ein Voice-over-Modell und eine Stimme, stell Stabilität und Sprache ein und generiere.
1:26Tutorial 16bKI-Musik
Erstelle in LUVI mit MiniMax Music 2.6 Hintergrundmusik oder einen kompletten Song mit deinem eigenen Songtext.
1:06Tutorial 16cAudio transkribieren
Mach mit xAI STT v1 aus einer Aufnahme Text – bei Bedarf mit Sprecherzuordnung und Füllwörtern.
1:23Tutorial 18a3D-Modelle generieren
Mach mit Hunyuan 3D oder HI3D aus einem Bild oder einer Beschreibung ein 3D-Modell und sieh, wie zusätzliche Ansichten und Parameter das Ergebnis prägen.
1:17Tutorial 18b3D-Viewer und Download
Sieh dir dein 3D-Modell im Viewer an – mit Objektiven, Beleuchtung, Drahtgitter- und Texturansicht – und lade es anschließend als GLB herunter.