Hangi modeller videoyla birlikte ses üretir?

Seedance 2.0 ve 2.5, Veo 3.1, Gemini Omni, MiniMax H3, HappyHorse, FLUX 3 Video, Grok Imagine Video ve Kling 3 ses bandını görüntüyle aynı geçişte üretir — diyalog, efekt, ortam sesi ve müzik — ancak sesin varsayılan olarak açık olması ve ek ücret alması bakımından farklılaşır.

Son güncelleme:

Ortak ses-video aileleri

AileVarsayılan sesFiyata etkisiSes nasıl istenir
Seedance 2.0 / 2.5açıkdahilprompt'ta türlü ses kanalları
Veo 3.1kapalıstandart ×2, Fast ×1,2, Lite'ta ses yokgenerate_audio'yu açın, sesi tarif edin
Gemini Omni 1.1açık, anahtar yokdahildüz yazıyla tarif edin
MiniMax H3her zaman açıkdahildiyalog etiketleri ve bir ses ortamı satırı
HappyHorse 1.0 / 1.1açıkdahilkelimelerle adlandırılmalı, yoksa neredeyse sessiz
FLUX 3 Videoaçık, kapatılabilirdahilkonuşma satırları için görünür bir konuşmacı gerekir
Grok Imagine Videoher zaman açıkdahilsesi adlandırın, olumsuzlama yok sayılır
Kling 3 (v3.0, O3)açıksatıra göre değişir, tahminde gösterilirdiyalog için konuşmacı etiketleri

Bu ailelerin her birinin model sayfasında prompt rehberi vardır; aralarında en çok farklılaşan kısım ses söz dizimidir.

Üretmeden önce bilinmesi gereken üç şey

  1. Sessizlik bir cümle değil, parametredir. Prompt'a "müzik yok" yazmak bir modeli susturmaz; Grok ve H3'te yok sayılır, diğerlerinde müziği çağırabilir. Anahtar varsa anahtarı kullanın.
  2. Diyalog görünür bir konuşmacı ister — FLUX 3 Video'da zorunlu, diğer her yerde en iyi böyle çalışır; ekranda kimse yokken tırnak içindeki bir satır ekran yazısı olarak çıkabilir.
  3. Veo istemezseniz sessiz gelir. Fiyatı değiştirdiği için LUVI'de ses anahtarı kapalıdır; açtığınızda tahmin güncellenir.

Önce ses alternatifleri

Belirli bir sese ihtiyacınız varsa konuşmayı bir metinden konuşma modeliyle (ElevenLabs, Gemini TTS, MiniMax Speech, Grok Speech) üretin ve onunla bir dudak senkronu modelini sürün. O zaman fiyatı sesin uzunluğu belirler.

Sık sorulanlar

Sesi kapatabilir miyim?

Yalnızca modelde bir anahtar varsa: Veo ve FLUX 3 Video'da generate_audio var. H3, Grok video ve Gemini Omni her zaman ses üretir; Seedance'ta ses kanalını prompt'un dışında bırakırsınız.

Klibim neden neredeyse sessiz geldi?

Bu modellerin çoğu sesin prompt'ta adlandırılmasını ister. Özellikle HappyHorse, ses satırı yazılmazsa neredeyse sessiz döner; ailenin prompt rehberi söz dizimini gösterir.

Bunun yerine gerçek bir ses kaydı ekleyebilir miyim?

Evet — OmniHuman, VEED ve sync gibi dudak senkronu modelleri kendi ses dosyanızı alır ve ağzı ona göre canlandırır.

Diğer sorular