Hangi LUVI video modelleri ses üretiyor: her birinin istediği tek cümle
LUVI'deki video modellerinin çoğu artık sesi görüntüyle aynı geçişte üretiyor, ama geri kalan her şeyde ayrışıyorlar: anahtar açık mı geliyor, açmak para ekliyor mu ve sesi nasıl yazmanız gerekiyor. Her ailenin ses anahtarı ve ses sözdizimi, şemalarına bakılarak çıkarıldı.

LUVI kataloğundaki video ailelerinin çoğu artık kendi sesini üretiyor: diyalog, efekt, ortam sesi ve müzik görüntüyle aynı geçişte çıkıyor. Ortak olmayan şey, bunu nasıl isteyeceğiniz. Bazıları ses anahtarı açık gelir, biri kapalı gelir ve açınca fiyatı artırır, birkaçında ise anahtar hiç yoktur; yani bir şey duyup duymayacağınıza tek başına prompt karar verir. Google DeepMind'ın kendi Veo rehberi genel kuralı açıkça koyuyor: “Explicitly define the sounds you want to hear, to match the audio to your visuals” (duymak istediğiniz sesleri açıkça tanımlayın). Bu yazı o cümlenin aile aile karşılığı.
Hangi modellerde ses anahtarı hiç yok?
Beş ailede LUVI'de hiçbir ses parametresi görünmüyor, dolayısıyla ne duyacağınıza tamamen prompt karar veriyor: MiniMax H3, Grok Imagine Video, Gemini Omni 1.1 Flash, HappyHorse ve Veo 3.1 Lite. Bunların dördü her zaman ses üretir. Veo 3.1 Lite ise ters yönden istisna: açılacak bir ses parametresi yok.
“Anahtar yok” hepsinin aynı davrandığı anlamına gelmiyor ve ses cümlesini yazmayı unuttuğunuzda fark ortaya çıkıyor:
- HappyHorse neredeyse sessiz bir klip döndürür. Sesi gördüğünden çıkarmaz.
- MiniMax H3 ses uydurur. Boş bırakılan ses alanı doldurulur, sessiz bırakılmaz.
- Grok Imagine Video ya sessizlik ya rastgele ses verir ve ikisini de isteyebileceğiniz bir yol yoktur.
Aynı eksiğin üç ailede üç farklı cezası var.
Ses varsayılan olarak açık mı, açmak para ekliyor mu?
Altı aile anahtar açık gelir ve ölçtüklerimizde bu fiyatı değiştirmiyor. Seedance 2.5, Wan 3.0, FLUX 3 Video, Kling, PixVerse ve Vidu Q3 varsayılan olarak sesi açık getirir. İkisi bunu parametrenin kendi açıklamasında söylüyor: Seedance 2.5'in generate_audio alanı “Does not affect price”, Wan 3.0'ın audio alanı ise “Same price either way” diyor. İkisini de canlı tahminle karşılaştırdık: 720p'de beş saniyelik bir Seedance 2.5 klibi ses açıkken 3.030 kredi, kapalıyken de 3.030 kredi; 720p'de beş saniyelik bir FLUX 3 Video klibi iki durumda da 1.870 kredi.
Veo iki konuda da istisna. generate_audio parametresi varsayılan olarak kapalı gelir ve kendi açıklaması sesin “saniye başına maliyeti artırdığını” söyler. 720p'de sekiz saniyelik bir Veo 3.1 Fast klibi ses kapalıyken 1.280 kredi, açıkken 1.536 kredi olarak tahmin ediliyor (22 Eylül 2026'da kontrol edildi). Yani “zaten müziğiyle birlikte gelen” model, sessiz gelen ve sesi açtığınızda ek ücret alan tek aile.
Varsayılanı açık olan bir ailenin içinde bir de tuzak var. Kling'in Omni O3 modlarında sound alanı metinden video ve görselden video için true, ama referanstan video için false; üstelik o modda referansın kendi sesi için ayrı bir keep_original_sound alanı bulunuyor. Bir Kling referans planı sessiz geldiyse sebebi budur.
Bir aile de yalnızca görüntü üretir: Hailuo'da diyalog, ses tasarımı ve müzik yoktur, dolayısıyla bir Hailuo prompt'unda sese harcadığınız her kelime boşa gider.
Her aile sesi nasıl yazmanızı istiyor?
Lehçelerin en çok ayrıştığı yer burası. Aşağıdakilerin hepsi LUVI'nin her aile için çalıştırdığı prompt rehberlerinden geliyor.
- Veo 3.1. Ses etiketlenerek sahnenin içine yazılır: replik tırnak içinde ve konuşana bağlı,
SFX: thunder cracks in the distance,Ambient noise: the quiet hum of a starship bridge, müzik düz cümleyle. Sessizlik içerik olarak yönlendirilebilir: “no music, only the wind”. - Seedance 2.5. Tipli kanallar, karakter genişlikleri birebir şu şekilde: müzik tam genişlikte
(…), efektler ASCII<…>, diyalog ASCII{…}, ekran altyazısı köşeli【…】. Ortam sesi düz cümlede yer alır. - MiniMax H3. Alanlı bir belge.
overall_soundscape:venon_diegetic_music:alanlarının ikisi de mutlaka yazılır; boş bırakılan alan uydurulmuş sesle doldurulur. Diyalog etiketli bir blok:<d>[English] I get off at the next station.</d>. - Gemini Omni 1.1 Flash.
Sound design: …etiketinin arkasında tek cümle; efekt, ortam ve diyalog hepsi orada. Müzik ayrıca istenmek zorunda ve türüyle değil kaynağı ve işlenişiyle tarif edilir: “a low tinny radio broadcast in the background, playing a song”. - FLUX 3 Video. Dört katman: konuşma, ortam, görünen bir harekete bağlı efekt, ve mikstteki yeri belirtilmiş müzik. Genelde bir ya da iki tanesi doğrudur; kalabalık miks belgelenmiş bir hatadır.
- HappyHorse. Üç kademeli, adı konmuş bir ses cümlesi: ön plan (diyalog, ana efekt), orta katman (görünen bir şeye bağlı Foley), arka plan (ortam, oda tonu, müzik).
- Wan 3.0. Ses maddesi toplamalı formülün en sonunda gelir ve üçe ayrılır: konuşma, efekt, fon müziği. Üçü de sıralanmaz, tarif edilir.
- Vidu Q3 ve PixVerse. Ses, onu doğuran görüntünün yanında içerik olarak yazılır:
audio includes soft room tone and faint spoon clink.
Tırnak işaretleri neden bazı modellerde tam tersini yapıyor?
Çünkü bu ailelerin ikisinde tırnak işareti, kelimeleri ağza değil ekrana koyma talimatıdır ve ikisi de tipografide bunu gerçek bir riske dönüştürecek kadar iyidir.
Gemini Omni 1.1 Flash'ta diyalog iki nokta üst üste ile ve tırnaksız yazılır: In a crisp, thoughtful tone, Clara says: It has to be here. Tırnak işareti burada görünmesi istenen yazıya ayrılmıştır, mesela üzerinde bir şey yazan bir tabelaya. Veo alışkanlığını buraya taşımak, repliğin altyazıya dönüşmesinin yoludur.
FLUX 3 Video'da tırnak doğrudur, ama yalnızca kadrajda konuşan biri varken. Söyleyecek kimsenin görünmediği ve “voiceover” ya da “narration” denmemiş bir tırnak içi cümle, görüntünün üzerine basılmış yazı olarak çıkabilir. Bu da Black Forest Labs'in FLUX 3 için “tipografiyi sahnenin doğal bir parçası olarak işler” demesinin doğal sonucu.
Diğer her yerde (Veo, Kling, Wan, Vidu Q3, HappyHorse) tırnak içi cümle konuşmadır. Kling, kimin ağzını oynatacağını bilmek için önce fiziksel hareketi ister; Wan ise sesin tonunu repliğin etrafında tarif etmenizi bekler. İki Google modelinin birbirinin tersi iki kuralı, bu listede yanlış yapması en pahalı şey.
Sessizliği nasıl istersiniz?
Her aile bunu farklı cevaplıyor ve “sessizlik” kelimesini yazmak hiçbirinde doğru değil.
- Parametreyle. Veo, Seedance 2.5, Wan 3.0, FLUX 3, Kling, PixVerse ve Vidu Q3'te bir anahtar var. Güvenilir yol bu.
- Kanalı hiç açmayarak. Seedance 2.5'te müzik istemiyorsanız
()kanalını yazmazsınız, “müzik olmasın” demezsiniz. - Değeri birebir yazarak. MiniMax H3'te sessizlik, müzik alanına
N/Ayazmaktır. Alanı boş bırakmak ses uydurtur. - Cümleyle. Wan bastırmayı sonda cümleyle yapar (“No dialogue.” “No background music.”), Gemini Omni ise çıplak parçaları en sona koyar: “No dialogue.” “No music, just realistic real world sound.”
- Hiçbir şekilde. Grok Imagine Video'da sessizlik bayrağı yok. Ondan sessiz bir klip gerekiyorsa sesi sonradan ayırırsınız.
Hepsinde geçerli tek kural şu: anahtarı olan bir modelde sessizliği düz cümleyle istemek cızırtı ya da ölü hava üretme eğilimindedir, çünkü ses modelinden hâlâ bir şey üretmesini istiyorsunuzdur. Kısmi sessizlik başka bir şey ve her yerde içerik olarak yazılabilir: “for the final two seconds, only rain against the window.”
Neyi doğruladık
- Modeller: Veo 3.1, 3.1 Fast ve Lite; Seedance 2.5; Wan 3.0; FLUX 3 Video; Kling v3.0 ve Omni O3; PixVerse v6 ve c1; Vidu Q3; MiniMax H3; Gemini Omni 1.1 Flash; HappyHorse 1.1 ve Hailuo ailelerinin canlı metinden video, görselden video ve referanstan video modları.
- Okunanlar: bu modların parametre şemaları ve varsayılan değerleri, LUVI'nin her aile için çalıştırdığı prompt rehberleri ve aşağıda bağlantısı verilen Google sayfaları.
- Tarih: 22 Eylül 2026. Kredi rakamları metinde belirtilen ayarlarla LUVI'de alınan canlı tahminlerden geliyor.
- Sonuçlar: Seedance 2.5, 720p'de beş saniye, ses açık ve kapalı, iki durumda da 3.030 kredi; FLUX 3 Video aynı koşullarda iki durumda da 1.870 kredi; Veo 3.1 Fast, 720p'de sekiz saniye, ses kapalı 1.280 kredi, açık 1.536 kredi.
- Eksikler: Bu yazı için yeni bir üretim yapılmadı, dolayısıyla çıktı kalitesi hakkında bir iddiası yok. Yukarıdaki varsayılanlar ve fiyatlar bir anlık görüntü; üretmeden önce Çalışma Alanı'ndaki tahmine ve parametre paneline bakın, çünkü sağlayıcı varsayılanı değiştirebilir.
Hangisini seçmeli?
Görüntüden değil, sesin ne yapması gerektiğinden başlayın.
- Belirli sözleri söyleyen bir karakter için, diyalog kuralına harfiyen uyacağınız bir aile seçin: tırnaklı replik, adı konmuş efekt ve ortam sesi istiyorsanız Veo 3.1; replik Mandarin, Kantonca, Japonca, Korece, Almanca veya Fransızca ise ve fonem düzeyinde dudak senkronu gerekiyorsa HappyHorse; konuşanı, ortam sesini ve müziği ayrı alanlarda tutmak istiyorsanız MiniMax H3.
- Türkçe konuşma gerekiyorsa seçenek daralıyor: FLUX 3 Video'nun model açıklaması Türkçeyi desteklediği dillerin arasında sayıyor, MiniMax H3'ün kararlı dil listesinde ise Türkçe yok; orada repliği ağza koymak yerine anlamı görüntüyle verip Türkçeyi ses yatağına yerleştirmek daha güvenli.
- Sözsüz bir planın altındaki atmosfer müziği bir müzik yönergesi ve mikstteki yerinin belirtilmesini ister. FLUX 3 Video'da bu tercih değil zorunluluk: yalnızca ortam ve efektten kurulu bir miks duyulmazlığa doğru kayar.
- Görünen bir harekete oturan efektler her yerde çalışır ve en iyi, sesi tek başına adlandırmak yerine kameranın gördüğü şeye bağladığınızda çalışır.
- Sesini kendiniz döşeyeceğiniz bir klip için prompt cümlesini değil anahtarı kullanın ve muhtemelen Grok Imagine Video'dan uzak durun, çünkü orada anahtar yok.
Çalışma Alanı'nda tüy düğmesi, seçili modelin lehçesini uygular; bir ailenin ses sözdizimini diğerine taşımayı bırakmanın en hızlı yolu bu: tüy düğmesi ne işe yarar ve prompt rehberi nedir. Manueli Claude veya ChatGPT üzerinden, LUVI bağlayıcısıyla da isteyebilirsiniz.
Yeni misiniz? LUVI hesabı açın ve ses cümlenizi seçtiğiniz ailenin en ucuz kısa klibinde deneyin.
Kaynaklar
- How to create effective prompts with Veo 3 – Google DeepMind, prompt rehberi (İngilizce). Erişim tarihi: 22 Eylül 2026.
- Ultimate prompting guide for Veo 3.1 – Google Cloud, blog (İngilizce). Erişim tarihi: 22 Eylül 2026.
- Generate videos with Veo 3.1 in Gemini API – Google AI for Developers, API belgeleri (İngilizce). Erişim tarihi: 22 Eylül 2026.
Devamı Karşılaştırmalar
- LUVI'de bir yüzü konuşturmanın altı yolu ve fiyatı belirleyen tek farkLUVI'de altı lip-sync ailesi var ve bunlar iki ayrı iş yapıyor: dördü durağan bir portreyi ses dosyasından canlandırıyor, ikisi elinizde zaten olan bir videonun ağzını yeniden senkronluyor. Hangi işi yaptığınız aynı zamanda hangi sürenin faturalandığını da belirliyor.
- Negatif prompt neredeyse yok oldu: bir şeyi onsuz nasıl dışlarsınızLUVI kataloğundaki 224 modelin yalnızca dördünde negatif prompt alanı var ve dördü de Qwen Image ailesinden. Alan kayboldu çünkü dayandığı örnekleme yöntemi kayboldu. Her ailede onun yerine ne yazılır ve “no X” yazmanın hâlâ işe yaradığı üç yer.
- Claude ya da ChatGPT'den üretim: Higgsfield, Krea, OpenArt ve LUVI'nin MCP bağlayıcılarını karşılaştırdıkHiggsfield, Krea, OpenArt ve LUVI Creator, Claude ya da ChatGPT'nin sizin hesabınızda üretim yapmasını sağlayan MCP bağlayıcılarını kendi sunucularında çalıştırıyor. Farkları üç noktada: fiyatı üretimden önce görüp görmemeniz, sunulan model sayısı ve asistanın her modelin prompt rehberine erişimi.