HappyHorse prompt'u nasıl yazılır: sesi yazmazsanız klip sessiz geliyor
HappyHorse görüntüyle sesi birlikte üretir ama sesi gördüğünden çıkarmaz: ses cümlesi olmayan bir prompt neredeyse sessiz bir video döndürür. Ayrıca zaman kodlu planlara uyan az sayıdaki video modelinden biri, yani Seedance 2.5'teki kuralın tam tersi geçerli.

HappyHorse, Alibaba'nın görüntüyle sesi tek geçişte üreten modeli: diyalog, efekt ve ortam sesi kareyle birlikte çıkar, dudak senkronu da fonem düzeyinde çalışır. LUVI'de metinden video, görselden video, referanstan video ve video düzenleme modlarıyla çalışıyor; 720P veya 1080P, üç ile on beş saniye arası. Faturalandırma saniye başına, bu yüzden kredi tahmini siz üretmeden önce Çalışma Alanı'nda görünür ve 1080P'nin saniye maliyeti 720P'den yüksektir. Bu modelin manuellerimizde başka hiçbir ailede geçmeyen iki kuralı var ve insanların modelden erken vazgeçmesinin sebebi tam olarak bu ikisi.
Klip neden neredeyse sessiz geldi?
HappyHorse sesi gördüğünden çıkarmaz. Fırtınayı kusursuz tarif eden ama sesi adlandıran bir cümle taşımayan bir prompt, neredeyse sessiz bir video döndürür; çünkü ses görüntüden değil kelimelerden üretilir. Bu çoğu kişiyi şaşırtıyor, çünkü üreticinin kendi metinden video API belgesinde ses konusunda hiçbir yönlendirme yok: örnek prompt yalnızca görüntüyü anlatıyor, kartondan yapılmış bir şehirden geçen bir tren.
Bu yüzden bu aile için tuttuğumuz manuel her düzeltmeye bir ses cümlesi koyar ve bunu söz verme değil içerik olarak yazar. Sahnenin ihtiyacına göre üç katman kullanın.
- Ön plan: diyalog ve sahnenin asıl meselesi olan tek efekt.
- Orta katman: görünen bir harekete bağlı Foley sesleri: ayak sesi, cızırtı, su, kumaş.
- Arka plan: ortam sesi, oda tonu, müzik.
Bunu kendi cümlesi olarak yazın: Audio: rain on the awning, distant traffic, no music. Dışlamaları cümlenin sonuna kısa ve somut biçimde ekleyebilirsiniz ve bu modelde işe yarar: “no music”, “no dialogue”, “no people in frame”.
Dudak senkronu tutacak repliği nasıl yazarsınız?
Repliğe dil etiketi verin, tırnak içine alın ve İngilizce olmayan bir cümleyi kendi alfabesiyle yazın. Dudak senkronu fonem düzeyinde çalışır ve gerçek yazı üzerinde eğitilmiştir; yani bir cümleyi okunuşuyla yazmak senkronu bozar. Prompt'un dili konuşmayı belirlemez, belirleyen şey etiket ve tırnak içindeki metindir.
A young woman in a red coat stands under a shop awning at night and looks straight into the camera, neon reflections on the wet pavement, one slow push-in. She says in German, "Der letzte Bus ist schon weg." Audio: rain on the awning, distant traffic, no music.
Hangi dillerin gerçekten senkron tuttuğu konusunda kaynaklar ayrışıyor ve bu Türkçe için doğrudan önemli. LUVI'nin bu aile için tuttuğu manuel 1.0 için yedi dil sayıyor: İngilizce, Mandarin, Kantonca, Japonca, Korece, Almanca ve Fransızca; 1.1'in listeyi genişlettiğini de not ediyor. fal'ın Happy Horse 1.1 sayfası ise “English, French, Spanish, Turkish, Japanese, and more” diyor, yani Türkçeyi de sayıyor. Bizim kontrolümüz manueli izliyor, dolayısıyla Türkçeyi şimdilik kanıtlanmamış kabul edin: repliği çok kısa tutun ya da anlamı kamera önünde konuşturmadan verip Türkçeyi ağza değil ses yatağına yerleştirin.
Birden fazla konuşan varsa karakterleri indeksleyin ve her sırayı kendi zaman aralığına yazın: 0-4s: character1 says in French, "..."; 4-8s: character2 laughs and replies, "...". Konuşanı kameraya dönük tutun ve cümleleri kısaltın.
HappyHorse'ta zaman kodları çalışıyor mu?
Çalışıyor ve bu modeli öğrenmeye değer kılan kural da bu. Zaman kodlu plan başlıkları burada onurlandırılır; oysa aynı sözdizimi Seedance 2.5'te tersini yapar, o aile plan sırasına göre ilerler ve saniye işaretleri kararsızdır. Bunu Seedance 2.5 için prompt nasıl yazılır yazısında anlatmıştık. Bir modelin alışkanlığını diğerine taşımak, ikisinde de üretim yakmanın en yaygın yolu.
Planları Shot N (framing, start-end s): biçiminde yazın, her planı beş saniye civarında tutun ve kimliğin kesmeler boyunca korunmasına dikkat edin.
Shot 1 (wide establishing, 0-5s): A fisherman in a yellow oilskin coat hauls a net over the rail of a small boat, overcast dawn light. Audio: gulls, wind, water against the hull. Shot 2 (medium, 5-10s): The same fisherman drinks from a steel flask in the wheelhouse, locked-off camera. Audio: engine hum under the cabin, the flask knocking against the console.
Planları kısa, fiziği yazılı tutun. Uzun planlarda mekân tutarlılığı kaybolur, yazılmamış fizik tanıdık biçimlerde bozulur (kendi kendine kapanan kapılar, yanlış hızda akan su) ve hızlı hareket ince kostüm detayını dağıtır.
Prompt en fazla ne kadar uzun olabilir?
Üreticinin sınırı cömert ama sessizce devreye giriyor. Alibaba Cloud'un metinden video API belgesi şunu yazıyor: “Maximum 5,000 non-Chinese characters or 2,500 Chinese characters. Excess is truncated.” Yani çok uzun bir İngilizce prompt reddedilmez, kuyruğu kesilir. Bu daha kötü bir durum, çünkü sesi genellikle prompt'un sonuna yazarsınız.
LUVI'nin kontrolü daha erken, 2.500 karakterde uyarır; bu aynı sınırın temkinli okunuşu. Pratikte asıl önemli tavan çok daha aşağıda: tek bir plan 20-60 kelime ister, çünkü uzayan prompt kendi kontrolünü seyreltir, yüzler ortalama bir görünüme kayar ve eller geometrisini kaybeder.
Bir HappyHorse prompt'unu ne kötüleştirir?
Dört alışkanlık, dördü de görsel modellerden taşınıyor ve dördü de kontrolde ölçülebiliyor.
- Övgü sıfatları. “Masterpiece”, “ultra-detailed”, “hyperrealistic” bu modelde ölü kelimelerdir: en iyi ihtimalle etkisiz, kötü ihtimalle bozucu. Yerine çekim dilini koyun: “overcast daylight, wet asphalt, neon pink and cyan reflections in the puddles, 35mm telephoto, shallow depth of field”.
- Üst üste yığılan kamera terimleri. Plan başına tek sinematografi işareti: ya lens, ya ışık tarifi, ya kamera hareketi. Beşi bir arada birbirini götürür. Kamerayı kendi cümlesinde tutun ki hareketi öznenin hareketi sanılmasın.
- Aşırı koreografi. Tek ana eylem, temiz tarif edilsin. “A child runs through a field”, aynı cümlenin saç, toz ve kol savuruşuyla şişirilmiş hâlinden daha iyi sonuç verir.
- Ağırlıklar ve oranlar. cfg yok, ağırlık sözdizimi yok; en boy oranı ise dokuz değerli bir parametre, prompt'a “16:9” yazmak hiçbir şey yapmaz.
Neyi doğruladık
- Modeller:
alibaba/happyhorse-1.1/text-to-video,/image-to-video,/reference-to-videovealibaba/happyhorse-1.0/video-edit. - Ayarlar: üç ile on beş saniye, 720P ve 1080P, şemanın sunduğu dokuz en boy oranı, referanstan video modunda en fazla dokuz görsel.
- Tarih ve okunanlar: 22 Eylül 2026. LUVI'deki model şemaları ve kredi tahminleri, LUVI'nin bu aile için çalıştırdığı prompt rehberi, Alibaba Cloud'un kendi API belgesi ve yukarıda bağlantısı verilen fal sayfası.
- Sonuçlar: şema ile üreticinin belgesi süre (3-15 sn, varsayılan 5) ve dokuz en boy oranında birebir örtüşüyor. Yukarıdaki prompt sınırı üreticinin kendi ifadesi. İki açık kaynağın dil listeleri örtüşmüyor; yazı birini seçmek yerine bunu olduğu gibi söylüyor.
- Eksikler: Bu yazı için yeni bir üretim yapılmadı, dolayısıyla çıktı kalitesi hakkında bir iddiası yok. Sağlayıcı fiyat güncellediğinde krediler değişir; uzun bir klipten önce Çalışma Alanı'ndaki tahmine bakın.
LUVI'de
Çalışma Alanı'nda HappyHorse'u seçin ve üretmeden önce tüy düğmesine basın. Bu düğme LuviTransLex, yani bu ailenin prompt rehberini uygulayan ücretsiz kontrol.
Bu modelde kontrol epey sert davranır, çünkü HappyHorse'un yayımlanmış bir “kaçınılacak kelimeler” listesi var. Şu prompt'u geçirin: A beautiful woman walking in a stunning city, masterpiece, ultra-detailed, hyperrealistic, epic cinematic lighting, 16:9, (neon:1.3), slow motion handheld orbit push-in with a zoom and a shake. Sonuç iki düzeltme ve dört uyarı: “masterpiece”, “ultra-detailed” ve “hyperrealistic” doğrudan silinir, “beautiful”, “stunning” ve “epic” ölü kalite etiketi diye işaretlenir, oran parametre olduğu için işaretlenir, ağırlık düşürülüp neon korunur. Geriye kalan cümlede hâlâ üst üste yığılmış kamera terimleri var; rehber onu tek işarete indirmenizi söyler, o kısmı elle yaparsınız.
Referanstan video modu en fazla dokuz görsel alır, yani bir karakterin tanınır kalması gerektiğinde kullanılacak mod budur; verdiğiniz kişilere character1 ve character2 diye seslenin ve kimliği kelimeyle bağlayın (“face, hair and wardrobe unchanged”). İsterseniz hepsini Claude veya ChatGPT üzerinden, LUVI bağlayıcısıyla da yürütebilirsiniz.
Yeni misiniz? LUVI hesabı açın ve önce üç saniyelik bir klip deneyin; ses cümlenizin tutup tutmadığını duymanın en ucuz yolu bu.
Kaynaklar
- HappyHorse metinden video API belgesi – Alibaba Cloud Model Studio, API belgeleri (İngilizce). Erişim tarihi: 22 Eylül 2026.
- HappyHorse API belgeleri dizini – Alibaba Cloud Model Studio, belge dizini (İngilizce). Erişim tarihi: 22 Eylül 2026.
- Happy Horse 1.1 (metinden video) – fal, model sayfası (İngilizce). Erişim tarihi: 22 Eylül 2026.
Devamı Rehberler
- Hailuo prompt'u nasıl yazılır: kamera komutları köşeli parantezin içindeHailuo kamerayı on beş komutluk kapalı bir listeden alıyor ve bu komutu hareketin geçtiği yere köşeli parantezle koyuyorsunuz: [Push in], [Tracking shot], [Static shot]. Model yalnızca görüntü üretiyor, yani ses için yazdığınız her kelime boşa gidiyor. Altı saniye 380 krediden başlıyor.
- Wan 3.0 prompt'u nasıl yazılır: kamerayı yazmazsanız Wan kendisi kesiyorWan 3.0 prompt'u sırayla toplanan bir formülle okur: özne, mekân, hareket, sonra görünüm, sonra ses. Sesi görüntüyle aynı anda üretir. Her plana kamerayı yazmazsanız, tek çekim istediğiniz klibin ortasında kendi kendine kesiyor. Beş saniye 480p'de 400 krediden başlıyor.
- Hunyuan3D prompt'unuzu okumuyor: görselden 3B'de brief'in tamamı fotoğraftırHunyuan3D'nin görselden 3B modlarında metin alanı hiç okunmuyor; modelin kendi sözleşmesi prompt kabul etmediğini söylüyor. Elinizdeki bütün kontrol, girdi görselini nasıl hazırladığınızda. Mesh üretimi Rapid'de 600, Pro'da 1.000 krediden başlıyor.