Yazılı metinden konuşan sunucuya: önce seslendirme, sonra dudak senkronu

Bir metni sunucuya çevirmek iki üretim demek: önce bir ses modeli metni okuyor, sonra bir lip-sync modeli o sesi bir yüze giydiriyor. Ses adımı onlarca defa tekrar edilebilecek kadar ucuz, yüz adımı değil. Kredileri kurtaran sıra ve ölçülmüş rakamlar.

Yayın:

Karanlık bir masada ince lacivert çizgilerle birbirine bağlanmış üç aşama: küçük boş bir kart, pirinç bir plakadan yükselen kehribar rengi bir ses dalgası ve gözle görülür biçimde daha büyük, konuşan bir kişinin çerçeveli portresi.

Konuşan bir sunucu tek üretim değil, iki üretimdir. Önce bir ses modeli metninizi okuyup bir ses dosyası üretir; sonra bir lip-sync modeli o dosyayla bir portreyi alıp yüzü sese göre canlandırır. Sıradan çok ekonomisi önemli: LUVI'de ses adımı onlarca kredi, yüz adımı binlerce kredi tutuyor. Yani bu iş akışının bütün zanaatı, hiçbir şey canlandırmadan önce okumayı doğru hâle getirmekte.

Birinci adım: metni sese çevirin

Katalogda yedi metinden konuşma modeli var ve bunlar klip başına değil karakter başına fiyatlanıyor: 1.000 karakter üzerinden, doğrusal olarak, blok yuvarlaması olmadan. 600 karakterlik bir paragraf, bin karakterlik ücretin yaklaşık onda altısı kadar tutar.

22 Eylül 2026'da kontrol edilen sıralama:

Fiyat karakter sayısını izlediği için zincirde üzerinde rahatça oynayabileceğiniz tek adım burası. Bir cümleyi yeniden yazıp bütün metni baştan okutmak kredi olarak çok az tutar ve bir repliğin “insan ağzından çıkmış gibi” durmadığını keşfetmenin en ucuz yeri burasıdır.

Hangi ses modeli ve nasıl yönlendirilir?

En çok yönlendirme imkânı ElevenLabs v3'te. 21 adlandırılmış ses, 0 ile 1 arasında bir stability ayarı, bir dili zorlayan language_code alanı ve auto, on, off seçenekli bir metin normalleştirme anahtarı sunuyor; bu son anahtar sayıların yazıyla okunup okunmayacağına karar veriyor. Modelin kendi notu da dikkate değer: çok dilli sesler bütün dilleri destekliyor, diğerleri kendi ana dillerine göre ayarlanmış ve seçildiklerinde dil alanını değiştiriyorlar.

Asıl sinsi olan normalleştirme anahtarı. İçinde “2026” ya da “1.250 TL” geçen bir metin, modelin bunu yazıyla okuyup okumamasına göre bambaşka duyulur ve auto her zaman bir sunucunun tercih edeceği yolu seçmez. Metniniz rakam doluysa bu ayarı bilinçli yapın.

İkinci adım: sesi bir yüze giydirin

Artık sayaç sese göre işliyor. Portre tabanlı lip-sync modelleri ses saniyesi üzerinden faturalanır, yani az önce ürettiğiniz dosyanın uzunluğu faturanın büyüklüğüdür:

Portre, iyi bir vesikalık fotoğrafın istediği şeyleri ister: cepheye dönük, eşit aydınlatılmış, ağzın üzerinden geçen sert gölge yok, çene hattını kesen hiçbir şey yok.

Zincirin tamamı ne tutuyor?

22 Eylül 2026'da tahmin olarak ölçülmüş bir örnek. Metin, yaklaşık 600 karakterlik tek bir paragraf; doğal bir tempoyla okunduğunda kabaca kırk saniye.

  • Ses, Gemini 2.5 Flash TTS ile: 49 kredi.
  • Yüz, OmniHuman 1.5 ile, o kırk saniyelik sesle: 9.600 kredi.

Yüz adımı, ses adımının yaklaşık iki yüz katı. Bu tek orandaki fark, bu yazıdaki sıranın bütün gerekçesi: sesi üretin, dinleyin, metni düzeltin, sesi yeniden üretin ve okuma doğru olana kadar görüntüye hiçbir şey harcamayın. Ses dosyasının başındaki iki saniyelik sessizliği kırpmak burada yazabileceğiniz her prompt'tan daha değerli.

Neyi doğruladık

  • Modeller: ses kataloğundaki yedi metinden konuşma modu, ayrıca bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video ve InfiniteTalk modu.
  • Okunanlar: her modun parametreleri, referans yuvaları ve fiyatı; hem uygulamanın kendi katalog kodundan hem de canlı açık model sayfalarından alındı ve yukarıdaki her rakamda ikisi örtüştü.
  • Tarih ve denemeler: 22 Eylül 2026. Örnekteki iki rakam, 600 karakterlik bir metin ve kırk saniyelik bir ses parçası için alınmış canlı kredi tahminleri.
  • Sonuçlar: ses için 49 kredi, canlandırılmış yüz için 9.600 kredi ve yukarıda sıralanan 1.000 karakterlik ücret merdiveni.
  • Eksikler: Bu yazı için yeni bir üretim yapılmadı, dolayısıyla ses kalitesi ya da senkron kalitesi hakkında bir iddiası yok. Kırk saniye, belirli bir dosyanın ölçümü değil okuma süresi tahminidir; ikinci adımı faturalayacak olan sizin kendi sesinizin uzunluğudur.

LUVI'de

Bunu Çalışma Alanı'nda iki adım olarak yürütebilirsiniz ve tek seferlik bir iş için en hızlı yol budur: sesi üretin, Kütüphane'de bulun, sonra lip-sync modelini açıp portreyle sesi iki yuvaya bırakın.

Tekrarlayacağınız her şey içinse bunu bir iş akışı olarak kurun. Node tuvali, ses çıktısını doğrudan lip-sync modelinin ses yuvasına bağlar; böylece metinde bir değişiklik yaptığınızda dosya taşımadan bütün zincir yeniden çalışır ve grafiğin tamamının tahmini çalıştırmadan önce görünür. İş akışları yalnızca masaüstünde çalışır.

Aynı zinciri Claude veya ChatGPT üzerinden, LUVI bağlayıcısıyla da yürütebilirsiniz; burada bu gerçekten işe yarıyor, çünkü asistan metni elinde tutup bir cümleyi değiştirebilir ve okuma doğru olana kadar yalnızca ses adımını yeniden çalıştırabilir.

Yeni misiniz? LUVI hesabı açın ve ilk kredilerinizi, hiçbir şey canlandırmadan önce sesin iki üç farklı versiyonuna harcayın.

Kaynaklar

  • OmniHuman-1.5 – OmniHuman Lab, proje sayfası (İngilizce). Erişim tarihi: 22 Eylül 2026.
  • ElevenLabs – ElevenLabs, ürün sayfası (İngilizce). Erişim tarihi: 22 Eylül 2026.

Devamı İş akışları