İçeriğe atla

AI News · industry

Full-Duplex Sesli Yapay Zekâ: Konuşurken Dinleyen Modeller

OpenAI, Google, Alibaba ve StepFun, Eylül 2026'da cümlenin ortasında sözünü kesebileceğiniz sesli modeller çıkardı. Neler değişti, hangi testte kim önde ve bunun işletmelerin telefon görüşmeleri için anlamı ne?

Entagl Team9 dk okuma
Full-Duplex Sesli Yapay Zekâ: Konuşurken Dinleyen Modeller

Full-duplex sesli yapay zekâ, aynı anda hem dinleyen hem konuşan tek bir modeldir; böylece arayan kişi sözü kesebilir, duraksayabilir ya da "hı hı" diyebilir ve konuşma bozulmaz. 7 Ekim 2026 itibarıyla OpenAI'ın GPT-Live-1 modeli, Artificial Analysis'in Speech to Speech Index sıralamasında 83,2 puanla zirvede. Google'ın Gemini 3.8 Live Extended Thinking modeli 82,6 ile kıl payı geride. Konuşmanın ne kadar doğal hissettirdiğini ölçen testte ise Çin merkezli StepFun %98,9 ile birinci. Üçü de son üç ay içinde ya yeni çıktı ya da güncellendi.

Telefonla müşteri karşılayan bir işletme yönetiyorsanız, yapay zekâ aramalarının altındaki teknoloji Eylül 2026'da değişti.

"Full-duplex" ne demek ve bir telefon görüşmesinde neden önemli?

2026'dan önce kurulan yapay zekâ telefon ajanlarının çoğu bir bayrak yarışı gibi çalışıyordu. Konuşmayı metne çeviren sistem arayanın sözlerini yazıya döküyor, bir dil modeli yanıt yazıyor, metni sese çeviren sistem de bu yanıtı okuyordu. Her devir teslim gecikme ekliyor ve sistem, arayanın sözünü ne zaman bitirdiğini tahmin etmek zorunda kalıyor. Erken tahmin ederse karşısındakinin sözünü keser. Geç tahmin ederse araya rahatsız edici bir sessizlik girer.

Full-duplex bir model ise dinlemeyi ve konuşmayı tek bir ağda, kesintisiz yapar. Daha cümlesinin ortasındayken "pardon, aslında perşembe olsun" sözünü duyup yön değiştirebilir. Konuşmayı bitirmiş biriyle o an düşünmekte olan birini birbirinden ayırt edebilir.

Fark, pratikte kendini gösteriyor. OpenAI'ın aktardığına göre dil öğrenme uygulaması Speak, öğrencilerin düşünme molaları sırasında yaşanan söz kesmeleri, önceki sıra tabanlı sistemlere kıyasla neredeyse %80 azalttı. Aynı duyuruda görüşü aktarılan ve hastalarla yapılan konuşmalar geliştiren bir başka müşteri ise zincirleme kurulumundan geçiş yapmanın 23.000 satır kodu ortadan kaldırdığını söyledi.

Sürekli sözünüzü kestiği için bir ses botunun yüzüne telefonu kapattığınız olmuştur belki.

Temmuz ile Ekim 2026 arasında neler çıktı?

Model Laboratuvar Bölge Ağırlıklar Çıkış tarihi Öne çıkan özellik
GPT-Live-1 OpenAI ABD Kapalı (API) 10 Eylül 2026 Zor akıl yürütmeyi ve araç çağrılarını ayrı bir arka uç modele devrediyor; telefon altyapısı desteği var
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind ABD Kapalı (API) 15 Eylül 2026 Konuşmayı sürdürürken araç çağrılarını arka planda çalıştırıyor; 97+ dil
StepAudio 3 Realtime StepFun Çin Kapalı (API, önizleme) 15 Eylül 2026 Artificial Analysis'te en yüksek konuşma dinamiği puanı
Qwen-Audio-3.1-Realtime Alibaba Qwen Çin Kapalı (API) Eylül 2026 Gerçek zamanlı modelde yaklaşık %85'lik fiyat indirimi
Grok Voice Think Fast 2.0 xAI ABD Kapalı (API) 29 Temmuz 2026 Artificial Analysis'te en yüksek görev başarı oranı
NemotronLabs VoiceChat 11B NVIDIA ABD Açık ağırlıklar Ağustos 2026 Araç çağırabilen ilk açık full-duplex model
Raon-SpeechChat-9B Krafton Güney Kore Açık ağırlıklar Nisan 2026 Sıralamadaki en hızlı ilk ses süresi (yalnızca İngilizce)
Step-Audio R1.1 (Realtime) StepFun Çin Açık ağırlıklar 2026'nın daha önceki aylarında Akıl yürütme puanları güçlü, açık bir gerçek zamanlı konuşma modeli

Kaynaklar: OpenAI, Google, StepFun dokümanları, The Decoder'ın Qwen-Audio-3.1 haberi, xAI, Hugging Face'te NVIDIA, Hugging Face'te Krafton, Hugging Face'te StepFun.

Listede iki eğilim dikkat çekiyor. Birincisi, öncü modellerin hepsi artık "konuşmaya devam et" ile "gidip işi yap" görevlerini birbirinden ayırıyor. GPT-Live-1 akıl yürütmeyi arka uçtaki bir metin modeline devrediyor, Gemini 3.8 Live araçları eşzamansız çağırıyor, StepFun da modelini konuşurken düşünen bir model olarak tanımlıyor. İkincisi, açık ağırlıklı modeller arasında artık konuşmanın ortasında araç çağırabilen bir full-duplex model de var. Bu yaza kadar bu yeteneği yalnızca barındırılan API'ler sunuyordu.

Şu an en iyi sesli yapay zekâ modeli hangisi?

Tek bir kazanan yok; "hangi testte?" demeden birini işaret eden biri size bir şey satmaya çalışıyordur. Artificial Analysis, endeksinde dört testi birleştiriyor: konuşmalı akıl yürütme, τ-Voice müşteri hizmetleri görevlerinde ajan performansı, arena tercihi ve görev başarısı. Konuşma dinamiklerini ise ayrıca raporluyor. 7 Ekim 2026 itibarıyla tablo şöyle:

Test (Artificial Analysis) Lider Puan Hemen ardından gelenler
Genel Speech to Speech Index GPT-Live-1 (Astra arka ucu, medium) 83,2 Gemini 3.8 Live Extended Thinking (High) 82,6; Grok Voice Think Fast 2.0 High 81,3
Konuşmalı akıl yürütme (Big Bench Audio) StepAudio 3 Realtime (StepFun) %99,7 Qwen Audio 3.0 Realtime Plus %99,2; Qwen3.5 Omni Plus Realtime %98,7
Ajan performansı (τ-Voice müşteri hizmetleri görevleri) GPT-Live-1 (Astra arka ucu, medium), tek deneme %74,5 Gemini 3.8 Live Extended Thinking (High) %68,6
Konuşma dinamikleri (duraksamalar, söz sırası, söz kesmeler) StepAudio 3 Realtime (StepFun) %98,9 Qwen Audio 3.0 Realtime Plus %98,4; GPT-Live-1 (Sol, low) %97,3
Speech Agent Arena'da görev başarısı Grok Voice Think Fast 2.0 High %94,6 Gemini 3.8 Live %93,2

Tabloyu şöyle okuyun. Genel endekste OpenAI, Google ve xAI arasında iki puandan az fark var; pratikte bu bir beraberlik demek. Konuşmalı akıl yürütmede ve konuşmanın ne kadar doğal hissettirdiğinde ise Çin modelleri önde: StepFun ve Alibaba, iki testte de bütün ABD modellerini geride bırakıyor. OpenAI'ın müşteri hizmetleri testindeki liderliği tek bir denemeye dayanıyor, o yüzden bunu geçici kabul edin. Fiyat farkı da gerçek: Artificial Analysis, Alibaba'nın Qwen Audio 3.0 Realtime Plus modelini, girdi sesinin saati başına takip ettiği en ucuz model olarak gösteriyor.

Şunu da belirtelim: Alibaba'nın daha yeni Qwen-Audio-3.1-Realtime modeli, biz kontrol ettiğimizde sıralamada henüz puanlanmamıştı. Bu yüzden yukarıdaki Alibaba satırları 3.0 sürümüne ait.

Yeni modeller hâlâ nerede yetersiz kalıyor?

Lansman yazıları iyimser. Kıyaslama tabloları ise daha dürüst.

  • Doğal görünmek ile işi bitirmek ayrı becerilerdir. NVIDIA'nın açık PersonaPlex modeli, aynı Artificial Analysis tablosunda konuşma dinamiklerinde %91,0 alırken konuşmalı akıl yürütmede %19'da kalıyor. Bir model kulağa akıcı gelip yine de randevuyu yanlış alabilir.
  • Daha iyi dinlemek, daha yavaş susmak anlamına gelebilir. Alibaba'nın MarkTechPost'un özetlediği kendi teknik sonuçları, modelinin kendisine yöneltilmemiş konuşmaları görmezden gelmekte çok daha iyi hâle geldiğini gösteriyor. Ama söz kesildikten sonra istenmeden konuşmaya geri dönme oranı 0,035'ten 0,130'a çıkmış. Sözü kesildiğinde durması da 1,116 saniye sürüyor; GPT-Realtime-2'de bu süre 0,383 saniye.
  • Müşteri hizmetleri görevleri hâlâ çözülmüş değil. τ-Voice'taki en iyi model bile havayolu, perakende ve telekom görevlerinin birebir kopyalarından yaklaşık dörtte üçünü tamamlıyor. Kalan dörtte biri başarısız oluyor.
  • Açık ağırlıklı modeller dengesiz. StepFun'ın açık Step-Audio R1.1 modeli konuşmalı akıl yürütmede %97,6 alıyor. Bu, Google'ın en iyi modelinin (Gemini 3.8 Live Extended Thinking, %97,7) yalnızca onda bir puan gerisinde ve bütün OpenAI ve xAI modellerinin önünde. Ancak henüz hiçbir açık modelin τ-Voice müşteri hizmetleri puanı yok. AI Weekly'nin incelemesi de NVIDIA'nın model kartına dayanarak, modelin doğru aracı %82,5 oranında seçtiğini ama ayrıntıları yalnızca %44,2 oranında doğru doldurduğunu not ediyor. Bir modelin üzerine bir şey kurmadan önce lisansını mutlaka kontrol edin.

Bu, telefonla müşteri karşılayan bir işletme için ne anlama geliyor?

Pratik sonuç şu: telefon kanalı gerçek işler için artık daha kullanışlı, yavaş kurulumlara karşı ise daha acımasız. Metin kanallarında satışı zaten hız belirliyor. Entagl'ın Yanıt Hızı Araştırması, 32.581 konuşmada, 60 saniye içinde yanıtlanan konuşmaların %35,1 oranında dönüşüme ulaştığını, 5 ila 60 dakika arasında yanıtlananlarda ise bu oranın %12,2'de kaldığını gösterdi. Telefon görüşmesi, var olan en sabırsız kanal.

Bu haberle yapabileceğiniz üç şey:

  1. Demoları değil, söz kesmeleri test edin. Yapay zekâ ajanınızı arayın ve sözünü cümlenin ortasında kesin, yarı yolda tarihi değiştirin, dört saniye sessiz kalın. Yapay zekâ telefon ajanını değerlendirme rehberimiz, denemeye değer senaryoları listeliyor.
  2. Sese değil, yapılan işe bakın. Yanlış saate randevu veren hoş bir ses, doğru saate randevu veren sade bir sesten daha kötüdür. Randevunun, siparişin ya da geri aramanın gerçekten sisteminize düştüğünü kontrol edin.
  3. Tek bir ses modeline bağlanıp kalmayın. Google, 15 Eylül'de Gemini 3.8 Live Extended Thinking'in Artificial Analysis endeksinde 1 numara olduğunu duyurdu; üç hafta sonra GPT-Live-1 onun 0,6 puan önünde. Genel gerekçeyi işinizi neden tek bir yapay zekâ modeline dayandırmamanız gerektiği yazımızda anlattık; bunun en çok can yaktığı yer de ses.

Entagl'ın Coordinator'ı bu tablonun neresinde?

Entagl'ın Coordinator'ı, telefon numaraları ve WhatsApp aramaları üzerinden gelen ve giden aramaları yönetiyor (WhatsApp tarafında desteklenen numaralarda ve WhatsApp'ın gerektirdiği durumlarda müşterinin izniyle). Bunu zincirleme bir bayrak yarışıyla değil, yerel konuşmadan konuşmaya modellerle yapıyor. Ses katmanı, ajanı yeniden kurmadan alttaki modeli değiştirebilecek şekilde tasarlandı: varsayılan olarak Gemini Live çalışıyor, OpenAI'ın gerçek zamanlı modelleri de ikinci seçenek olarak devreye alınıyor. Aramadan önce müşterinin son konuşmalarının özetlerini, randevularını ve geçmiş aramalarını okuyor; böylece bir onay araması ya da istenen bir geri arama "size nasıl yardımcı olabilirim?" sorusuyla değil, bağlamla başlıyor. Her arama, müşterinin kaydında bir döküm bırakıyor.

Aramaların müşteri yolculuğunun neresine oturduğunu görmek için müşteri hizmetleri ve satış için yapay zekâ sesi yazımıza göz atın. En yaygın kullanım için ise randevuya gelmeme üzerine araştırma derlememiz, onay aramalarının gerçekte neyi değiştirdiğini anlatıyor.

Tüm bağlama sahip bir yapay zekâ aramasının kendi kullanım senaryonuzda nasıl duyulduğunu dinlemek ister misiniz? 30 dakikalık bir demo ayarlayın.

FAQ

Full-duplex ve half-duplex sesli yapay zekâ arasındaki fark nedir?

Half-duplex (sıra tabanlı) sesli yapay zekâ sırayla konuşur: sizin susmanızı bekler, sonra yanıt verir. Full-duplex sesli yapay zekâ ise aynı anda dinler ve konuşur; böylece daha konuşurken söz kesmelere, "hı hı" gibi onay seslerine ve duraksamalara tepki verebilir.

Ekim 2026'da en iyi yapay zekâ ses modeli hangisi?

Teste göre değişir. 7 Ekim 2026 itibarıyla Artificial Analysis'te GPT-Live-1, 83,2 puanla genel Speech to Speech Index'in lideri; Gemini 3.8 Live Extended Thinking'in (82,6) ve Grok Voice Think Fast 2.0'ın (81,3) az farkla önünde. StepFun'ın StepAudio 3 Realtime modeli ise %98,9 ile konuşma dinamiklerinde birinci.

Açık kaynaklı full-duplex ses modelleri var mı?

Evet. NVIDIA, NemotronLabs VoiceChat 11B modelini araç çağırabilen ilk açık full-duplex model olarak tanımlıyor. Krafton'ın Raon-SpeechChat-9B modeli açık ve yalnızca İngilizce. StepFun da Step-Audio R1.1'in ağırlıklarını yayımlıyor. Akıl yürütmeleri güçlü olabilir, ama henüz hiçbiri τ-Voice müşteri hizmetleri kıyaslamasında puanlanmadı ve lisansları farklı. Üzerine bir şey kurmadan önce koşulları kontrol edin.

Full-duplex modeller, yapay zekâ telefon ajanlarını her arama için hazır hâle getiriyor mu?

Hayır. τ-Voice müşteri hizmetleri kıyaslamasındaki en iyi model, tek bir denemeye göre görevlerin %74,5'ini tamamlıyor. Bir insana ulaşmanın net bir yolunu açık tutun ve ajanın yalnızca nasıl duyulduğunu değil, attığı adımları da test edin.

Bir işletmenin bu modellerden birini seçmesi gerekiyor mu?

Genellikle doğrudan değil. Google'ın 15 Eylül lansmanından sonraki üç hafta içinde sıralamanın zirvesi el değiştirdi. Bu yüzden daha güvenli kurulum, ses katmanı ajanı yeniden kurmadan başka bir modele geçebilen ve desteklediği seçenekleri siz karar vermeden önce kontrol edebileceğiniz bir platformdur.

Kaynaklar: OpenAI, Google DeepMind, StepFun, xAI, NVIDIA ve Krafton ürün sayfaları ve model kartları; Artificial Analysis Speech to Speech sıralaması (7 Ekim 2026'da kontrol edildi); The Decoder (23 Eylül 2026); MarkTechPost (28 Eylül 2026); AI Weekly (Ağustos 2026); Entagl Yanıt Hızı Araştırması (2026).

Yayınlayan Entagl Team on