İçeriğe atla

AI News · industry

Bir Milyon Token Artık Standart. Büyük Kısmı İşe Yaramıyor.

Ciddi her laboratuvar bu yıl bir milyon token'lık bağlam penceresi yayımladı, açık ağırlıklı olanlar dahil. Kıyaslamalar modellerin bunun ancak bir bölümünü güvenilir biçimde kullandığını söylüyor ve modele ne verdiğiniz, pencereye ne sığdığından hâlâ daha önemli.

Entagl Team8 dk okuma
Bir Milyon Token Artık Standart. Büyük Kısmı İşe Yaramıyor.

Eylül 2026 itibarıyla bir milyon token'lık bağlam penceresi artık taban özellik. Anthropic, OpenAI, Google ve Çin'deki açık ağırlıklı laboratuvarların hepsi böyle bir pencere sunuyor. NVIDIA'nın RULER kıyaslaması, 32K token ve üzerini iddia eden modellerin yalnızca yarısının 32K'da kaliteyi koruyabildiğini buldu. Pencere büyüdü. Pencerenin güvenilir kısmı daha yavaş büyüdü.

Bir milyon token'lık pencereyi gerçekte kimler sunuyor?

Buradaki yaygınlık, tek tek rakamlardan daha çok şey anlatıyor; çünkü bu yeteneğin artık bir rekabet hendeği olmaktan çıktığını gösteriyor. Masaya oturmanın asgari şartı hâline geldi ve bunlardan ikisinin ağırlıklarını indirebiliyorsunuz.

Model Laboratuvar (ülke) Bağlam penceresi Ağırlıklar
Claude Opus 5.5 Anthropic (ABD) 1M, 128K azami çıktı Kapalı
GPT-6.1 Sol OpenAI (ABD) 1,050,000, 128K azami çıktı Kapalı
Gemini 3.8 Flash Google (ABD) 1M, 64K azami çıktı Kapalı
DeepSeek-V4.1-Flash DeepSeek (Çin) 1M'ye kadar Açık
Kimi K3 Moonshot AI (Çin) 1M Açık
Mistral Large 3 Mistral (Fransa) 256K Açık

Bu tabloda iki şey öne çıkıyor. Birincisi, Çinli laboratuvarlar bu özellikte başa baş durumda ve ağırlıkları da yayımlıyorlar. DeepSeek'in model kartı, 64K'da seyrek dikkatle eğitilen ve eğitimin ilerleyen aşamasında bir milyon token'a genişletilen 552B parametreli bir uzman karışımı omurgayı anlatıyor. Kimi K3, 18 Eylül 2026'da Amazon Bedrock'a yerleşik görüntü anlama ve açık istem önbelleklemesiyle geldi. Bağlam penceresi kesitinden çok genel sıralama tablosunu merak ediyorsanız, konuyu 2026'nın En İyi LLM'leri: Açık, Kapalı ve Küresel yazısında ele aldık.

İkincisi, Mistral bu yarışa girmedi. Yayımladığı sınırlar Mistral Large 3'ü 256K token'da tutuyor, ürün ailesinin geri kalanı da 128K veya 256K'da duruyor. Bu bilinçli bir tercih ve bir özellik yarışının inandırıcı bir çekimseri olduğunda bunu fark etmekte fayda var.

Bir milyon token gerçekte neyi alır?

En net somut yanıtı Google'ın kendi belgeleri veriyor. Bir milyon token kabaca 50,000 satır kod, ortalama uzunlukta sekiz İngilizce roman ya da 200'den fazla podcast bölümünün dökümü demek.

Bir işletme için faydalı karşılığı ise başka: bir milyon token, tek bir müşteri konuşmasının hiçbir zaman ihtiyaç duymayacağı kadar fazla. Tek bir müşteriyle bir yıllık WhatsApp yazışması buna yaklaşamaz bile. Yani müşteri mesajları üzerinde yapay zekâ çalıştırıyorsanız, pencere bir süredir kısıtınız değil. Kısıtınız seçim ve zaten hep oydu.

Modeller pencerenin tamamını gerçekten kullanıyor mu?

Eşit biçimde kullanmıyorlar ve bunu sağlayıcıların kendisi söylüyor.

Sorunu en temiz ortaya koyan metin NVIDIA'nın RULER makalesi (COLM 2024). Basit samanlıkta iğne testinin ötesine geçip çok adımlı izleme ve toplama görevlerine girdi, 17 uzun bağlam modelini değerlendirdi ve kolay getirme testindeki neredeyse kusursuz skorlara rağmen "neredeyse tüm modellerin bağlam uzunluğu arttıkça büyük performans düşüşleri gösterdiğini" buldu. 32K iddia eden modellerin yarısı 32K'da kaliteyi koruyamadı.

Chroma'nın Context Rot raporu (Hong, Troynikov ve Huber, Temmuz 2025) 18 modeli kasıtlı olarak basit tutulmuş görevlerde sınadı ve girdi büyüdükçe performansın "çoğu zaman şaşırtıcı ve tekdüze olmayan biçimlerde" bozulduğunu buldu. Düşüş dengesiz ilerliyor ve iğne, soruya birebir benzemekten uzaklaştıkça tahmin edilmesi zorlaşıyor.

Google bu sınırı kendi uzun bağlam kılavuzunda açıkça yazıyor. Samanlıkta iğne skorlarının temel tek iğne kurgusunu kapsadığını belirtiyor: "Birden fazla iğnenizin ya da aradığınız belirli bilgi parçalarının olabileceği durumlarda model aynı doğrulukla çalışmaz." Gerçek müşteri soruları ise neredeyse her zaman çok iğneli. Perşembe günü kendisine yer açıp açamayacağınızı, kaparonun iade edilip edilmediğini ve her zamanki terapistinin çalışıp çalışmadığını soran bir müşteri, tek bir mesaja üç iğne gömmüş demektir.

Aynı kılavuz, uygulaması hiçbir maliyeti olmayan pratik bir kural da veriyor: sorunuzu istemin sonuna, bağlamdan sonra koyun. Girdi uzun olduğunda modeller bu şekilde daha iyi sonuç veriyor.

Neden bütün laboratuvarlar aynı anda buraya geldi

2026'daki ilginç mühendislik, uzun bir pencereyi defalarca okumayı uygun maliyetli hâle getirmekti. DeepSeek-V4.1-Flash bu konuda açık; kendisini KV önbellek sıkıştırması üzerinden konumlandırıyor.

Kapalı tarafta ekonomi aynı yöne hareket etti. OpenAI 22 Eylül'de GPT-6 Sol ve Luna'yı yayımladığında API fiyatlarını %50 düşürdü ve varsayılan önbellek isabet oranlarını yükseltti; önbellekten okunan girdi token'larında indirim %90 oldu. Aynı duyuruda GitHub, birkaç ay boyunca süren önbellekleme iyileştirmelerinin, milyarlarca istek genelinde yeniden işlenmesi gereken istem token'larının payını %50'den fazla azalttığını bildirdi. Bir hafta sonra, 29 Eylül'de OpenAI bu sürümün yerine GPT-6.1 Sol'u getirdi ve önbelleklenmiş girdi fiyatını yeniden yarıya indirdi. Üzerine inşa ettiğiniz tempo bu.

Uzun bağlam normalleşti, çünkü önbellekleme büyük bir istemi yeniden okumayı ucuzlattı; modeller bir milyon token boyunca dikkatini toplamayı öğrendiği için değil. Bunlar farklı sorunlar ve yalnızca biri çözüldü.

Fatura ortadan kalkmadı, yer değiştirdi

Daha büyük bir pencereden üç maliyet sağ çıkıyor ve bir yapay zekâ kurulumunun bütçesini yapıyorsanız üçünü de fiyatlamanız gerekir.

  1. Token'lar hâlâ sayaçta ve sayaç kademe atlayabiliyor. Önbellekten okuma da para tutuyor, sadece taze okumadan daha az. OpenAI'ın kendi model sayfası bunu açıkça yazıyor: 272K girdi token'ını aşan istemler, isteğin tamamı için girdi ve önbellek oranlarının 2 katı, çıktının ise 1,5 katı fiyatlanıyor. Pencerenin dörtte birini doldurun, birim ekonominiz değişir.
  2. Gecikme girdiyle birlikte büyüyor. Google'ın rehberliği dolambaçsız: daha uzun sorgular genelde ilk token'a kadar geçen sürenin uzaması demek. Müşteri mesajlaşmasında bu doğrudan cebinizden çıkar. 32,581 konuşmayı inceleyen Yanıt Hızı Çalışmamız, 60 saniye içinde verilen yanıtların %35,1 oranında dönüştüğünü, 5 ila 60 dakika arasındaki yanıtlarda bu oranın %12,2'de kaldığını buldu.
  3. Doğruluk, en geç fark ettiğiniz maliyettir. Şişmiş bir istemden çıkan yanlış cevap, bir müşteri ona göre hareket edene kadar doğru cevapla birebir aynı görünür.

Müşteri konuşmalarında yapay zekâ çalıştırıyorsanız bu ne değiştirir

Teknik özellik tablolarının ima ettiğinden azını.

Bir milyon token'lık pencere bir mazereti ortadan kaldırıyor. Tasarım kararı ise yerinde duruyor. Modelin her turda neyi göreceğini hâlâ siz seçiyorsunuz ve yukarıdaki kanıtlar daha dar, daha iyi seçilmiş bir istemin daha büyüğünü yendiğini söylüyor. Entagl'ın Receptionist'i, işletmenin tamamını her tura yüklemek yerine, sorunun ihtiyaç duyduğu belirli bilgileri işletmenin SSS'leri, hizmetleri ve kataloğu üzerinde anlamsal aramayla getiriyor. Model seçimi iş yüküne göre kademeli, böylece basit bir soru amiral gemisi fiyatından faturalanmıyor. Coordinator bir onay araması yaptığında, aynı müşteri kaydındaki sohbet geçmişini zaten elinde tutuyor; yani ham metin yığınından hiçbir şeyin yeniden kurulması gerekmiyor.

Bu, iyi getirmenin baştan beri gerektirdiği disiplinin aynısı ve kıyaslamalar bunu doğrulamayı sürdürüyor. İşin bellek tarafına 2026'da Yapay Zekâ Ajan Belleği yazısında daha derin girdik; orada hatırlamayı getirmeden ayıran kıyaslamalar var. Aynı eğilimin fiyat tarafı, yani küçük modellerin işletme işlerinin çoğunu üstlenecek kadar ucuzlaması, 2026'da Küçük Dil Modelleri yazısında. Bu özellikler birbirine yakınsarken hangi laboratuvarın üzerine inşa edeceğinize karar veriyorsanız, İşletmenizi Tek Bir Yapay Zekâ Modeli Üzerine Kurmayın yazısı taşınabilir kalmanın gerekçesini anlatıyor.

Disiplinli bağlam seçiminin kendi konuşmalarınızda nasıl göründüğünü merak ediyorsanız, 30 dakikalık bir demo ayarlayın; gerçek mesaj geçmişinizi birlikte inceleyelim.

SSS

Daha büyük bir bağlam penceresi getirmenin yerini alır mı?

Hayır. Getirmenin mühendislik emeğine ne zaman değeceğini değiştirir. Var oluş nedeni ise yerinde duruyor. Maliyet hâlâ işlenen token sayısıyla büyüyor, gecikme girdi uzunluğuyla artıyor ve hem RULER hem Chroma, girdiler büyüdükçe doğruluğun bozulduğunu gösteriyor. Getirme bu üç sorunu aynı anda daraltıyor.

2026'da kullanılabilen en büyük bağlam penceresi hangisi?

Birkaç model bir milyon token veya üzerini kabul ediyor: Claude Opus 5.5, 1,050,000 ile GPT-6.1 Sol, Gemini 3.8 Flash, DeepSeek-V4.1-Flash ve Kimi K3. Bir avuç model daha fazlasını ilan ediyor. Daha faydalı soru, bir modelin pencerenin ne kadarını güvenilir biçimde kullandığı; RULER gibi kıyaslamaların ölçmeye çalıştığı da bu ve o rakam ilan edilenin istikrarlı biçimde altında kalıyor.

Açık ağırlıklı modellerin bağlam pencereleri daha mı küçük?

Artık değil. DeepSeek-V4.1-Flash ve Moonshot'ın Kimi K3'ü, ağırlıkları yayımlanmış hâlde bir milyon token alıyor; yani kendi sunucunuzda barındırmak artık kısa bir pencereyi kabul etmek anlamına gelmiyor. Mistral Large 3 tasarımı gereği 256K'da tavan yapıyor, bu da açık modeller hakkında genel bir şey söylemez.

Bir müşteri hizmetleri konuşması gerçekte ne kadar bağlama ihtiyaç duyar?

Bir milyon token'ın çok altında. Tek bir müşteriyle aylara yayılan uzun bir yazışma bile modern bir pencerenin küçük bir kesridir. Asıl iş, hangi işletme bilgilerinin, geçmiş siparişlerin ve önceki mesajların tam da bu tura ait olduğuna karar vermek.

Uzun bağlam yapay zekânın yanıtını yavaşlatır mı?

Genelde evet. Google'ın uzun bağlam rehberi, daha uzun sorgularda ilk token'a kadar geçen sürenin arttığını belirtiyor. Yanıt hızının dönüşümle birlikte hareket ettiği müşteri mesajlaşmasında bu ödünleşimi kendi trafiğiniz üzerinde ölçmeye değer.

Kaynaklar: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, Temmuz 2025); Gemini API uzun bağlam belgeleri ve Gemini 3.8 Flash model notları; Claude Opus 5.5 model belgeleri; OpenAI GPT-6.1 Sol model referansı ile GPT-6 Sol ve Luna (22 Eylül 2026) ve GPT-6.1 Sol (29 Eylül 2026) duyuruları; DeepSeek-V4.1-Flash model kartı; Kimi K3 Amazon Bedrock üzerinde (18 Eylül 2026); Mistral Large 3 ve bilinen sınırlamalar; Entagl Yanıt Hızı Çalışması (2026). Model özellikleri 30 Eylül 2026'da doğrulandı ve sık sık değişiyor.

Yayınlayan Entagl Team on