İçeriğe atla

industry · product

Yayına Aldıktan Sonra Yapay Zeka Ajanını Nasıl Doğru Tutarsınız

Hakemli bir çalışma, zaman içinde test ettiği 128 model-veri seti eşleşmesinin %91'inde kalite düşüşü buldu. Canlı bir ajanın kötüleşmesi için kurulumunuzda hiçbir şeyin değişmesi gerekmiyor; işte bunu yakalayan bakım döngüsü.

Entagl Team11 dk okuma
Yayına Aldıktan Sonra Yapay Zeka Ajanını Nasıl Doğru Tutarsınız

Yapay zeka ajanı bakımı bir temizlik işi değildir. İşin kendisidir. Yayına alınırken her testi geçen bir ajan, kimse bir talimata, bir güvenlik önlemine ya da tek satır koda dokunmadan üretimde ölçülebilir biçimde kötüleşebilir. Nature'ın Scientific Reports dergisinde yayımlanan hakemli bir çalışma, dört makine öğrenmesi modelini sağlık operasyonları, finans, ulaşım ve hava durumu alanlarından 32 gerçek veri setiyle eşleştirdi ve son eğitimin üzerinden zaman geçtikçe her eşleşmenin nasıl dayandığını izledi. 128 eşleşmenin %91'inde kalite düştü; yazarlar bu örüntüye yapay zeka yaşlanması adını verdi. Çözüm daha iyi bir model değil. Çözüm, sahibi belli bir gözden geçirme döngüsü.

Bir ajanı dört aşamada güvenle yayına almayı daha önce yazmıştık. Bu yazı ondan sonrasıyla ilgili: çok daha az konuşulan ve sessizce daha çok hasar veren kısımla. Altıncı haftada ve yirminci haftada ne yapıyorsunuz?

Bir yapay zeka ajanı yayına alındıktan sonra neden kötüleşir?

Dört şey bozulur ve birbirinden bağımsız bozulur. Çoğu ekip bunlardan yalnızca birini izler.

Ne bozulur Nasıl görünür Nasıl yakalarsınız
Modelin davranışı Aynı soru, aynı talimat, doğrusu kadar kendinden emin okunan daha kötü bir yanıt Sabit bir test setini belirli aralıklarla yeniden çalıştırıp puanları karşılaştırın
Bilgileriniz Ajan, geçen ay değiştirdiğiniz bir politikayı, fiyatı ya da açılış saatini kusursuz biçimde aktarır Bilgi kayıtlarına tarih düşün, belirli bir düzende gözden geçirin
İşletmeniz Yeni hizmet, yeni şube, mevsimlik çalışma saatleri, biten bir kampanya Bilgi güncellemelerini, onları tetikleyen operasyonel değişikliğe bağlayın
Kapsam Ajandan, kapsamının ötesinde daha uzun ve daha karmaşık işler yapması isteniyor Devir oranını ve gelen iş türlerini izleyin

İlk satır insanları şaşırtıyor. Anwar Ali'nin HousingWire yazısı buna davranışsal kayma diyor ve bunu çoğu ekibin duymuş olduğu veri kaymasından ayırıyor. İkisinden yakalaması zor olanı bu, çünkü daha kötü bir yanıtın hiçbir yanı kötü görünmüyor.

Gerçek bir devreye almada kayma aslında neye benziyor?

BSI Financial Services'te Kıdemli Başkan Yardımcısı ve Ürün Yönetimi Başkanı olan Anwar Ali, tam da bunun hikâyesini Eylül 2026'da yayımladı. Ekibi, uzun uğraşlarla oturttukları uyumluluk güvenlik önlemlerinin arkasında, canlı hesap verileri üzerinden kredi müşterilerinin sorularını yanıtlayan sesli ve yazılı bir ajan çalıştırdı. İşe yaradı. Müşterinin sorununun bir insana ulaşmadan çözüldüğü oran olan kapsama, aylarca sektör ortalamasının üzerinde kaldı.

Sonra yaklaşık sekiz puan düştü. Haftalarca kimse fark etmedi.

İnceleme güvenlik önlemlerini, görüşme akışını ve müşteri davranışındaki değişimleri temize çıkardı. Sebep modelin kendisiydi: önde gelen bir laboratuvarın köklü bir modeli, aynı soru kategorilerine sessizce daha kötü yanıtlar üretiyordu. Asıl ödünç alınası kısım, vardığı sonuç: bu bir teknoloji başarısızlığı değil, bir ölçüm başarısızlığıydı. Kapsama haftalık gözden geçiriliyordu ve haftalık bir gecikmeli gösterge, yavaş bir düşüşü ancak çok sayıda müşteri o düşüşten geçtikten sonra yakalayabilir.

Hangi sayıları, hangi sıklıkta izlemelisiniz?

Küçük bir set seçin, her birine bir periyot atayın ve o periyodu hasar penceresinden kısa tutun. Ayda bir gözden geçirilen bir metrik, size sinyal vermeden önce kötü bir ay yaşatır. Bunlar getiri metrikleri değil, operasyon metrikleri; finansal taraf için çoğu projenin hiç getiri göstermediği yerde yapay zeka getirisi nasıl ölçülür yazısına bakın.

Metrik Periyot Kötü bir hareket ne anlama gelir
İnsana devir oranı Günlük Ajan daha sık reddediyor ya da yetersiz kalıyor, ya da sorular değişti
İlk yanıt süresi Günlük Bir teslimat ya da kuyruk sorunu, kalite sorunu değil
Devir olmadan çözüm Günlük Klasik kayma göstergesi. Günü değil, eğilimi izleyin
Yapay zeka yanıtlarında olumsuz oy oranı Haftalık Ekibiniz, toplu sayıların sakladığı bir şeyi görüyor
Görüşmelerden randevu ya da dönüşüm oranı Haftalık Ajan yanıtlıyor ama artık kapatmıyor
Regresyon test seti puanı Aylık ve her model değişikliğinde Model ya da yapılandırma ayağınızın altından kaydı

İlk yanıt süresi nadiren kaysa da o listede yer hak ediyor. Kendi 32.581 görüşmelik çalışmamız, 60 saniyenin altında verilen yanıtların %35,1 oranında dönüştüğünü, bir ila yirmi dört saat süren yanıtların ise %7,1'de kaldığını buldu. Hız, bir ajanın satın alınma sebebidir; dolayısıyla hâlâ geçerli olduğunu kanıtlamaya değen metrik de odur.

Bir yapay zeka ajanını ne sıklıkla yeniden test etmelisiniz?

Doğru sonuçları bilinen gerçek görüşmelerden oluşan sabit bir regresyon test seti tutun ve onu üç tetikleyicide yeniden çalıştırın:

  1. Belirli aralıklarla, en az ayda bir. Kaymayı bir önseziden çıkarıp sayıya çeviren şey budur.
  2. Her model değişikliğinden önce ve sonra, başlatan siz olmasanız bile. Platformunuz daha yeni bir modele geçiyorsa, bu sizin sisteminizde bir değişikliktir.
  3. Anlamlı her bilgi ya da talimat düzenlemesinden sonra. Tek bir şikâyet için yapılan düzeltme, sorunsuz çalışan bir yanıtı sıklıkla bozar.

Seti zaten elinizde olan görüşmelerden kurun. Sık gelen sorularınızı, garip uç durumlarınızı ve ajanın asla tek başına yanıtlamaması gereken birkaç konuyu kapsayan yirmi ila elli vaka. Gerçek bir gerilemeyi yakalayacak kadar büyük, gerçekten çalıştıracağınız kadar küçük.

Hangi model üzerinde çalıştığınızı yeniden kıyaslamak ayrı ve daha yavaş bir döngü. Üç ayda bir makul bir varsayılan ve kurulumunuz hiçbir zaman tek bir laboratuvara perçinlenmediyse bu iş çok daha kolay. Bunu işinizi tek bir yapay zeka modeli üzerine neden kurmamalısınız yazısında savunmuştuk.

Haftalık bakım döngüsü neye benzer?

Her hafta aynı saatte, otuz ila altmış dakika:

  1. On gerçek görüşmeyi baştan sona okuyun. Özetleri değil. Birkaçını işaretlenenler arasından, birkaçını da rastgele seçin; çünkü normalin neye benzediğini size rastgele olanlar gösterir.
  2. Ekibinizin kaydettiği her olumsuz oyu triyaj edin. Her birini üç kovadan birine ayırın: bilgi yanlıştı ya da eksikti, talimatlar yanlıştı, ya da ajan insana devretmeliydi.
  3. Görüşmeyi değil, kovayı düzeltin. Tek bir sohbette yapılan tek seferlik bir düzeltme sisteme hiçbir şey öğretmez. Bilgi kaydını, talimatı ya da devir kuralını güncelleyin.
  4. Taşıyıcı bir şeyi değiştirdiyseniz regresyon setini yeniden çalıştırın.
  5. Neyi neden değiştirdiğinizi yazın. Altı hafta sonra "bu ne zaman başladı?" sorusunu yanıtlamanızı sağlayan şey, tarihli bir değişiklik günlüğüdür.

Model sorunsuzken bile uzun görevler neden başarısız olur?

Bu bir bakım görevinden çok bir tasarım kısıtı, ama ortaya çıkarken tıpkı bir bozulma gibi görünüyor.

Ağustos 2026 tarihli bir arXiv ön baskısı olan How Fast Do Agents Rot?, ajan güvenilirliğini dokuz model ve analiz edilen 10.664 yörünge üzerinde ölçtü. Görev başarısı, adım başına güvenilirliğin yönettiği geometrik bir yasayı izliyor; bu güvenilirlik model ölçeğiyle yükseliyor ama en güçlü sistemlerde bile 1'in epey altında doyuma ulaşıyor. Gerçekten ajansal olan araç kullanımı görevinde, yaygın biçimde kullanılan tescilli modeller dahil test edilen her model, on altı bağımlı adım içinde neredeyse kusursuz başarıdan neredeyse sıfıra düştü. Bozulma, bağlam uzunluğunu değil adım sayısını izledi.

Bu bir ön baskı ve görevleri müşteri hizmetleri görüşmeleri değil. Pratik çıkarım yine de geçerli: güvenilirlik her bağımlı adımda birleşerek aşağı iniyor. Yani yanıtlamak, nitelemek ve randevu almakla sınırlanmış bir ajan, on beş adımlık bir süreci gözetimsiz yürüten bir ajandan çok daha sağlam zeminde duruyor. Ajanınızın işi yayına alındığından beri sessizce büyüdüyse, elinizdeki şey kalite sorunu kılığına girmiş bir kapsam sorunudur.

Bunun sahibi aslında kim?

Genelde hiç kimse ve Ali'nin yazısındaki asıl bulgu da bu. Ürün ekipleri yayınlar, mühendislik altyapıyı ayakta tutar, operasyon işi çevirir ve yanıtların kötüleştiğini fark etmekten kimse sorumlu değildir.

Tek bir kişi belirleyin ve bu işi bir komiteye vermeyin. O kişi günlük sayıları izler, haftalık döngüyü yürütür ve ajanın yoldan çıktığını söyleyip kapsamını geri çekecek yetkiye sahiptir. Rolü gerçek kılan da bu son kısım. Ali alternatif konusunda açık sözlü: "yalnızca onay damgası basabilen bir denetçi gözetim sağlamaz, yalnızca gözetimin görüntüsünü sağlar."

Entagl bu resmin neresinde?

Ekibinizden herkes kötü bir yapay zeka yanıtını, neyin yanlış olduğuna dair bir notla doğrudan birleşik gelen kutusundan işaretleyebilir. İşaretlenen yanıtlar bir durum bilgisiyle inceleme kuyruğuna düşer; böylece haftalık triyaj bir hafıza sınavı değil, bir iş listesi olur. Bilgi tek bir yerde durur: bir SSS'yi, bir hizmeti ya da açılış saatlerinizi düzeltmek, bunu WhatsApp, Instagram, Messenger, Telegram, web sohbeti, e-posta ve API için aynı anda düzeltir. Dört ajan tek bir beyni paylaştığı için, sohbet tarafında yaptığınız bir düzeltme bir sonraki aramada da geçerlidir.

İki yapısal parça, tek tek hiçbir özellikten daha önemli. Model yönlendirmesi tek bir laboratuvara bağlı değil: her aşamanın arkasındaki model bir ayardır ve arkasına yedek modeller tanımlanabilir, böylece bir sağlayıcının davranış değişikliği yeniden inşa değil, bir yönlendirme kararı olur. İnsana devir de bir başarısızlık durumu değil, birinci sınıf bir yoldur; dolayısıyla bir şeyin kaydığını size söyleyen sayıyı zaten topluyor olursunuz.

Ajanı en baştan doğru temellendirmek bütün bunları ucuzlatıyor. Bunu kendi işletme bilginizle bir yapay zeka ajanını nasıl eğitirsiniz yazısında anlatıyoruz.

Bakımın çözmediği şeyler

Baştan düzgün temellendirilmemiş bir ajanı doğru hale getirmez. Kapsamı kötü çizilmiş bir ajanı izlemek, size yanlış şeyin çok hassas bir ölçümünü verir.

Halüsinasyonu ortadan kaldırmaz. Onu azaltan kontroller ayrı bir yığın ve bunları yapay zeka ajanınızın halüsinasyon görmesini nasıl durdurursunuz yazısında ele aldık.

Bir sayının hareket etmesi de bir teşhis değildir. Devir oranı, ajan kötüleştiği için de yükselebilir, farklı türde sorular getiren bir reklam kampanyası yürüttüğünüz için de. Bir şeyi değiştirmeden önce görüşmeleri okuyun. Haftalık döngünün birinci adımının ölçmek değil okumak olmasının sebebi bu.

FAQ

Bir yapay zeka ajanının performansını ne sıklıkla kontrol etmelisiniz?

Devir oranını, ilk yanıt süresini ve çözüm oranını günlük izleyin; bunlar bir düşüşün öncü göstergeleridir. İşaretlenen yanıtları ve dönüşümü haftalık gözden geçirin. Regresyon test setini ayda bir ve her model değişikliğinde yeniden çalıştırın. Bir finansal hizmetler devreye almasında sekiz puanlık bir düşüşün haftalarca fark edilmemesinin sebebi, yalnızca haftalık gözden geçirmedir.

Hiçbir şey değişmediyse bir yapay zeka ajanı kötüleşebilir mi?

Evet, üstelik birbirinden ayrı iki sebeple ve bu ikisini ayrı tutmakta fayda var. Çoğu ekibin kaçırdığı davranışsal kaymadır: barındırılan bir model, siz talimatlarınızda ya da yapılandırmanızda hiçbir şey değiştirmeden aynı sorulara daha kötü yanıtlar üretmeye başlayabilir. Kapsama yaklaşık sekiz puan düştüğünde Anwar Ali'nin BSI Financial Services'te belgelediği şey tam olarak budur. Diğeri ise yapay zeka yaşlanması: sabit bir model, yalnızca eğitildiği günden bu yana daha çok zaman geçtiği için daha az isabetli hale gelir. Nature'ın Scientific Reports dergisi bunu, test ettiği 128 model-veri seti eşleşmesinin %91'inde gözlemledi. Farklı mekanizmalar, aynı belirti. Sabit bir regresyon test seti ikisini de yakalar.

Sorunun modelde mi yoksa bilgi tabanınızda mı olduğunu nasıl anlarsınız?

Sabit regresyon test setinizi yeniden çalıştırın. Altta yatan bilgi değişmediği halde eskiden geçen vakalar şimdi kalıyorsa, model kaymıştır. Ajan, basitçe güncelliğini yitirmiş bilgilerden kendinden emin biçimde yanıt veriyorsa, kayan sizin bilginizdir. İkisini ayıran şey test setidir; her seferinde yeniden yazılmak yerine sabit kalması ve tekrar kullanılması gerekmesinin sebebi de budur.

Küçük bir işletmede yapay zeka ajanı bakımının sahibi kim olmalı?

Adı konmuş tek bir kişi ve bu genelde en teknik olan değil, müşteri deneyiminin sahibi olan kişidir. İş, görüşmeleri okumak, işaretlenen yanıtları triyaj etmek ve işletme bilgisini güncellemekten ibaret. Hiçbiri mühendislik gerektirmiyor, hepsi ise sayılar öyle söylediğinde ajanın kapsamını geri çekecek yetkiye sahip birini gerektiriyor.

Daha iyi bir model izleme ihtiyacını ortadan kaldırır mı?

Hayır. Adım başına güvenilirlik model ölçeğiyle iyileşir ama 1'e ulaşmaz; dolayısıyla uzun görev zincirleri yine bozulur ve daha güçlü bir model de ayağınızın altından davranışını değiştirebilir. Daha iyi modeller tabanı yükseltir. Tabanı izleme ihtiyacını ortadan kaldırmaz.

Toplamadığınız sayıyla başlayın

Bu işletmede başka bir yerde neredeyse kesinlikle haftalık bir sayı toplantısı yapıyorsunuz, başka bir sistem için değişiklik günlüğü tutuyorsunuz ve bir işi kalite açısından örnekleyerek kontrol etmeyi biliyorsunuz. Ali de yazısının sonunda aynı sonuca varıyor: yetkinlik genelde zaten var ve neredeyse hiç kimse onu müşterileriyle konuşan yapay zekaya yöneltmiş değil.

Günlük izlemediğiniz bir öncü gösterge seçin, ona bir sahip verin ve haftalık okuma için takvime otuz dakika koyun. Tek başına bu bile burada anlatılan kaymayı yakalardı.

İşaretlenen yanıt kuyruğunun, ortak bilginin ve devir kontrollerinin gerçek bir çalışma alanında nasıl işlediğini görmek için 30 dakikalık bir demo ayırtın; kendi görüşmelerinizi birlikte baştan sona geçelim.

Kaynaklar: Nature Scientific Reports, "Temporal quality degradation in AI models" (2022); HousingWire, Anwar Ali, "The silent failure mode: what happens when your AI model quietly gets worse" (Eylül 2026); arXiv:2609.01660, "How Fast Do Agents Rot?" (Ağustos 2026); Entagl Response Velocity Study (2026). Rakamlar Eylül 2026 itibarıyla doğrulanmıştır.

Yayınlayan Entagl Team on