İçeriğe atla

AI News · industry

2026'da Yapay Zeka Tarayıcı Ajanları: Gerçek Olan ve Riskli Olan

OpenAI, Atlas tarayıcısını 9 Ağustos'ta emekliye ayırdı. Asıl hareket, yazılımı doğrudan kullanan bilgisayar kullanımı ajanlarına kaydı. İşte bu ajanların sıralaması, hâlâ neyi yanlış yaptıkları ve işletmelerin görmezden gelemeyeceği güvenlik gerçeği.

Entagl Team9 dk okuma
2026'da Yapay Zeka Tarayıcı Ajanları: Gerçek Olan ve Riskli Olan

OpenAI, ChatGPT Atlas adlı özel tarayıcısını 9 Ağustos 2026'da, lansmanından bir yıldan kısa süre sonra kapattı ve bu hamlenin ardındaki mesaj asıl hikâyeyi anlatıyor: bağımsız "yapay zeka tarayıcısı" soluyor, yazılımı sizin adınıza kullanan ajan ise bu alanın hızla ilerlediği yön. Ağustos 2026 itibarıyla en iyi bilgisayar kullanımı modelleri, profesyonel bir ekranda bir hedefi neredeyse %88 doğrulukla bulabiliyor, ancak en iyileri bile çok adımlı görevlerin yalnızca beşte birini baştan sona tamamlayabiliyor. Yapay zeka tarayıcı ajanları aynı anda hem gerçekten faydalı hem de gerçekten güvenilmez ve bu iki gerçek arasındaki uçurum, bugün her satın alma kararının merkezinde yer alıyor.

Bu yazı, 2026'da neyin değiştiğini, bilgisayar kullanımı ajanlarının küresel alanda gerçekte nasıl sıralandığını, öne çıkan kıyaslama (benchmark) rakamlarının neden yapabildiklerini abarttığını ve hiçbir tedarikçinin çözemediği güvenlik sorununu anlatıyor. Bir işletme yönetiyorsanız, pratik çıkarım en sonda.

2026'da yapay zeka tarayıcılarına ne oldu?

Yapay zeka tarayıcıları 2025'in gözde ürünüydü. Büyük küçük pek çok şirket, insanların web'de gezinmek için kullandığı arayüzün sahibi olmayı, içine bir model gömerek denedi. 2026'da bu bahis hızla dağıldı. OpenAI, Atlas'ı emekliye ayıracağını ve tarama özelliklerini ChatGPT masaüstü uygulamasına dahil edeceğini, tarayıcının ise 9 Ağustos'ta çalışmayı durduracağını doğruladı (9to5Mac). The Browser Company, Atlassian'a satıldı ve rakip yapay zeka öncelikli tarayıcılar ya birleşti ya da yön değiştirdi.

TechCrunch'ın ifadesiyle ortak nokta şu: "odak, ajanlara ve otomasyona kaydı" (TechCrunch). Ayrı bir tarayıcı hiçbir zaman asıl mesele değildi. Asıl mesele, bir sayfayı okuyabilen, tıklayabilen, yazabilen ve bir görevi tamamlayabilen bir ajan. Bu yetenek artık gidilecek yeni bir yer olarak satılmak yerine, insanların zaten kullandığı araçların içine yerleştiriliyor.

Talep sinyali gerçek. Gartner, kurumsal uygulamaların %40'ının 2026 sonuna kadar göreve özel yapay zeka ajanlarıyla birlikte geleceğini öngörüyor; bu oran 2025'te %5'in altındaydı (Gartner). Artık soru, ajanların gelip gelmeyeceği değil. Soru, anahtarların onlara emanet edilip edilemeyeceği.

Bilgisayar kullanımı ajanı nedir ve bir yapay zeka tarayıcısından farkı nedir?

Bir bilgisayar kullanımı ajanı (bazen CUA olarak da anılır), yazılımı bir insanın yaptığı gibi kullanır: ekran görüntüsü alır, nereye tıklayacağına veya ne yazacağına karar verir, harekete geçer, sonra tekrar bakar. Bir yapay zeka tarayıcısı, bu fikrin sadece bir teslim aracıdır: üzerine bir ajan iliştirilmiş bir Chromium tarayıcısı. Ancak alttaki ajan, pekâlâ bir masaüstü uygulamasının, bir bulut korumalı alanının (sandbox) veya bir işletim sisteminin içinde de çalışabilir.

Bu ayrım önemli, çünkü iki hata türü de birbirinden farklı. Bir sohbet asistanı bir soruyu yanıtlar. Bir bilgisayar kullanımı ajanı ise bir eylem gerçekleştirir ve bir eylemin sonuçları vardır: bir formu gönderebilir, para taşıyabilir veya bir dosyayı silebilir. Bu, ayrıca bu ajan sınıfının 2026'da agentik ticaret yazımızda ele aldığımız alışveriş ve ödeme ajanlarından bir adım ötede olmasının, ve 2026'da yapay zeka ajanlarında yeni olanlar yazımızda tarif ettiğimiz yönetişim katmanına neden ihtiyaç duyduğunun da sebebidir. Kontrolsüz yetenek bir ürün değildir. Bir yükümlülüktür.

Bilgisayar kullanımı ajanları şu anda nasıl sıralanıyor?

İki kıyaslama önemli ve bunlar çok farklı şeyleri ölçüyor. ScreenSpot Pro, temellendirmeyi (grounding) test eder: model, yüksek çözünürlüklü profesyonel bir arayüzde doğru düğmeyi, simgeyi veya alanı işaret edebiliyor mu? Ajanın çevresindeki iş akışını tamamlayıp tamamlayamayacağını test etmez. 11 Ağustos 2026 tarihli kamuya açık ScreenSpot Pro anlık görüntüsünde liderler birbirine yakındı ve alan küreseldi.

Sıra Model Laboratuvar (ülke) Lisans ScreenSpot Pro
1 Claude Opus 4.8 Anthropic (ABD) Kapalı 87.9%
2 GPT-5.4 OpenAI (ABD) Kapalı 85.4%
3 Qwen3.8 Max Alibaba (Çin) Kapalı 84.5%
4 Gemini 3.1 Pro Google (ABD) Kapalı 84.4%
5 Muse Spark Meta (ABD) Kapalı 84.1%
8 Muse Glimmer 30B Meta (ABD) Açık ağırlık 75.4%
10 Holo2-235B H Company (Fransa) Açık ağırlık 70.6%
13 Qwen3.5 397B Alibaba (Çin) Açık ağırlık 65.6%
15 Nemotron 3 Nano Omni NVIDIA (ABD) Açık ağırlık 57.8%

Kaynak: BenchLM ScreenSpot Pro liderlik tablosu, 11 Ağustos 2026 tarihli anlık görüntü. Sıralamalar aylık olarak değişir.

İki şey öne çıkıyor. Birincisi, 11 Ağustos 2026 itibarıyla ScreenSpot Pro'da puanlanan modeller arasında bir ABD kapalı modeli, Anthropic'in Claude'u (Opus 4.8), temellendirmede %87.9 ile önde gitti, ancak ilk dört birbirinden dört puandan az farkla ayrıldı ve bir Çin kapalı modeli, Alibaba'nın Qwen3.8 Max'i, bir ABD amiral gemisinin üzerinde üçüncü sırada yer aldı. İkincisi, açık ağırlık katmanı gerçek ve dünya çapında: Meta'nın Muse Glimmer'ı (ABD), H Company'nin Holo2'si (Fransa), Alibaba'nın Qwen'i (Çin) ve NVIDIA'nın Nemotron'u (ABD), hepsi, ByteDance'in UI-TARS'ı ve Zhipu'nun AutoGLM'i gibi Çinli laboratuvarların açık kaynaklı GUI-ajan soyağacının yanında yer alıyor.

Bu tabloyu kalıcı bir taç olarak değil, hareket hâlindeki bir liderlik tablosu olarak okuyun. Her iki ABD laboratuvarı da anlık görüntüden sonra daha yeni amiral gemileri çıkardı, Anthropic'in Claude Opus 5'i (24 Temmuz 2026) ve OpenAI'nin GPT-5.6'sı (9 Temmuz 2026), ve hiçbiri henüz ScreenSpot Pro'da puanlanmadı, dolayısıyla temellendirme liderliği "son söz" değil, "şu ana kadar puanlanan modeller arasında en iyisi" olarak okunmalı. Bu anlık görüntüde zirve, ince bir farkla Amerikan; genişlik küresel ve açık katman aradaki farkı kapatıyor. Bu alan aylık olarak yeniden sıralanıyor.

Kıyaslama puanları bu ajanların yapabildiklerini neden abartıyor?

Temellendirme bir ön koşuldur, bitiş çizgisi değil. Asıl zor soru, bir ajanın gerçek, çok adımlı bir işi tamamlayıp tamamlamadığıdır ve 2026'nın ortası itibarıyla dürüst cevap şu: genellikle hayır.

Görev başına ortalama kabaca 318 araç çağrısı yapan uzun ufuklu iş akışlarından oluşan bir kıyaslama olan OSWorld 2.0'da, en iyi ölçülen sistem görevlerin yalnızca yaklaşık %20.6'sını baştan sona tamamladı; kısmi kontrol noktaları sayıldığında bile %54.8 puan aldı (TestMu AI analizi). Bu kıyaslama sınıfında %50 ila %70 aralığında gördüğünüz herhangi bir rakam, neredeyse kesinlikle tam tamamlama değil, kontrol noktası puanlamasıdır. Aynı analiz ikinci bir tuzağa da dikkat çekiyor: bir OSWorld puanı genellikle tek seferlik bir tahmindir ve güvenilirlik, bir görevi bir kez çözmekten çıkarılamaz. Aynı görevi birkaç kez çalıştırın, tamamlama oranları düşer.

Ajanın nerede çalıştığı da önemli. Aynı analiz, web görevlerinde kabaca %80, masaüstü uygulamalarında ise kabaca %35 başarı olduğunu bildiriyor, dolayısıyla bir tarayıcıda yetenekli görünen bir ajan, tarayıcıdan çıktığı an belirgin biçimde daha az güvenilir hâle geliyor. "Yapay zeka tarayıcı ajanı"nın ilk biçim olmasının nedeni tam da bu: tarayıcı en dost canlısı yüzey, yapılandırılmış, hoşgörülü ve gözlemlemesi kolay.

Buradan çıkan sonuç, bilgisayar kullanımı ajanlarının sahte olduğu değil. Yetenek gerçek ve gelişiyorken güvenilirliğin geride kaldığı, her büyük yüzeyin hâlâ beta veya önizleme olarak etiketlendiği ve tek seferlik puanların teknolojiyi olduğundan iyi gösterdiği. Bir demo için %20 tamamlama bir mucizedir. Denetimsiz bir iş süreci için ise döngüde bir insan tutmak için bir neden.

Kimsenin çözemediği güvenlik sorunu

Güvenilirlik açığı bir verimlilik meselesidir. Güvenlik açığı ise bir yönetişim meselesidir ve daha kötüdür. Black Hat USA 2026'da, Zenity Labs'tan araştırmacılar, tedarikçiler genelinde agentik tarayıcıları etkileyen ve "PleaseFix" olarak adlandırdıkları bir tık gerektirmeyen (zero-click) istismar sınıfını sergiledi (Dark Reading). Temel neden yapısaldır: bir yapay zeka ajanı e-postalardan, takvimlerden, belgelerden ve web sayfalarından içerik çeker ve meşru bir talimatı, o içeriğin içine gizlenmiş kötü niyetli bir talimattan güvenilir biçimde ayırt edemez. Bu yüzden her ikisini de uygular.

Sergilenen saldırılar teorik değil. Zehirlenmiş bir takvim daveti, hiçbir kullanıcı etkileşimi olmadan bir ajanı ele geçirdi ve yerel dosyalara ve parola yöneticisi iş akışlarına ulaştı. Sıradan görünen bir bağlantı, başka bir ajanı kurbanın kendi mesajlaşma hesabından oltalama (phishing) mesajları göndermeye tetikledi. Zenity ekibinin ifadesiyle, bir yapay zeka tarayıcısı "web'de sizin çalışanınız gibi hareket eder, zaten e-postasına, dosyalarına, takvimine ve iş uygulamalarına giriş yapmış hâldedir." Bir kişinin tam yetkili erişimini devralan bir ajan, o kişinin tam etki alanını da devralır.

Temiz bir yama yok, çünkü açıklık tek bir hatadan değil, tasarımdan kaynaklanıyor. Araştırmacıların tavsiyesi manidar: ajanın ele geçirileceğini varsayın, yapabileceği en kötü şeye karar verin ve gerçekten ihtiyaç duymadığı her şeyi elinden alın. Bu bir yazılım güncellemesi değil, bir yönetişim talimatıdır. Alıcı güveninin hâlâ dar olmasının nedeni de bu. Bir sektör anketinde, yöneticilerin yalnızca yaklaşık %20'si bir yapay zeka ajanına finansal işlemleri yürütme konusunda güvenebileceğini söyledi; daha düşük riskli veri analizi için ise bu oran %38'di (PwC AI Agent Survey). Gartner ise, maliyet, belirsiz değer ve zayıf risk kontrollerini gerekçe göstererek, agentik yapay zeka projelerinin %40'tan fazlasının 2027 sonuna kadar iptal edileceğini öngörüyor (Gartner).

Bu işletmeler için ne anlama geliyor?

İşte pratik okuma. Tarayıcıyı tam giriş yapmış kimliğinizle kullanan genel amaçlı bir ajan güçlü, güvenilmez ve kontrol altına alması zordur. Çoğu iş işi için buna ihtiyacınız yok. İhtiyacınız olan, sonucun (rezerve edilmiş bir randevu, yanıtlanmış bir soru, sorgulanmış bir sipariş) dar, yönetilen bir yol üzerinden yakalanması ve bir kişinin araya girebilmesidir.

Her şeyin anahtarı verilmiş bir ajan ile bir görevin tam olarak ihtiyaç duyduğu araçların verildiği bir ajan arasındaki fark budur. Entagl'da, müşteriyle yüzleşen ajan, bir tarayıcıyı pilotluk eden tek bir model değil, bir çok ajanlı hattır (multi-agent pipeline). Yalnızca dokunması gereken sistemleri çağıran kapsamlı araçlar ve özel HTTP fonksiyonları aracılığıyla hareket eder, gerçek bir takvime gerçek randevular rezerve eder ve her yanıtta çıktı korkuluklarıyla (guardrails) bir insan gelen kutusuna devreder. Bir müşterinin hesaplarına giriş yapmaz ve açık web'de doğaçlama yapmaz, dolayısıyla zehirlenmiş bir sayfa veya kötü niyetli bir takvim davetinin ineceği bir yer yoktur. İnsanın döngüde olduğu yapay zeka, açıklandı yazımızda savunduğumuz gibi, tasarım ilkesi basittir: yapay zeka harekete geçer, insanlar yönetir.

2026 tarayıcı-ajanı anının dersi "teknolojiyi bekleyin" değil. "Teknolojiyi kapsamlandırın." Ajanlarla kazanan işletmeler, azami özerklik verip okuduğu içeriğin her zaman dürüst olduğunu umanlar değil, bir ajana net bir görev, bunu yapmak için asgari erişim ve tırmandırma yolunda bir insan verenlerdir.

SSS

Bir yapay zeka tarayıcısı ile bir bilgisayar kullanımı ajanı arasındaki fark nedir?

Bir yapay zeka tarayıcısı, içine bir yapay zeka ajanı gömülmüş bir web tarayıcısıdır. Bir bilgisayar kullanımı ajanı ise alttaki yetenektir: ekrana bakarak, tıklayarak ve yazarak yazılımı kullanan bir model. Ajan bir tarayıcının, bir masaüstü uygulamasının veya bir bulut korumalı alanının içinde çalışabilir. 2026'da sektör, bağımsız yapay zeka tarayıcıları satmaktan uzaklaşıp bilgisayar kullanımı ajanlarını mevcut araçlara gömmeye yöneldi; OpenAI'nin Atlas tarayıcısını emekliye ayırıp özellikleri ChatGPT'ye taşımasının nedeni de bu.

Bilgisayar kullanımı ajanları, iş görevlerini denetimsiz yürütecek kadar güvenilir mi?

Çoğu yüksek riskli görev için henüz değil. Uzun, çok adımlı iş akışlarında, en iyi ölçülen sistemler görevlerin yalnızca yaklaşık %20'sini baştan sona tamamlıyor, tek seferlik kıyaslama puanları gerçek güvenilirliği abartıyor ve ajanlar tarayıcının dışında belirgin biçimde daha zayıf. İş kullanımı için güvenli örüntü, tam denetimsiz özerklik değil, döngüde bir insanın bulunduğu dar kapsamlı bir ajandır.

Yapay zeka tarayıcı ajanlarıyla başlıca güvenlik riski nedir?

İçerik yoluyla yönerge enjeksiyonu (prompt injection). Bir ajan, gerçek bir talimatı bir e-postaya, takvim davetine, belgeye veya web sayfasına gizlenmiş kötü niyetli bir talimattan güvenilir biçimde ayıramaz, dolayısıyla bir saldırgan gizli komutlar sokuşturup ajanı kullanıcının kendi giriş yapmış erişimini kullanarak yönlendirebilir. Araştırmacılar, Black Hat USA 2026'da birden çok agentik tarayıcıda bir tık gerektirmeyen ele geçirmeler sergiledi. Önlem, ajanın davranacağına güvenmek değil, ajanın ulaşabileceği şeyleri sınırlamaktır.

Küçük bir işletme yapay zeka ajanlarını güvenli biçimde nasıl benimsemeli?

Sınırlı bir işle başlayın (müşteri mesajlarını yanıtlamak, randevu rezerve etmek, sipariş sorgulamak), ajana yalnızca o işin ihtiyaç duyduğu araçları ve verileri verin, bir insanı devralabilecek durumda tutun ve giriş yapmış tarayıcınızı kullanmak yerine yönetilen araçlar aracılığıyla hareket eden platformları tercih edin. Bu, bir şeyler ters giderse etki alanını küçük tutarken verimlilik kazancını yakalar.

Yönetilen, insanın döngüde olduğu bir ajanın sohbet ve ses genelinde gerçek müşteri konuşmalarını nasıl ele aldığını görün. 30 dakikalık bir demo ayırtın ve bunu sizin işinize uyarlayalım.

Kaynaklar: yapay zeka tarayıcısı kaymasına dair 9to5Mac ve TechCrunch; benimseme ve iptallere dair Gartner ve Gartner; temellendirmeye dair BenchLM ScreenSpot Pro (11 Ağustos 2026); OSWorld 2.0 tamamlama oranlarına dair TestMu AI; Zenity Labs "PleaseFix" araştırmasına dair Dark Reading; ajan güvenine dair PwC AI Agent Survey. Model sürümleri ve sıralamaları Ağustos 2026 itibarıyla günceldir ve aylık olarak değişir.

Yayınlayan Entagl Team on