Saltar al contenido
Entagl

AI News · industry

Agentes de navegador con IA en 2026: qué es real y qué es arriesgado

OpenAI retiró su navegador Atlas el 9 de agosto. La verdadera acción se trasladó a los agentes que usan la computadora y operan software directamente. Aquí verás dónde se sitúan, qué siguen haciendo mal y la realidad de seguridad que las empresas no pueden ignorar.

Entagl Team9 min de lectura
Agentes de navegador con IA en 2026: qué es real y qué es arriesgado

OpenAI cerró su navegador dedicado ChatGPT Atlas el 9 de agosto de 2026, menos de un año después de su lanzamiento, y el mensaje detrás de la decisión es la verdadera historia: el "navegador con IA" independiente se está desvaneciendo, mientras que el agente que opera software en tu nombre es hacia donde corre el sector. A agosto de 2026, los mejores modelos de uso de computadora pueden localizar un objetivo en una pantalla profesional con una precisión cercana al 88%, pero incluso el mejor de ellos solo completa alrededor de una de cada cinco tareas de varios pasos de principio a fin. Los agentes de navegador con IA son genuinamente útiles y genuinamente poco fiables al mismo tiempo, y la brecha entre esos dos hechos es donde vive hoy cada decisión de compra.

Este artículo explica qué cambió en 2026, dónde se sitúan realmente los agentes de uso de computadora en el panorama global, por qué las cifras destacadas de los benchmarks exageran lo que pueden hacer, y el problema de seguridad que ningún proveedor ha resuelto. Si diriges un negocio, la conclusión práctica está al final.

¿Qué pasó con los navegadores con IA en 2026?

Los navegadores con IA fueron el producto de moda de 2025. Empresas grandes y pequeñas intentaron adueñarse de la interfaz que la gente usa para navegar por la web integrando un modelo en ella. En 2026 esa apuesta se deshizo rápido. OpenAI confirmó que retiraría Atlas e integraría sus funciones de navegación en la app de escritorio de ChatGPT, con el navegador programado para dejar de funcionar el 9 de agosto (9to5Mac). The Browser Company se vendió a Atlassian, y los navegadores rivales centrados en IA se consolidaron o cambiaron de rumbo.

El hilo conductor, como lo expresó TechCrunch, es que "el foco se ha desplazado hacia los agentes y la automatización" (TechCrunch). Un navegador aparte nunca fue el objetivo. El objetivo es un agente que pueda leer una página, hacer clic, escribir y terminar una tarea. Esa capacidad ahora se está incorporando a las herramientas que la gente ya usa, en lugar de venderse como un nuevo lugar al que ir.

La señal de demanda es real. Gartner espera que el 40% de las aplicaciones empresariales incluyan agentes de IA específicos para tareas para finales de 2026, frente a menos del 5% en 2025 (Gartner). La pregunta ya no es si llegan los agentes. Es si se les puede confiar las llaves.

¿Qué es un agente de uso de computadora y en qué se diferencia de un navegador con IA?

Un agente de uso de computadora (a veces llamado CUA) opera el software como lo hace una persona: toma una captura de pantalla, decide dónde hacer clic o qué escribir, actúa y luego vuelve a mirar. Un navegador con IA es un vehículo de entrega para esa idea, un navegador basado en Chromium con un agente adosado. Pero el agente subyacente puede ejecutarse con la misma facilidad dentro de una app de escritorio, un entorno aislado en la nube o un sistema operativo.

La distinción importa porque los dos modos de fallo son diferentes. Un asistente de chat responde una pregunta. Un agente de uso de computadora realiza una acción, y una acción tiene consecuencias: puede enviar un formulario, mover dinero o borrar un archivo. Por eso también esta clase de agente está un paso más allá de los agentes de compra y pago que cubrimos en el comercio agéntico en 2026, y por eso necesita la capa de gobernanza que describimos en qué hay de nuevo en los agentes de IA en 2026. La capacidad sin control no es un producto. Es un pasivo.

¿Dónde se sitúan ahora mismo los agentes de uso de computadora?

Dos benchmarks importan, y miden cosas muy diferentes. ScreenSpot Pro evalúa el anclaje: ¿puede el modelo señalar el botón, icono o campo correcto en una interfaz profesional de alta resolución? No evalúa si el agente puede terminar el flujo de trabajo que lo rodea. En la instantánea pública de ScreenSpot Pro con fecha del 11 de agosto de 2026, los líderes estaban muy parejos, y el panorama era global.

Puesto Modelo Laboratorio (país) Licencia ScreenSpot Pro
1 Claude Opus 4.8 Anthropic (EE. UU.) Cerrada 87.9%
2 GPT-5.4 OpenAI (EE. UU.) Cerrada 85.4%
3 Qwen3.8 Max Alibaba (China) Cerrada 84.5%
4 Gemini 3.1 Pro Google (EE. UU.) Cerrada 84.4%
5 Muse Spark Meta (EE. UU.) Cerrada 84.1%
8 Muse Glimmer 30B Meta (EE. UU.) Peso abierto 75.4%
10 Holo2-235B H Company (Francia) Peso abierto 70.6%
13 Qwen3.5 397B Alibaba (China) Peso abierto 65.6%
15 Nemotron 3 Nano Omni NVIDIA (EE. UU.) Peso abierto 57.8%

Fuente: tabla de clasificación BenchLM ScreenSpot Pro, instantánea con fecha del 11 de agosto de 2026. Las clasificaciones se reordenan cada mes.

Dos cosas destacan. Primero, entre los modelos puntuados en ScreenSpot Pro a fecha del 11 de agosto de 2026, un modelo cerrado estadounidense, el Claude de Anthropic (Opus 4.8), lideró el anclaje con un 87.9%, pero los cuatro primeros quedaron a menos de cuatro puntos entre sí, y un modelo cerrado chino, el Qwen3.8 Max de Alibaba, se clasificó tercero por encima de un buque insignia estadounidense. Segundo, el nivel de pesos abiertos es real y mundial: el Muse Glimmer de Meta (EE. UU.), el Holo2 de H Company (Francia), el Qwen de Alibaba (China) y el Nemotron de NVIDIA (EE. UU.) aparecen todos, junto con el linaje de agentes GUI de código abierto de laboratorios chinos como UI-TARS de ByteDance y AutoGLM de Zhipu.

Lee esa tabla como una clasificación en movimiento, no como una corona permanente. Ambos laboratorios estadounidenses lanzaron buques insignia más nuevos después de la instantánea, el Claude Opus 5 de Anthropic (24 de julio de 2026) y el GPT-5.6 de OpenAI (9 de julio de 2026), y ninguno está puntuado todavía en ScreenSpot Pro, así que el liderazgo en anclaje se lee como "el mejor entre los modelos puntuados hasta ahora", no como la última palabra. En esta instantánea la cima es estadounidense por un margen estrecho, la amplitud es global y el nivel abierto se está acercando. Este panorama se reordena cada mes.

Por qué las puntuaciones de los benchmarks exageran lo que estos agentes pueden hacer

El anclaje es un requisito previo, no una meta final. La pregunta más difícil es si un agente completa un trabajo real de varios pasos, y la respuesta honesta a mediados de 2026 es: normalmente no.

En OSWorld 2.0, un benchmark de flujos de trabajo de largo horizonte que promedian aproximadamente 318 llamadas a herramientas por tarea, el mejor sistema medido completó solo alrededor del 20.6% de las tareas de principio a fin, incluso al obtener un 54.8% cuando se contaban los puntos de control parciales (análisis de TestMu AI). Cualquier cifra que veas en el rango del 50% al 70% en esta clase de benchmark es casi con certeza puntuación por puntos de control, no finalización completa. El mismo análisis señala una segunda trampa: una puntuación de OSWorld suele ser una estimación de una sola ejecución, y la fiabilidad no puede inferirse de resolver una tarea una vez. Ejecuta la misma tarea varias veces y las tasas de finalización caen.

Dónde funciona el agente también importa. El mismo análisis reporta aproximadamente un 80% de éxito en tareas web frente a aproximadamente un 35% en aplicaciones de escritorio, así que un agente que parece capaz en un navegador es notablemente menos fiable en cuanto sale de él. Esto es exactamente por qué el "agente de navegador con IA" fue el primer formato: el navegador es la superficie más amigable, estructurada, indulgente y fácil de observar.

La conclusión no es que los agentes de uso de computadora sean falsos. Es que la capacidad es real y va mejorando mientras la fiabilidad se queda atrás, cada superficie importante sigue etiquetada como beta o vista previa, y las puntuaciones de una sola ejecución adornan la tecnología. Para una demo, un 20% de finalización es un milagro. Para un proceso de negocio desatendido, es una razón para mantener a un humano en el circuito.

El problema de seguridad que nadie ha resuelto

La brecha de fiabilidad es un problema de productividad. La brecha de seguridad es un problema de gobernanza, y es peor. En Black Hat USA 2026, investigadores de Zenity Labs demostraron una clase de exploits de cero clics que llaman "PleaseFix" y que afecta a los navegadores agénticos de distintos proveedores (Dark Reading). La causa raíz es estructural: un agente de IA extrae contenido de correos electrónicos, calendarios, documentos y páginas web, y no puede distinguir de forma fiable una instrucción legítima de una maliciosa oculta dentro de ese contenido. Así que sigue ambas.

Los ataques demostrados no son teóricos. Una invitación de calendario envenenada secuestró a un agente sin ninguna interacción del usuario y alcanzó archivos locales y flujos de trabajo de gestores de contraseñas. Un enlace de apariencia normal indujo a otro agente a enviar mensajes de phishing desde la propia cuenta de mensajería de la víctima. Como lo expresó el equipo de Zenity, un navegador con IA "actúa en la web como tu empleado, ya con la sesión iniciada en su correo, archivos, calendario y aplicaciones de trabajo". Un agente que hereda el acceso autenticado completo de una persona hereda también todo su radio de impacto.

No hay un parche limpio, porque la exposición proviene del diseño, no de un solo error. El consejo de los investigadores es revelador: asume que el agente será secuestrado, decide lo peor que podría hacer y quítale todo lo que no necesite de verdad. Eso es una instrucción de gobernanza, no una actualización de software. También es por eso que la confianza de los compradores sigue siendo estrecha. En una encuesta del sector, solo alrededor del 20% de los ejecutivos dijo que confiaría en un agente de IA para ejecutar transacciones financieras, frente al 38% para análisis de datos de menor riesgo (PwC AI Agent Survey). Gartner, por su parte, espera que más del 40% de los proyectos de IA agéntica se cancelen para finales de 2027, citando el coste, el valor poco claro y los controles de riesgo débiles (Gartner).

Qué significa esto para las empresas

Aquí está la lectura práctica. Un agente de propósito general que opera un navegador con tu identidad completa ya autenticada es potente, poco fiable y difícil de contener. Para la mayoría de los trabajos de negocio, no necesitas eso. Necesitas el resultado (una cita reservada, una pregunta respondida, un pedido consultado) capturado a través de un camino estrecho y gobernado, con una persona capaz de intervenir.

Esa es la diferencia entre un agente al que se le dan las llaves de todo y un agente al que se le dan exactamente las herramientas que una tarea requiere. En Entagl, el agente de cara al cliente es un pipeline multiagente, no un único modelo pilotando un navegador. Actúa a través de herramientas acotadas y funciones HTTP personalizadas que llaman solo a los sistemas que se supone debe tocar, reserva citas reales en un calendario real y hace el traspaso a una bandeja de entrada humana con barreras de protección de salida en cada respuesta. No inicia sesión en las cuentas de un cliente ni improvisa por la web abierta, así que una página envenenada o una invitación de calendario maliciosa no tienen dónde aterrizar. Como argumentamos en la IA con humano en el circuito, explicada, el principio de diseño es simple: la IA actúa, los humanos gobiernan.

La lección del momento de los agentes de navegador de 2026 no es "espera a que llegue la tecnología". Es "acota la tecnología". Las empresas que ganan con los agentes son las que le dan a un agente un trabajo claro, el acceso mínimo para hacerlo y una persona en el camino de escalado, en lugar de la máxima autonomía y la esperanza de que el contenido que lee sea siempre honesto.

FAQ

¿Cuál es la diferencia entre un navegador con IA y un agente de uso de computadora?

Un navegador con IA es un navegador web con un agente de IA integrado. Un agente de uso de computadora es la capacidad subyacente: un modelo que opera software mirando la pantalla, haciendo clic y escribiendo. El agente puede ejecutarse dentro de un navegador, una app de escritorio o un entorno aislado en la nube. En 2026 el sector se alejó de vender navegadores con IA independientes y se orientó a incorporar agentes de uso de computadora en herramientas existentes, y por eso OpenAI retiró su navegador Atlas y trasladó las funciones a ChatGPT.

¿Son los agentes de uso de computadora lo bastante fiables para ejecutar tareas de negocio sin supervisión?

Todavía no para la mayoría de las tareas de alto riesgo. En flujos de trabajo largos y de varios pasos, los mejores sistemas medidos completan solo alrededor del 20% de las tareas de principio a fin, las puntuaciones de benchmark de una sola ejecución exageran la fiabilidad real, y los agentes son notablemente más débiles fuera del navegador. Para el uso empresarial, el patrón seguro es un agente estrictamente acotado con un humano en el circuito, no autonomía plena y desatendida.

¿Cuál es el principal riesgo de seguridad de los agentes de navegador con IA?

La inyección de instrucciones a través del contenido. Un agente no puede separar de forma fiable una instrucción genuina de una maliciosa oculta en un correo electrónico, invitación de calendario, documento o página web, así que un atacante puede colar comandos ocultos y redirigir al agente usando el propio acceso autenticado del usuario. Los investigadores demostraron secuestros de cero clics en varios navegadores agénticos en Black Hat USA 2026. La mitigación es limitar lo que el agente puede alcanzar, no confiar en que se comporte.

¿Cómo debería adoptar una pequeña empresa los agentes de IA de forma segura?

Empieza con un trabajo acotado (responder mensajes de clientes, reservar citas, consultar pedidos), dale al agente solo las herramientas y los datos que ese trabajo necesita, mantén a un humano capaz de tomar el control, y prefiere plataformas que actúen a través de herramientas gobernadas en lugar de operar tu navegador con la sesión iniciada. Esto captura la ganancia de productividad mientras mantiene pequeño el radio de impacto si algo sale mal.

Descubre cómo un agente gobernado y con humano en el circuito gestiona conversaciones reales con clientes en chat y voz. Reserva una demo de 30 minutos y la adaptaremos a tu negocio.

Fuentes: 9to5Mac y TechCrunch sobre el cambio en los navegadores con IA; Gartner y Gartner sobre adopción y cancelación; BenchLM ScreenSpot Pro (11 de agosto de 2026) sobre anclaje; TestMu AI sobre las tasas de finalización de OSWorld 2.0; Dark Reading sobre la investigación "PleaseFix" de Zenity Labs; PwC AI Agent Survey sobre la confianza en los agentes. Las versiones de los modelos y las clasificaciones son actuales a agosto de 2026 y cambian cada mes.

Publicado por Entagl Team on