AI News · industry
Un millón de tokens ya es el estándar. La mayor parte no funciona.
Este año todos los laboratorios serios lanzaron una ventana de contexto de un millón de tokens, incluidos los de pesos abiertos. Los benchmarks dicen que los modelos solo usan de forma fiable una parte, y lo que le das al modelo sigue importando más que lo que cabe.

A septiembre de 2026, una ventana de contexto de un millón de tokens ya es una especificación de partida. Anthropic, OpenAI, Google y los laboratorios chinos de pesos abiertos la ofrecen. El benchmark RULER de NVIDIA encontró que, entre los modelos que declaraban 32K tokens o más, solo la mitad aguantaba a 32K. La ventana creció. La parte fiable creció más despacio.
¿Quién ofrece de verdad una ventana de un millón de tokens?
La amplitud importa más que cualquier cifra suelta, porque indica que la capacidad dejó de ser una ventaja defendible. Es el mínimo para jugar, y en dos de estos casos puedes descargarte los pesos.
| Modelo | Laboratorio (país) | Ventana de contexto | Pesos |
|---|---|---|---|
| Claude Opus 5.5 | Anthropic (EE. UU.) | 1M, 128K de salida máx. | Cerrados |
| GPT-6.1 Sol | OpenAI (EE. UU.) | 1,050,000, 128K de salida máx. | Cerrados |
| Gemini 3.8 Flash | Google (EE. UU.) | 1M, 64K de salida máx. | Cerrados |
| DeepSeek-V4.1-Flash | DeepSeek (China) | Hasta 1M | Abiertos |
| Kimi K3 | Moonshot AI (China) | 1M | Abiertos |
| Mistral Large 3 | Mistral (Francia) | 256K | Abiertos |
De esa tabla destacan dos cosas. Primero, los laboratorios chinos están a la par en esta especificación, y encima publican los pesos. La ficha del modelo de DeepSeek describe una arquitectura mixture-of-experts de 552B parámetros, entrenada con atención dispersa a 64K y extendida a un millón de tokens más adelante en el entrenamiento. Kimi K3 llegó a Amazon Bedrock el 18 de septiembre de 2026 con visión nativa y caché de prompts explícita. Si lo que buscas es la foto general de la clasificación y no el corte por ventana de contexto, lo cubrimos en Los mejores LLM de 2026: abiertos, cerrados y globales.
Segundo, Mistral se saltó la carrera. Sus límites publicados sitúan a Mistral Large 3 en 256K tokens, y el resto de su gama se queda en 128K o 256K. Es deliberado, y conviene fijarse cuando una carrera de especificaciones tiene a alguien creíble que se abstiene.
¿Qué cabe de verdad en un millón de tokens?
La propia documentación de Google da la respuesta concreta más clara. Un millón de tokens son aproximadamente 50,000 líneas de código, ocho novelas en inglés de extensión media o transcripciones de más de 200 episodios de pódcast.
Para una empresa, la traducción útil es otra: un millón de tokens es muchísimo más de lo que necesitará jamás una sola conversación con un cliente. Un año de hilos de WhatsApp con un mismo cliente ni se acerca. Así que, si usas IA sobre los mensajes de tus clientes, la ventana dejó de ser tu límite hace tiempo. Tu límite es la selección, y siempre lo fue.
¿Usan los modelos toda la ventana?
No de forma uniforme, y lo dicen los propios proveedores.
El artículo de RULER (NVIDIA, COLM 2024) es la formulación más limpia del problema. Fue más allá de la simple prueba de la aguja en el pajar, hasta el rastreo multisalto y la agregación, evaluó 17 modelos de contexto largo y encontró que, pese a puntuaciones casi perfectas en la prueba fácil de recuperación, «casi todos los modelos muestran grandes caídas de rendimiento a medida que aumenta la longitud del contexto». La mitad de los modelos que declaraban 32K no sostenían la calidad a 32K.
El informe Context Rot de Chroma (Hong, Troynikov y Huber, julio de 2025) probó 18 modelos con tareas deliberadamente simples y encontró que el rendimiento se degrada a medida que crece la entrada, «a menudo de formas sorprendentes y no uniformes». La caída es irregular, y cuesta más predecirla cuanto menos se parece literalmente la aguja a la pregunta.
Google expone la limitación en su propia guía de contexto largo. Las puntuaciones de aguja en el pajar, señala, cubren el montaje básico de una sola aguja: «En casos en los que puedas tener varias agujas o fragmentos concretos de información que estés buscando, el modelo no rinde con la misma precisión». Las preguntas reales de los clientes casi siempre llevan varias agujas. Un cliente que pregunta si puedes atenderle el jueves, si el depósito es reembolsable y si su terapeuta habitual está trabajando ha enterrado tres agujas en un solo mensaje.
La misma guía ofrece una regla práctica que no cuesta nada aplicar: pon tu pregunta al final del prompt, después del contexto. Con entradas largas, los modelos responden mejor así.
Por qué todos los laboratorios llegaron aquí a la vez
La ingeniería interesante de 2026 consistió en hacer que leer una ventana larga una y otra vez saliera barato. DeepSeek-V4.1-Flash lo dice sin rodeos y se presenta en torno a la compresión de la caché KV.
La economía se movió en la misma dirección del lado cerrado. Cuando OpenAI lanzó GPT-6 Sol y Luna el 22 de septiembre, bajó los precios de la API un 50% y subió las tasas de acierto de caché por defecto, con un descuento del 90% en las lecturas de tokens de entrada cacheados. En el mismo anuncio, GitHub informó de que, a lo largo de varios meses, las mejoras de caché redujeron en más de un 50% la proporción de tokens de prompt que necesitaban procesarse de nuevo, sobre miles de millones de peticiones. Una semana después, el 29 de septiembre, OpenAI sustituyó ese lanzamiento por GPT-6.1 Sol y volvió a reducir a la mitad el precio de la entrada cacheada. Ese es el ritmo contra el que estás construyendo.
El contexto largo se volvió normal porque la caché abarató releer un prompt grande, no porque los modelos hayan mejorado prestando atención a lo largo de un millón de tokens. Son problemas distintos, y solo se resolvió uno.
La factura no desapareció, se movió
Tres costes sobreviven a una ventana más grande, y si estás presupuestando un despliegue de IA deberías ponerles precio a los tres.
- Los tokens siguen midiéndose, y el contador puede subir de escalón. Una lectura de caché sigue costando dinero, solo que menos que una lectura nueva. La propia página del modelo de OpenAI lo dice claro: los prompts de más de 272K tokens de entrada se cobran a 2x en las tarifas de entrada y de caché, y a 1.5x en la de salida, para toda la petición. Llena un cuarto de la ventana y tu economía unitaria cambia.
- La latencia escala con la entrada. La recomendación de Google es tajante: las consultas más largas suelen implicar más tiempo hasta el primer token. En la mensajería con clientes, eso te cuesta dinero directamente. Nuestro Estudio de velocidad de respuesta, sobre 32,581 conversaciones, encontró que las respuestas en menos de 60 segundos convertían al 35.1%, frente al 12.2% de las respuestas entre 5 y 60 minutos.
- La precisión es la que notas la última. Una respuesta equivocada salida de un prompt inflado se ve exactamente igual que una correcta, hasta que un cliente actúa según ella.
Qué cambia esto si usas IA en las conversaciones con clientes
Menos de lo que sugieren las fichas técnicas.
La ventana de un millón de tokens elimina una excusa. La decisión de diseño sigue ahí. Tú eliges qué ve el modelo en cada turno, y la evidencia anterior dice que un prompt más ajustado y mejor seleccionado gana a uno más grande. El Receptionist de Entagl recupera los datos concretos que pide cada pregunta mediante búsqueda semántica sobre las FAQs, los servicios y el catálogo del negocio, en vez de cargar el negocio entero en cada turno. La selección de modelo va por niveles según la carga de trabajo, así que una pregunta sencilla no se factura a tarifa de modelo insignia. Cuando el Coordinator hace una llamada de confirmación, ya tiene el historial de chat de esa misma ficha de cliente, así que no hay que reconstruir nada a partir de un muro de texto en bruto.
Es la misma disciplina que siempre exigió una buena recuperación, y los benchmarks la siguen validando. Profundizamos en la parte de memoria en La memoria de los agentes de IA en 2026, que repasa los benchmarks que separan recordar de recuperar. La parte de precios de esa misma tendencia, con los modelos pequeños ya baratos para asumir la mayor parte del trabajo de una empresa, está en Los modelos de lenguaje pequeños en 2026. Y si estás decidiendo sobre qué laboratorio construir mientras estas especificaciones convergen, Por qué no deberías montar tu negocio sobre un solo modelo de IA defiende la portabilidad.
Si quieres ver cómo es una selección de contexto disciplinada en tus propias conversaciones, reserva una demo de 30 minutos y repasamos tu historial real de mensajes.
FAQ
¿Una ventana de contexto más grande sustituye a la recuperación?
No. Cambia cuándo compensa la ingeniería de la recuperación. El motivo sigue en pie. El coste sigue escalando con los tokens procesados, la latencia sube con la longitud de la entrada, y tanto RULER como Chroma muestran que la precisión se degrada cuando crecen las entradas. La recuperación estrecha los tres problemas a la vez.
¿Cuál es la mayor ventana de contexto disponible en 2026?
Varios modelos aceptan un millón de tokens o más, entre ellos Claude Opus 5.5, GPT-6.1 Sol con 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash y Kimi K3. Unos pocos anuncian más. La pregunta más útil es qué parte de la ventana usa un modelo de forma fiable, que es lo que intentan medir benchmarks como RULER, y esa cifra es sistemáticamente menor que la anunciada.
¿Tienen los modelos de pesos abiertos ventanas de contexto más pequeñas?
Ya no. DeepSeek-V4.1-Flash y el Kimi K3 de Moonshot aceptan un millón de tokens con los pesos publicados, así que alojarlos tú mismo ya no significa conformarse con una ventana corta. Mistral Large 3 se queda en 256K por decisión propia, lo que no dice nada sobre los modelos abiertos en general.
¿Cuánto contexto necesita realmente una conversación de atención al cliente?
Muchísimo menos de un millón de tokens. Incluso un hilo largo de varios meses con un mismo cliente es una fracción pequeña de una ventana moderna. El trabajo está en decidir qué datos del negocio, qué pedidos anteriores y qué mensajes previos entran en este turno concreto.
¿El contexto largo hace que la IA tarde más en responder?
En general sí. La guía de contexto largo de Google señala que las consultas más largas tienen un tiempo mayor hasta el primer token. En la mensajería con clientes, donde la velocidad de respuesta va ligada a la conversión, ese intercambio merece medirse sobre tu propio tráfico.
Fuentes: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, julio de 2025); documentación de contexto largo de la API de Gemini y notas del modelo Gemini 3.8 Flash; documentación del modelo Claude Opus 5.5; referencia del modelo GPT-6.1 Sol de OpenAI y los anuncios de GPT-6 Sol y Luna (22 sep 2026) y GPT-6.1 Sol (29 sep 2026); ficha del modelo DeepSeek-V4.1-Flash; Kimi K3 en Amazon Bedrock (18 sep 2026); Mistral Large 3 y limitaciones conocidas; Estudio de velocidad de respuesta de Entagl (2026). Especificaciones de los modelos verificadas el 30 de septiembre de 2026; cambian con frecuencia.