Pular para o conteúdo

AI News · industry

Um milhão de tokens virou padrão. A maior parte não funciona.

Todo laboratório sério lançou uma janela de contexto de um milhão de tokens neste ano, inclusive os de pesos abertos. Os benchmarks dizem que os modelos usam com segurança só uma fração dela, e o que você entrega ao modelo ainda importa mais do que o que cabe nele.

Entagl Team8 min de leitura
Um milhão de tokens virou padrão. A maior parte não funciona.

Em setembro de 2026, uma janela de contexto de um milhão de tokens já é especificação básica. Anthropic, OpenAI, Google e os laboratórios de pesos abertos da China entregam todos a sua. O benchmark RULER da NVIDIA constatou que, entre os modelos que alegam 32K tokens ou mais, só metade se sustentava em 32K. A janela cresceu. A parte confiável dela cresceu mais devagar.

Quem entrega de fato uma janela de um milhão de tokens?

A distribuição importa mais do que qualquer número isolado, porque mostra que essa capacidade deixou de ser um fosso competitivo. Virou requisito mínimo, e em dois desses casos você pode baixar os pesos.

Modelo Laboratório (país) Janela de contexto Pesos
Claude Opus 5.5 Anthropic (EUA) 1M, saída máx. de 128K Fechados
GPT-6.1 Sol OpenAI (EUA) 1,050,000, saída máx. de 128K Fechados
Gemini 3.8 Flash Google (EUA) 1M, saída máx. de 64K Fechados
DeepSeek-V4.1-Flash DeepSeek (China) Até 1M Abertos
Kimi K3 Moonshot AI (China) 1M Abertos
Mistral Large 3 Mistral (França) 256K Abertos

Duas coisas saltam aos olhos nessa tabela. Primeiro, os laboratórios chineses estão em paridade nessa especificação, e estão liberando os pesos. O model card da DeepSeek descreve uma espinha dorsal mixture-of-experts de 552B parâmetros, treinada com atenção esparsa em 64K e estendida para um milhão de tokens mais adiante no treinamento. O Kimi K3 chegou ao Amazon Bedrock em 18 de setembro de 2026 com visão nativa e cache explícito de prompt. Se você quer o panorama mais amplo do ranking em vez do recorte de janela de contexto, escrevemos sobre isso em Os melhores LLMs de 2026: abertos, fechados e globais.

Segundo, a Mistral ficou de fora da corrida. Os limites que ela publica colocam o Mistral Large 3 em 256K tokens, e o resto da linha fica em 128K ou 256K. Isso é deliberado, e vale reparar quando uma corrida por especificação tem alguém se abstendo com credibilidade.

O que cabe, na prática, em um milhão de tokens?

A documentação do próprio Google dá a resposta concreta mais clara. Um milhão de tokens é mais ou menos 50,000 linhas de código, oito romances em inglês de tamanho médio ou transcrições de mais de 200 episódios de podcast.

Para uma empresa, a tradução útil é outra: um milhão de tokens é muito mais do que qualquer conversa isolada com um cliente vai precisar algum dia. Um ano de conversas de WhatsApp com o mesmo cliente não chega perto. Então, se você roda IA em cima de mensagens de clientes, a janela deixou de ser o seu limite faz tempo. Seu limite é a seleção, e sempre foi.

Os modelos usam mesmo a janela inteira?

Não de forma uniforme, e os próprios fornecedores dizem isso.

O artigo do RULER (COLM 2024), da NVIDIA, é a formulação mais limpa do problema. Ele foi além do teste simples de agulha no palheiro e entrou em rastreamento multi-hop e agregação, avaliou 17 modelos de contexto longo e concluiu que, apesar das notas quase perfeitas no teste fácil de recuperação, "quase todos os modelos apresentam grandes quedas de desempenho conforme o comprimento do contexto aumenta". Metade dos modelos que alegavam 32K não conseguiu manter a qualidade em 32K.

O relatório Context Rot da Chroma (Hong, Troynikov e Huber, julho de 2025) testou 18 modelos em tarefas propositalmente simples e constatou que o desempenho se degrada conforme a entrada cresce, "muitas vezes de maneiras surpreendentes e não uniformes". A queda é irregular, e fica mais difícil de prever à medida que a agulha deixa de ser literalmente parecida com a pergunta.

O Google afirma a limitação no próprio guia de contexto longo. As notas de agulha no palheiro, observa a empresa, cobrem o cenário básico de uma agulha só: "Nos casos em que você pode ter várias agulhas ou trechos específicos de informação que está procurando, o modelo não tem a mesma precisão". Perguntas reais de clientes quase sempre têm várias agulhas. Um cliente que pergunta se dá para encaixá-lo na quinta-feira, se o sinal é reembolsável e se a terapeuta de sempre está trabalhando enterrou três agulhas em uma mensagem só.

O mesmo guia traz uma regra prática que não custa nada aplicar: coloque a sua pergunta no fim do prompt, depois do contexto. Com entradas longas, os modelos se saem melhor assim.

Por que todos os laboratórios chegaram aqui ao mesmo tempo

A engenharia interessante de 2026 foi tornar barato ler uma janela longa repetidas vezes. O DeepSeek-V4.1-Flash é explícito quanto a isso e se posiciona em torno da compressão do cache KV.

A economia andou na mesma direção do lado fechado. Quando a OpenAI lançou o GPT-6 Sol e a Luna em 22 de setembro, cortou os preços da API em 50% e elevou as taxas padrão de acerto de cache, com as leituras de tokens de entrada em cache saindo com 90% de desconto. No mesmo anúncio, o GitHub relatou que, ao longo de vários meses, as melhorias de cache reduziram em mais de 50% a fatia de tokens de prompt que precisava de processamento novo, em bilhões de requisições. Uma semana depois, em 29 de setembro, a OpenAI substituiu esse lançamento pelo GPT-6.1 Sol e cortou de novo pela metade o preço da entrada em cache. É esse o ritmo contra o qual você está construindo.

O contexto longo virou normal porque o cache barateou reler um prompt grande, não porque os modelos ficaram melhores em prestar atenção ao longo de um milhão de tokens. São problemas diferentes, e só um deles foi resolvido.

A conta não sumiu, ela mudou de lugar

Três custos sobrevivem a uma janela maior, e se você está orçando uma implantação de IA, precifique os três.

  1. Os tokens continuam sendo medidos, e o medidor pode subir de faixa. Uma leitura de cache ainda custa dinheiro, só que menos do que uma leitura nova. A própria página do modelo da OpenAI diz isso sem rodeios: prompts acima de 272K tokens de entrada são cobrados a 2x nas tarifas de entrada e de cache e 1.5x na saída, valendo para a requisição inteira. Preencha um quarto da janela e a sua economia unitária muda.
  2. A latência cresce junto com a entrada. A orientação do Google é seca: consultas mais longas geralmente significam mais tempo até o primeiro token. Em mensagens com clientes, isso custa dinheiro de forma direta. Nosso Estudo de Velocidade de Resposta, com 32,581 conversas, mostrou que respostas em até 60 segundos converteram a 35.1%, contra 12.2% das respostas entre 5 e 60 minutos.
  3. A precisão é a que você percebe por último. Uma resposta errada saída de um prompt inchado é idêntica a uma resposta certa, até um cliente agir com base nela.

O que isso muda se você roda IA em conversas com clientes

Menos do que as fichas técnicas sugerem.

A janela de um milhão de tokens tira uma desculpa. A decisão de projeto continua. Você ainda escolhe o que o modelo vê a cada turno, e as evidências acima dizem que um prompt mais enxuto e mais bem selecionado ganha de um prompt maior. O Receptionist da Entagl busca os fatos específicos que a pergunta exige por busca semântica nas FAQs, nos serviços e no catálogo da empresa, em vez de carregar o negócio inteiro em cada turno. A escolha de modelo é escalonada por carga de trabalho, então uma pergunta simples não é cobrada a preço de modelo de ponta. Quando o Coordinator faz uma ligação de confirmação, ele já carrega o histórico de conversa do mesmo registro de cliente, então nada precisa ser reconstruído a partir de um paredão de texto cru.

É a mesma disciplina que uma boa recuperação sempre exigiu, e os benchmarks seguem confirmando isso. Fomos mais fundo no lado da memória em Memória de agentes de IA em 2026, que cobre os benchmarks que separam lembrar de recuperar. O lado de preço da mesma tendência, em que os modelos pequenos ficaram baratos o bastante para dar conta da maior parte do trabalho de uma empresa, está em Modelos de linguagem pequenos em 2026. E se você está decidindo em qual laboratório se apoiar enquanto essas especificações convergem, Por que você não deveria construir seu negócio em um único modelo de IA defende a portabilidade.

Se você quer ver como é uma seleção de contexto disciplinada nas suas próprias conversas, agende uma demonstração de 30 minutos e a gente percorre o seu histórico real de mensagens.

FAQ

Uma janela de contexto maior substitui a recuperação?

Não. Ela muda o momento em que a recuperação compensa a engenharia. O motivo dela continua de pé. O custo ainda cresce com os tokens processados, a latência sobe com o tamanho da entrada, e tanto o RULER quanto a Chroma mostram a precisão se degradando conforme as entradas crescem. A recuperação aperta os três problemas de uma vez.

Qual é a maior janela de contexto disponível em 2026?

Vários modelos aceitam um milhão de tokens ou mais, entre eles Claude Opus 5.5, GPT-6.1 Sol com 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash e Kimi K3. Alguns anunciam mais. A pergunta mais útil é quanto da janela o modelo usa de forma confiável, que é o que benchmarks como o RULER tentam medir, e esse número é sempre menor do que o anunciado.

Modelos de pesos abertos têm janelas de contexto menores?

Não mais. O DeepSeek-V4.1-Flash e o Kimi K3, da Moonshot, aceitam um milhão de tokens com os pesos publicados, então hospedar por conta própria não significa mais aceitar uma janela curta. O Mistral Large 3 para em 256K por decisão de projeto, o que não diz nada sobre os modelos abertos em geral.

De quanto contexto uma conversa de atendimento precisa de verdade?

De muito menos que um milhão de tokens. Até uma conversa longa, de vários meses, com um mesmo cliente é uma fração pequena de uma janela moderna. O trabalho é decidir quais fatos do negócio, pedidos antigos e mensagens anteriores entram neste turno específico.

Contexto longo deixa a IA mais lenta para responder?

Em geral, sim. A orientação de contexto longo do Google observa que consultas mais longas têm maior tempo até o primeiro token. Em mensagens com clientes, onde a velocidade de resposta acompanha a conversão, esse trade-off vale ser medido no seu próprio tráfego.

Fontes: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, julho de 2025); documentação de contexto longo da Gemini API e notas do modelo Gemini 3.8 Flash; documentação do modelo Claude Opus 5.5; referência do modelo GPT-6.1 Sol da OpenAI e os anúncios de GPT-6 Sol e Luna (22 de setembro de 2026) e GPT-6.1 Sol (29 de setembro de 2026); model card do DeepSeek-V4.1-Flash; Kimi K3 no Amazon Bedrock (18 de setembro de 2026); Mistral Large 3 e limitações conhecidas; Estudo de Velocidade de Resposta da Entagl (2026). Especificações dos modelos verificadas em 30 de setembro de 2026 e mudam com frequência.

Publicado por Entagl Team on