AI News · industry
Un milione di token è ormai lo standard. Gran parte non funziona.
Quest'anno ogni laboratorio serio ha rilasciato una finestra di contesto da un milione di token, compresi quelli a pesi aperti. I benchmark dicono che i modelli ne usano in modo affidabile solo una frazione, e quello che dai in pasto al modello conta ancora più di quello che ci sta dentro.

A settembre 2026 una finestra di contesto da un milione di token è ormai una specifica di base. Anthropic, OpenAI, Google e i laboratori cinesi a pesi aperti la offrono tutti. Il benchmark RULER di NVIDIA ha rilevato che, tra i modelli che dichiarano 32K token o più, solo la metà reggeva davvero a 32K. La finestra è cresciuta. La parte affidabile è cresciuta più lentamente.
Chi offre davvero una finestra da un milione di token?
La diffusione conta più di qualsiasi singolo numero, perché dice che questa capacità ha smesso di essere un vantaggio difendibile. È il minimo per stare in partita, e in due casi i pesi si possono scaricare.
| Modello | Laboratorio (paese) | Finestra di contesto | Pesi |
|---|---|---|---|
| Claude Opus 5.5 | Anthropic (USA) | 1M, output max 128K | Chiuso |
| GPT-6.1 Sol | OpenAI (USA) | 1,050,000, output max 128K | Chiuso |
| Gemini 3.8 Flash | Google (USA) | 1M, output max 64K | Chiuso |
| DeepSeek-V4.1-Flash | DeepSeek (Cina) | Fino a 1M | Aperto |
| Kimi K3 | Moonshot AI (Cina) | 1M | Aperto |
| Mistral Large 3 | Mistral (Francia) | 256K | Aperto |
Da quella tabella saltano fuori due cose. Primo, i laboratori cinesi sono alla pari su questa specifica, e i pesi li pubblicano. La scheda del modello di DeepSeek descrive una struttura mixture-of-experts da 552B parametri, addestrata con attenzione sparsa a 64K ed estesa a un milione di token più avanti nell'addestramento. Kimi K3 è arrivato su Amazon Bedrock il 18 settembre 2026 con visione nativa e caching esplicito dei prompt. Se ti interessa il quadro completo delle classifiche invece del solo taglio sulla finestra di contesto, ne abbiamo parlato in I migliori LLM del 2026: aperti, chiusi e globali.
Secondo, Mistral ha saltato la corsa. I limiti che pubblica mettono Mistral Large 3 a 256K token, e il resto della sua linea sta a 128K o 256K. È una scelta deliberata, e quando in una corsa alle specifiche c'è un astenuto credibile vale la pena notarlo.
Cosa ci sta davvero in un milione di token?
La risposta concreta più chiara arriva dalla documentazione di Google. Un milione di token equivale grosso modo a 50,000 righe di codice, otto romanzi inglesi di lunghezza media o le trascrizioni di oltre 200 episodi di podcast.
Per un'azienda la traduzione utile è un'altra: un milione di token è molto più di quanto servirà mai a una singola conversazione con un cliente. Un anno di thread WhatsApp con lo stesso cliente non ci si avvicina nemmeno. Quindi, se fai girare l'AI sui messaggi dei clienti, la finestra ha smesso da un pezzo di essere il tuo vincolo. Il tuo vincolo è la selezione, ed è sempre stato quello.
I modelli usano davvero tutta la finestra?
Non in modo uniforme, e lo dicono i fornitori stessi.
Il paper RULER di NVIDIA (COLM 2024) è la formulazione più netta del problema. Va oltre il semplice test dell'ago nel pagliaio, fino al tracciamento multi-hop e all'aggregazione, valuta 17 modelli a contesto lungo e rileva che, nonostante punteggi quasi perfetti nel test di recupero facile, "quasi tutti i modelli mostrano grossi cali di prestazioni al crescere della lunghezza del contesto". Metà dei modelli che dichiaravano 32K non riusciva a tenere la qualità a 32K.
Il report Context Rot di Chroma (Hong, Troynikov e Huber, luglio 2025) ha testato 18 modelli su compiti volutamente semplici e ha rilevato che le prestazioni degradano al crescere dell'input, "spesso in modi sorprendenti e non uniformi". Il calo è irregolare, e diventa più difficile da prevedere man mano che l'ago somiglia meno letteralmente alla domanda.
Google dichiara il limite nella sua guida al contesto lungo. I punteggi dell'ago nel pagliaio, osserva, coprono lo scenario base con un solo ago: "Nei casi in cui si abbiano più aghi o informazioni specifiche da cercare, il modello non offre la stessa accuratezza". Le domande vere dei clienti sono quasi sempre a più aghi. Un cliente che chiede se riesci a incastrarlo giovedì, se la caparra è rimborsabile e se la sua terapista di sempre è in turno ha nascosto tre aghi in un solo messaggio.
La stessa guida propone una regola pratica che non costa nulla applicare: metti la domanda alla fine del prompt, dopo il contesto. Con input lunghi i modelli se la cavano meglio così.
Perché tutti i laboratori ci sono arrivati insieme
L'ingegneria interessante del 2026 è stata rendere economico rileggere più volte una finestra lunga. DeepSeek-V4.1-Flash lo dice apertamente e si presenta proprio intorno alla compressione della cache KV.
Sul fronte chiuso l'economia si è mossa nella stessa direzione. Quando OpenAI ha rilasciato GPT-6 Sol e Luna il 22 settembre ha tagliato i prezzi delle API del 50% e alzato i tassi di cache hit predefiniti, con le letture dei token di input in cache scontate del 90%. Nello stesso annuncio, GitHub ha riferito che nell'arco di alcuni mesi i miglioramenti al caching hanno ridotto di oltre il 50% la quota di token di prompt da elaborare da zero, su miliardi di richieste. Una settimana dopo, il 29 settembre, OpenAI ha sostituito quella release con GPT-6.1 Sol e ha dimezzato di nuovo il prezzo dell'input in cache. È questo il ritmo con cui fai i conti mentre costruisci.
Il contesto lungo è diventato normale perché il caching ha reso economico rileggere un prompt grosso, non perché i modelli siano diventati più bravi a prestare attenzione lungo un milione di token. Sono due problemi diversi, e ne è stato risolto solo uno.
Il conto non è sparito, si è spostato
Tre costi sopravvivono a una finestra più grande, e se stai facendo il budget di un progetto AI devi metterli a preventivo tutti e tre.
- I token si contano ancora, e il contatore può scattare. Una lettura da cache costa comunque, solo meno di una lettura nuova. La pagina del modello di OpenAI lo dice senza giri di parole: i prompt oltre i 272K token di input sono tariffati a 2x sulle tariffe di input e di cache e a 1.5x sull'output per l'intera richiesta. Riempi un quarto della finestra e la tua economia unitaria cambia.
- La latenza cresce con l'input. Le indicazioni di Google sono nette: query più lunghe significano in genere un time to first token più alto. Nella messaggistica con i clienti questo ti costa soldi in modo diretto. Il nostro Studio sulla velocità di risposta su 32,581 conversazioni ha rilevato che le risposte entro 60 secondi convertivano al 35.1%, contro il 12.2% delle risposte tra 5 e 60 minuti.
- L'accuratezza è quella di cui ti accorgi per ultima. Una risposta sbagliata uscita da un prompt gonfio sembra identica a una giusta, finché un cliente non ci agisce sopra.
Cosa cambia se fai girare l'AI sulle conversazioni con i clienti
Meno di quanto lascino intendere le schede tecniche.
La finestra da un milione di token toglie una scusa. La decisione di progettazione resta. Sei sempre tu a scegliere cosa vede il modello a ogni turno, e le prove qui sopra dicono che un prompt più stretto e meglio selezionato batte un prompt più grande. Il Receptionist di Entagl recupera i fatti precisi che una domanda richiede tramite ricerca semantica su FAQ, servizi e catalogo dell'azienda, invece di caricare tutta l'azienda a ogni turno. La scelta del modello è a livelli in base al carico di lavoro, così una domanda semplice non viene fatturata a tariffa di punta. Quando il Coordinator fa una chiamata di conferma, ha già lo storico della chat dalla stessa scheda cliente, quindi non c'è nulla da ricostruire da un muro di testo grezzo.
È la stessa disciplina che un buon retrieval ha sempre richiesto, e i benchmark continuano a darle ragione. Sul lato memoria siamo andati più a fondo in La memoria degli AI agent nel 2026, che passa in rassegna i benchmark capaci di distinguere il ricordare dal recuperare. Il lato prezzi dello stesso trend, cioè i modelli piccoli diventati abbastanza economici da reggere gran parte del lavoro aziendale, sta in Small Language Model nel 2026. E se stai decidendo su quale laboratorio costruire mentre queste specifiche convergono, Perché non dovresti costruire la tua azienda su un unico modello di AI spiega perché conviene restare portabili.
Se vuoi vedere che aspetto ha una selezione del contesto fatta con disciplina sulle tue conversazioni, prenota una demo di 30 minuti e ripercorriamo insieme lo storico reale dei tuoi messaggi.
FAQ
Una finestra di contesto più grande sostituisce il retrieval?
No. Cambia il momento in cui il retrieval ripaga l'ingegneria che richiede. Il motivo per farlo resta in piedi. Il costo scala ancora con i token elaborati, la latenza sale con la lunghezza dell'input, e sia RULER sia Chroma mostrano l'accuratezza che degrada al crescere degli input. Il retrieval restringe tutti e tre i problemi in una volta sola.
Qual è la finestra di contesto più grande disponibile nel 2026?
Diversi modelli accettano un milione di token o più, tra cui Claude Opus 5.5, GPT-6.1 Sol con 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash e Kimi K3. Qualcuno ne dichiara di più. La domanda più utile è quanta parte della finestra un modello usa in modo affidabile, che è quello che benchmark come RULER provano a misurare, e quel numero è sistematicamente più basso di quello pubblicizzato.
I modelli a pesi aperti hanno finestre di contesto più piccole?
Non più. DeepSeek-V4.1-Flash e Kimi K3 di Moonshot accettano entrambi un milione di token con i pesi pubblicati, quindi self-hostare non significa più accontentarsi di una finestra corta. Mistral Large 3 si ferma a 256K per scelta, il che non dice nulla sui modelli aperti in generale.
Quanto contesto serve davvero a una conversazione di assistenza clienti?
Molto meno di un milione di token. Anche un lungo thread di mesi con un singolo cliente è una frazione minima di una finestra moderna. Il lavoro sta nel decidere quali dati aziendali, ordini passati e messaggi precedenti servono in questo turno specifico.
Il contesto lungo rende l'AI più lenta a rispondere?
In generale sì. Le indicazioni di Google sul contesto lungo segnalano che le query più lunghe hanno un time to first token più alto. Nella messaggistica con i clienti, dove la velocità di risposta è legata alla conversione, è un compromesso che vale la pena misurare sul proprio traffico.
Fonti: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, luglio 2025); documentazione dell'API Gemini sul contesto lungo e note sul modello Gemini 3.8 Flash; documentazione del modello Claude Opus 5.5; riferimento del modello OpenAI GPT-6.1 Sol e gli annunci di GPT-6 Sol e Luna (22 settembre 2026) e GPT-6.1 Sol (29 settembre 2026); scheda del modello DeepSeek-V4.1-Flash; Kimi K3 su Amazon Bedrock (18 settembre 2026); Mistral Large 3 e limitazioni note; Entagl Response Velocity Study (2026). Specifiche dei modelli verificate il 30 settembre 2026 e soggette a cambiamenti frequenti.