AI News · industry
Un million de tokens, c'est la norme. La majeure partie ne fonctionne pas.
Tous les labos sérieux ont livré une fenêtre de contexte d'un million de tokens cette année, y compris ceux à poids ouverts. Les benchmarks disent que les modèles n'en exploitent de façon fiable qu'une fraction, et ce que vous donnez au modèle compte toujours plus que ce qui tient dedans.

En septembre 2026, la fenêtre de contexte d'un million de tokens est devenue une spécification de base. Anthropic, OpenAI, Google et les labos chinois à poids ouverts en proposent tous une. Le benchmark RULER de NVIDIA a constaté que, parmi les modèles annonçant 32K tokens ou plus, seule la moitié tenait la distance à 32K. La fenêtre a grandi. La partie fiable, elle, a grandi plus lentement.
Qui livre vraiment une fenêtre d'un million de tokens ?
La diffusion compte plus que n'importe quel chiffre isolé, parce qu'elle vous dit que cette capacité a cessé d'être un avantage défendable. C'est devenu le ticket d'entrée, et pour deux de ces modèles vous pouvez télécharger les poids.
| Modèle | Labo (pays) | Fenêtre de contexte | Poids |
|---|---|---|---|
| Claude Opus 5.5 | Anthropic (États-Unis) | 1M, 128K de sortie max | Fermés |
| GPT-6.1 Sol | OpenAI (États-Unis) | 1,050,000, 128K de sortie max | Fermés |
| Gemini 3.8 Flash | Google (États-Unis) | 1M, 64K de sortie max | Fermés |
| DeepSeek-V4.1-Flash | DeepSeek (Chine) | Jusqu'à 1M | Ouverts |
| Kimi K3 | Moonshot AI (Chine) | 1M | Ouverts |
| Mistral Large 3 | Mistral (France) | 256K | Ouverts |
Deux choses ressortent de ce tableau. D'abord, les labos chinois sont à parité sur cette spec, et ils publient les poids. La fiche du modèle de DeepSeek décrit une architecture mixture-of-experts de 552B paramètres, entraînée avec de l'attention parcimonieuse à 64K puis étendue à un million de tokens plus tard dans l'entraînement. Kimi K3 est arrivé sur Amazon Bedrock le 18 septembre 2026, avec vision native et mise en cache explicite des prompts. Si vous voulez le classement général plutôt que la seule coupe par fenêtre de contexte, nous l'avons traité dans Les meilleurs LLM de 2026 : ouverts, fermés et mondiaux.
Ensuite, Mistral n'est pas entré dans la course. Ses limites publiées placent Mistral Large 3 à 256K tokens, et le reste de sa gamme reste à 128K ou 256K. C'est un choix assumé, et quand une course aux specs compte un abstentionniste crédible, cela mérite qu'on s'y arrête.
Que contient vraiment un million de tokens ?
La documentation de Google donne la réponse concrète la plus claire. Un million de tokens, c'est à peu près 50,000 lignes de code, huit romans anglais de longueur moyenne, ou les transcriptions de plus de 200 épisodes de podcast.
Pour une entreprise, la traduction utile est autre : un million de tokens dépasse de loin ce dont une conversation client aura jamais besoin. Un an d'échanges WhatsApp avec un même client n'en approche même pas. Donc si vous faites tourner de l'IA sur vos messages clients, la fenêtre a cessé d'être votre contrainte il y a déjà un moment. Votre contrainte, c'est la sélection, et elle l'a toujours été.
Les modèles utilisent-ils vraiment toute la fenêtre ?
Pas de façon uniforme, et les fournisseurs le disent eux-mêmes.
L'article RULER de NVIDIA (COLM 2024) est l'énoncé le plus net du problème. Il va au-delà du simple test de l'aiguille dans une botte de foin, jusqu'au traçage multi-sauts et à l'agrégation, évalue 17 modèles à long contexte, et constate que malgré des scores quasi parfaits sur le test de récupération facile, « presque tous les modèles subissent de fortes baisses de performance à mesure que la longueur du contexte augmente ». La moitié des modèles annonçant 32K ne tenaient pas la qualité à 32K.
Le rapport Context Rot de Chroma (Hong, Troynikov et Huber, juillet 2025) a testé 18 modèles sur des tâches volontairement simples et a constaté que les performances se dégradent quand l'entrée grossit, « souvent de manière surprenante et non uniforme ». La baisse est irrégulière, et elle devient plus difficile à prévoir à mesure que l'aiguille ressemble moins littéralement à la question.
Google énonce la limite dans son propre guide du long contexte. Les scores de l'aiguille dans la botte de foin, note l'entreprise, couvrent le cas de base, celui d'une seule aiguille : « Dans les cas où vous auriez plusieurs aiguilles ou des éléments d'information précis à retrouver, le modèle n'atteint pas la même précision. » Les vraies questions des clients comportent presque toujours plusieurs aiguilles. Une cliente qui demande si vous pouvez la caser jeudi, si l'acompte est remboursable et si sa thérapeute habituelle travaille a enfoui trois aiguilles dans un seul message.
Le même guide donne une règle pratique qui ne coûte rien à appliquer : placez votre question à la fin du prompt, après le contexte. Les modèles s'en sortent mieux ainsi quand l'entrée est longue.
Pourquoi tous les labos sont arrivés là en même temps
L'ingénierie intéressante de 2026 a consisté à rendre une longue fenêtre assez abordable pour être relue en boucle. DeepSeek-V4.1-Flash est explicite là-dessus : il se présente autour de la compression du cache KV.
L'économie a bougé dans le même sens côté modèles fermés. Quand OpenAI a sorti GPT-6 Sol et Luna le 22 septembre, l'entreprise a baissé ses prix d'API de 50% et relevé les taux de succès du cache par défaut, avec une remise de 90% sur la lecture des tokens d'entrée mis en cache. Dans la même annonce, GitHub a rapporté qu'en quelques mois les améliorations du cache avaient réduit de plus de 50% la part des tokens de prompt nécessitant un traitement neuf, sur des milliards de requêtes. Une semaine plus tard, le 29 septembre, OpenAI a remplacé cette version par GPT-6.1 Sol et divisé encore par deux le prix de l'entrée en cache. Voilà la cadence face à laquelle vous construisez.
Le long contexte est devenu normal parce que le cache a rendu bon marché la relecture d'un gros prompt, pas parce que les modèles sont devenus meilleurs pour rester attentifs sur un million de tokens. Ce sont deux problèmes différents, et un seul a été résolu.
La facture n'a pas disparu, elle s'est déplacée
Trois coûts survivent à une fenêtre plus grande, et si vous budgétez un déploiement d'IA, vous devriez chiffrer les trois.
- Les tokens restent comptés, et le compteur peut passer au palier supérieur. Une lecture en cache coûte quand même de l'argent, simplement moins qu'une lecture neuve. La page modèle d'OpenAI le dit sans détour : au-delà de 272K tokens d'entrée, les prompts sont facturés 2x les tarifs d'entrée et de cache, et 1.5x la sortie, pour toute la requête. Remplissez un quart de la fenêtre et votre économie unitaire change.
- La latence croît avec l'entrée. Google est direct : des requêtes plus longues signifient en général un délai plus élevé avant le premier token. Dans la messagerie client, cela vous coûte de l'argent, directement. Notre étude Response Velocity, portant sur 32,581 conversations, a montré que les réponses envoyées en moins de 60 secondes convertissaient à 35.1%, contre 12.2% pour celles envoyées entre 5 et 60 minutes.
- La justesse est celle qu'on remarque en dernier. Une mauvaise réponse issue d'un prompt gonflé ressemble exactement à une bonne, jusqu'au moment où un client agit dessus.
Ce que cela change si vous faites tourner de l'IA sur vos conversations clients
Moins que ne le laissent croire les fiches techniques.
La fenêtre d'un million de tokens supprime une excuse. La décision de conception, elle, reste. Vous choisissez toujours ce que le modèle voit à chaque tour, et les éléments ci-dessus disent qu'un prompt plus serré et mieux sélectionné bat un prompt plus gros. Le Receptionist d'Entagl va chercher les faits précis dont une question a besoin, par recherche sémantique dans les FAQ, les services et le catalogue de l'entreprise, au lieu de charger toute l'entreprise à chaque tour. Le choix du modèle se fait par paliers selon la charge de travail, donc une question simple n'est pas facturée au tarif du modèle phare. Quand le Coordinator passe un appel de confirmation, il dispose déjà de l'historique de chat rattaché à la même fiche client, et rien n'a besoin d'être reconstruit à partir d'un mur de texte brut.
C'est la même discipline que la bonne recherche d'information a toujours exigée, et les benchmarks continuent de la valider. Nous sommes allés plus loin sur le volet mémoire dans La mémoire des agents IA en 2026, qui couvre les benchmarks séparant le fait de se souvenir du fait de retrouver. Le volet tarifaire de la même tendance, où les petits modèles sont devenus assez bon marché pour absorber l'essentiel du travail d'une entreprise, est traité dans Les petits modèles de langage en 2026. Et si vous devez choisir sur quel labo construire pendant que ces specs convergent, Pourquoi il ne faut pas bâtir votre entreprise sur un seul modèle d'IA plaide pour rester portable.
Si vous voulez voir à quoi ressemble une sélection de contexte rigoureuse sur vos propres conversations, réservez une démo de 30 minutes et nous parcourrons ensemble votre véritable historique de messages.
FAQ
Une fenêtre de contexte plus grande remplace-t-elle la recherche d'information ?
Non. Elle change le moment où la recherche d'information vaut l'effort d'ingénierie. Sa raison d'être tient toujours. Le coût croît encore avec le nombre de tokens traités, la latence monte avec la longueur de l'entrée, et RULER comme Chroma montrent une justesse qui se dégrade quand les entrées grossissent. La recherche d'information réduit les trois problèmes d'un coup.
Quelle est la plus grande fenêtre de contexte disponible en 2026 ?
Plusieurs modèles acceptent un million de tokens ou plus : Claude Opus 5.5, GPT-6.1 Sol à 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash et Kimi K3. Une poignée en annoncent davantage. La question plus utile est de savoir quelle part de la fenêtre un modèle exploite de façon fiable, ce que des benchmarks comme RULER cherchent à mesurer, et ce chiffre est systématiquement inférieur à celui affiché.
Les modèles à poids ouverts ont-ils des fenêtres de contexte plus petites ?
Plus maintenant. DeepSeek-V4.1-Flash et Kimi K3 de Moonshot acceptent tous deux un million de tokens avec des poids publiés, donc l'auto-hébergement n'oblige plus à se contenter d'une fenêtre courte. Mistral Large 3 plafonne à 256K par choix, ce qui ne dit rien des modèles ouverts en général.
De combien de contexte une conversation de service client a-t-elle vraiment besoin ?
Bien moins d'un million de tokens. Même un long fil de plusieurs mois avec un client ne représente qu'une petite fraction d'une fenêtre moderne. Le travail consiste à décider quels faits de l'entreprise, quelles commandes passées et quels messages antérieurs ont leur place dans ce tour précis.
Le long contexte rend-il l'IA plus lente à répondre ?
En général, oui. Le guide de Google sur le long contexte note que des requêtes plus longues entraînent un délai plus élevé avant le premier token. Pour la messagerie client, où la vitesse de réponse suit la conversion, cet arbitrage mérite d'être mesuré sur votre propre trafic.
Sources : RULER (NVIDIA, arXiv:2404.06654, COLM 2024) ; Context Rot (Chroma, juillet 2025) ; documentation long contexte de l'API Gemini et notes du modèle Gemini 3.8 Flash ; documentation du modèle Claude Opus 5.5 ; référence du modèle OpenAI GPT-6.1 Sol et les annonces de GPT-6 Sol et Luna (22 septembre 2026) et de GPT-6.1 Sol (29 septembre 2026) ; fiche du modèle DeepSeek-V4.1-Flash ; Kimi K3 sur Amazon Bedrock (18 septembre 2026) ; Mistral Large 3 et limitations connues ; étude Response Velocity d'Entagl (2026). Spécifications des modèles vérifiées le 30 septembre 2026 ; elles changent fréquemment.