Zum Inhalt springen

AI News · industry

Eine Million Token sind jetzt Standard. Das meiste davon funktioniert nicht.

Jedes ernstzunehmende Labor hat dieses Jahr ein Kontextfenster mit einer Million Token ausgeliefert, auch die mit offenen Gewichten. Die Benchmarks sagen, dass Modelle nur einen Bruchteil davon zuverlässig nutzen, und was Sie dem Modell geben, zählt weiterhin mehr als das, was hineinpasst.

Entagl Team8 Min. Lesezeit
Eine Million Token sind jetzt Standard. Das meiste davon funktioniert nicht.

Stand September 2026 ist ein Kontextfenster mit einer Million Token die Grundausstattung. Anthropic, OpenAI, Google und die Open-Weights-Labore in China liefern alle eines. NVIDIAs RULER-Benchmark hat herausgefunden: Von den Modellen, die 32K Token oder mehr angeben, hielt nur die Hälfte bei 32K stand. Das Fenster ist gewachsen. Der zuverlässige Teil davon langsamer.

Wer liefert wirklich ein Kontextfenster mit einer Million Token?

Die Verbreitung sagt mehr aus als jede einzelne Zahl, denn sie zeigt, dass diese Fähigkeit kein Burggraben mehr ist. Sie ist Pflichtprogramm, und bei zweien davon können Sie die Gewichte herunterladen.

Modell Labor (Land) Kontextfenster Gewichte
Claude Opus 5.5 Anthropic (USA) 1M, 128K max. Ausgabe Geschlossen
GPT-6.1 Sol OpenAI (USA) 1,050,000, 128K max. Ausgabe Geschlossen
Gemini 3.8 Flash Google (USA) 1M, 64K max. Ausgabe Geschlossen
DeepSeek-V4.1-Flash DeepSeek (China) Bis zu 1M Offen
Kimi K3 Moonshot AI (China) 1M Offen
Mistral Large 3 Mistral (Frankreich) 256K Offen

Zwei Dinge fallen in dieser Tabelle auf. Erstens sind die chinesischen Labore bei dieser Spezifikation gleichauf, und sie veröffentlichen die Gewichte. DeepSeeks Modellkarte beschreibt ein Mixture-of-Experts-Backbone mit 552B Parametern, trainiert mit Sparse Attention bei 64K und später im Training auf eine Million Token erweitert. Kimi K3 kam am 18. September 2026 auf Amazon Bedrock an, mit nativer Bildverarbeitung und explizitem Prompt-Caching. Wenn Sie das breitere Ranking suchen statt nur den Ausschnitt Kontextfenster: Wir haben es in Die besten LLMs 2026: offen, geschlossen und global behandelt.

Zweitens hat Mistral das Rennen ausgelassen. Die veröffentlichten Limits setzen Mistral Large 3 auf 256K Token, der Rest der Modellreihe liegt bei 128K oder 256K. Das ist Absicht. Und es lohnt sich hinzusehen, wenn bei einem Wettrennen um Spezifikationen jemand Glaubwürdiges nicht mitmacht.

Was passt wirklich in eine Million Token?

Googles eigene Dokumentation gibt die klarste konkrete Antwort. Eine Million Token sind ungefähr 50,000 Codezeilen, acht englische Romane durchschnittlicher Länge oder Transkripte von über 200 Podcast-Folgen.

Für ein Unternehmen lautet die nützliche Übersetzung anders: Eine Million Token sind weit mehr, als ein einzelnes Kundengespräch je brauchen wird. Ein Jahr WhatsApp-Verläufe mit einem Kunden kommt nicht annähernd heran. Wenn Sie also KI auf Kundennachrichten laufen lassen, ist das Fenster schon eine Weile nicht mehr Ihre Begrenzung. Ihre Begrenzung ist die Auswahl, und das war sie immer.

Nutzen Modelle das ganze Fenster wirklich?

Nicht gleichmäßig, und die Anbieter sagen das selbst.

NVIDIAs RULER-Paper (COLM 2024) formuliert das Problem am klarsten. Es ging über den einfachen Nadel-im-Heuhaufen-Test hinaus, hin zu mehrstufigem Nachverfolgen und Aggregieren, bewertete 17 Long-Context-Modelle und stellte fest: Trotz nahezu perfekter Werte beim leichten Retrieval-Test zeigen „fast alle Modelle große Leistungseinbrüche, wenn die Kontextlänge steigt“. Die Hälfte der Modelle mit angegebenen 32K konnte die Qualität bei 32K nicht halten.

Chromas Context-Rot-Bericht (Hong, Troynikov und Huber, Juli 2025) testete 18 Modelle an bewusst einfachen Aufgaben und fand, dass die Leistung mit wachsendem Input nachlässt, „oft auf überraschende und uneinheitliche Weise“. Der Abfall verläuft ungleichmäßig, und er wird schwerer vorhersagbar, je weniger die Nadel der Frage wörtlich ähnelt.

Google benennt die Grenze in seinem eigenen Long-Context-Leitfaden. Die Nadel-im-Heuhaufen-Werte, heißt es dort, decken den einfachen Fall mit einer einzigen Nadel ab: „In Fällen, in denen Sie mehrere Nadeln oder bestimmte Informationen suchen, arbeitet das Modell nicht mit derselben Genauigkeit.“ Echte Kundenfragen enthalten fast immer mehrere Nadeln. Wer fragt, ob am Donnerstag noch ein Termin frei ist, ob die Anzahlung erstattet wird und ob die gewohnte Therapeutin arbeitet, hat drei Nadeln in einer Nachricht vergraben.

Der gleiche Leitfaden nennt eine praktische Regel, deren Anwendung nichts kostet: Stellen Sie Ihre Frage ans Ende des Prompts, nach dem Kontext. Bei langem Input schneiden Modelle so besser ab.

Warum alle Labore gleichzeitig hier gelandet sind

Die interessante Ingenieursarbeit 2026 bestand darin, ein langes Fenster bezahlbar zu machen, wenn man es immer wieder liest. DeepSeek-V4.1-Flash benennt das offen und stellt die Komprimierung des KV-Cache in den Mittelpunkt.

Auf der geschlossenen Seite bewegte sich die Ökonomie in dieselbe Richtung. Als OpenAI am 22. September GPT-6 Sol und Luna veröffentlichte, senkte das Unternehmen die API-Preise um 50% und hob die Standard-Trefferquote des Caches an; gelesene Input-Token aus dem Cache bekamen 90% Rabatt. In derselben Ankündigung berichtete GitHub, dass die Cache-Verbesserungen über mehrere Monate hinweg den Anteil der Prompt-Token, die frisch verarbeitet werden müssen, um mehr als 50% gesenkt haben, über Milliarden von Anfragen hinweg. Eine Woche später, am 29. September, löste OpenAI diese Veröffentlichung durch GPT-6.1 Sol ab und halbierte den Preis für Cache-Input erneut. In diesem Takt entwickeln Sie.

Langer Kontext wurde normal, weil Caching das wiederholte Lesen eines großen Prompts billig gemacht hat, nicht weil Modelle über eine Million Token hinweg besser aufpassen. Das sind zwei verschiedene Probleme, und nur eines davon ist gelöst.

Die Rechnung ist nicht verschwunden, sie ist umgezogen

Drei Kosten überleben ein größeres Fenster. Wenn Sie einen KI-Einsatz budgetieren, sollten Sie alle drei einpreisen.

  1. Token werden weiter gezählt, und der Zähler kann hochschalten. Ein Cache-Lesevorgang kostet weiterhin Geld, nur weniger als ein frischer. OpenAIs eigene Modellseite sagt es deutlich: Prompts über 272K Input-Token werden für die gesamte Anfrage mit dem 2x Input- und Cache-Preis und dem 1.5x Output-Preis berechnet. Füllen Sie ein Viertel des Fensters, ändert sich Ihre Stückkostenrechnung.
  2. Die Latenz wächst mit dem Input. Googles Hinweis ist unmissverständlich: Längere Anfragen bedeuten in der Regel eine höhere Zeit bis zum ersten Token. In der Kundenkommunikation kostet Sie das direkt Geld. Unsere Response Velocity Study mit 32,581 Gesprächen ergab, dass Antworten innerhalb von 60 Sekunden mit 35.1% konvertierten, gegenüber 12.2% bei Antworten nach 5 bis 60 Minuten.
  3. Die Genauigkeit merken Sie zuletzt. Eine falsche Antwort aus einem überladenen Prompt sieht genauso aus wie eine richtige, bis ein Kunde danach handelt.

Was sich ändert, wenn Sie KI auf Kundengespräche anwenden

Weniger, als die Datenblätter nahelegen.

Das Fenster mit einer Million Token nimmt Ihnen eine Ausrede. Die Design-Entscheidung bleibt. Sie wählen weiterhin aus, was das Modell in jeder Runde sieht, und die Belege oben sagen, dass ein knapperer, besser ausgewählter Prompt einen größeren schlägt. Entagls Receptionist holt sich über eine semantische Suche in FAQs, Leistungen und Katalog des Unternehmens genau die Fakten, die eine Frage braucht, statt das ganze Unternehmen in jede Runde zu laden. Die Modellauswahl ist nach Arbeitslast gestaffelt, eine einfache Frage wird also nicht zum Flaggschiff-Tarif abgerechnet. Wenn der Coordinator einen Bestätigungsanruf tätigt, hat er den Chatverlauf aus demselben Kundendatensatz bereits vorliegen, es muss also nichts aus einer Wand von Rohtext rekonstruiert werden.

Es ist dieselbe Disziplin, die gutes Retrieval immer verlangt hat, und die Benchmarks bestätigen sie weiter. Die Gedächtnisseite davon haben wir in Das Gedächtnis von KI-Agenten 2026: Was die neuen Benchmarks zeigen vertieft, dort geht es um die Benchmarks, die Erinnern von Abrufen trennen. Die Preisseite desselben Trends, bei der kleine Modelle billig genug wurden, um den Großteil der Geschäftsarbeit zu übernehmen, steht in Kleine Sprachmodelle im Jahr 2026: günstig, schnell, gut genug. Und wenn Sie gerade entscheiden, auf welches Labor Sie bauen, während diese Spezifikationen zusammenlaufen: Warum Sie Ihr Unternehmen nicht auf ein einziges KI-Modell aufbauen sollten begründet, warum es sich lohnt, portabel zu bleiben.

Wenn Sie sehen wollen, wie disziplinierte Kontextauswahl bei Ihren eigenen Gesprächen aussieht, buchen Sie eine 30-minütige Demo und wir gehen Ihren echten Nachrichtenverlauf gemeinsam durch.

FAQ

Ersetzt ein größeres Kontextfenster das Retrieval?

Nein. Es verschiebt nur, ab wann sich der technische Aufwand für Retrieval lohnt. Der Grund dafür bleibt bestehen. Die Kosten skalieren weiter mit den verarbeiteten Token, die Latenz steigt mit der Länge des Inputs, und RULER wie Chroma zeigen beide, dass die Genauigkeit mit wachsendem Input nachlässt. Retrieval verkleinert alle drei Probleme auf einmal.

Welches ist 2026 das größte verfügbare Kontextfenster?

Mehrere Modelle nehmen eine Million Token oder mehr an, darunter Claude Opus 5.5, GPT-6.1 Sol mit 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash und Kimi K3. Eine Handvoll wirbt mit mehr. Nützlicher ist die Frage, wie viel vom Fenster ein Modell zuverlässig nutzt. Genau das versuchen Benchmarks wie RULER zu messen, und dieser Wert liegt durchgängig unter dem beworbenen.

Haben Modelle mit offenen Gewichten kleinere Kontextfenster?

Nicht mehr. DeepSeek-V4.1-Flash und Moonshots Kimi K3 nehmen beide eine Million Token an, bei veröffentlichten Gewichten. Selbst hosten heißt also nicht mehr, ein kurzes Fenster hinzunehmen. Mistral Large 3 endet bewusst bei 256K, was über offene Modelle im Allgemeinen nichts aussagt.

Wie viel Kontext braucht ein Kundenservice-Gespräch tatsächlich?

Weit weniger als eine Million Token. Selbst ein langer Verlauf über mehrere Monate mit einem Kunden ist ein kleiner Bruchteil eines modernen Fensters. Die Arbeit besteht darin, zu entscheiden, welche Geschäftsfakten, früheren Bestellungen und vorherigen Nachrichten in genau diese Runde gehören.

Antwortet die KI bei langem Kontext langsamer?

In der Regel ja. Googles Long-Context-Leitfaden weist darauf hin, dass längere Anfragen eine höhere Zeit bis zum ersten Token haben. In der Kundenkommunikation, wo die Antwortgeschwindigkeit mit der Konversion zusammenhängt, lohnt es sich, diesen Kompromiss am eigenen Traffic zu messen.

Quellen: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, Juli 2025); Gemini-API-Dokumentation zu langem Kontext und Modellhinweise zu Gemini 3.8 Flash; Modelldokumentation zu Claude Opus 5.5; OpenAI-Modellreferenz zu GPT-6.1 Sol sowie die Ankündigungen zu GPT-6 Sol und Luna (22. Sep. 2026) und GPT-6.1 Sol (29. Sep. 2026); Modellkarte DeepSeek-V4.1-Flash; Kimi K3 auf Amazon Bedrock (18. Sep. 2026); Mistral Large 3 und bekannte Einschränkungen; Entagl Response Velocity Study (2026). Modellspezifikationen am 30. September 2026 geprüft, sie ändern sich häufig.

Veröffentlicht von Entagl Team on