Перейти к содержимому

AI News · industry

Миллион токенов стал стандартом. Работает из него меньшая часть.

В этом году окно контекста на миллион токенов выпустили все серьёзные лаборатории, включая те, что открывают веса. Бенчмарки говорят, что надёжно модели используют лишь часть этого окна, и то, что вы даёте модели, по-прежнему важнее того, сколько в неё помещается.

Entagl Team8 мин. чтения
Миллион токенов стал стандартом. Работает из него меньшая часть.

По состоянию на сентябрь 2026 года окно контекста в один миллион токенов превратилось в базовую характеристику. Anthropic, OpenAI, Google и китайские лаборатории с открытыми весами выпускают такие модели. Бенчмарк RULER от NVIDIA показал, что из моделей, заявлявших 32K токенов и больше, качество на 32K удержала лишь половина. Окно выросло. Надёжная его часть росла медленнее.

У кого на самом деле есть окно на миллион токенов?

Разброс по рынку важнее любой отдельной цифры, потому что он показывает: эта возможность перестала быть преимуществом, которое кто-то защищает. Теперь это входной билет, а в двух случаях из списка веса можно просто скачать.

Модель Лаборатория (страна) Окно контекста Веса
Claude Opus 5.5 Anthropic (США) 1M, до 128K на выходе Закрытые
GPT-6.1 Sol OpenAI (США) 1,050,000, до 128K на выходе Закрытые
Gemini 3.8 Flash Google (США) 1M, до 64K на выходе Закрытые
DeepSeek-V4.1-Flash DeepSeek (Китай) До 1M Открытые
Kimi K3 Moonshot AI (Китай) 1M Открытые
Mistral Large 3 Mistral (Франция) 256K Открытые

В этой таблице обращают на себя внимание две вещи. Во-первых, китайские лаборатории держат паритет по этой характеристике и при этом отдают веса. В карточке модели DeepSeek описывает основу mixture-of-experts на 552B параметров, обученную с разреженным вниманием на 64K и расширенную до миллиона токенов уже позже, в ходе обучения. Kimi K3 появилась в Amazon Bedrock 18 сентября 2026 года с нативным зрением и явным кэшированием промптов. Если вам нужна общая картина рейтингов, а не срез по окну контекста, мы разбирали её в материале Лучшие LLM 2026 года: открытые, закрытые и мировые.

Во-вторых, Mistral в эту гонку не пошла. В опубликованных ограничениях у Mistral Large 3 стоит 256K токенов, а остальная линейка держится на 128K или 256K. Это осознанный выбор, и его стоит заметить: в гонке характеристик появился тот, кто убедительно от неё отказался.

Что на самом деле вмещает миллион токенов?

Самый конкретный ответ даёт документация самой Google. Миллион токенов вмещает примерно 50,000 строк кода, восемь английских романов средней длины или расшифровки более чем 200 эпизодов подкастов.

Для бизнеса полезнее другой пересчёт: миллион токенов намного превышает то, что когда-либо понадобится одному клиентскому диалогу. Год переписки с одним клиентом в WhatsApp и близко не подбирается. Так что если вы запускаете ИИ на клиентских сообщениях, окно перестало быть вашим ограничением уже довольно давно. Ограничивает вас отбор, и так было всегда.

Используют ли модели всё окно целиком?

Неравномерно, и сами вендоры об этом говорят.

Статья про RULER от NVIDIA (COLM 2024) формулирует проблему яснее всего. Авторы вышли за пределы простого теста «иголка в стоге сена», добавив многошаговую трассировку и агрегацию, прогнали 17 моделей с длинным контекстом и обнаружили, что, несмотря на почти идеальные результаты на лёгком тесте на извлечение, «почти все модели демонстрируют сильное падение качества по мере роста длины контекста». Половина моделей, заявлявших 32K, не удержала качество на 32K.

Отчёт Context Rot от Chroma (Hong, Troynikov и Huber, июль 2025 года) проверил 18 моделей на намеренно простых задачах и показал, что качество падает по мере роста входа, «часто неожиданным и неравномерным образом». Спад идёт неровно, и предсказать его тем сложнее, чем меньше иголка буквально похожа на сам вопрос.

Google формулирует это ограничение в собственном руководстве по длинному контексту. Результаты теста «иголка в стоге сена», отмечает компания, покрывают базовый сценарий с одной иголкой: «В случаях, когда иголок может быть несколько или когда вы ищете конкретные фрагменты информации, модель работает уже не с той же точностью». Реальные вопросы клиентов почти всегда содержат несколько иголок. Клиент, который спрашивает, найдётся ли для него окно в четверг, вернут ли ему депозит и работает ли его постоянный терапевт, спрятал в одном сообщении сразу три иголки.

То же руководство предлагает практичное правило, которое ничего не стоит применить: ставьте свой вопрос в конце промпта, после контекста. На длинном входе модели так работают лучше.

Почему все лаборатории пришли сюда одновременно

Вся интересная инженерия 2026 года свелась к тому, как сделать многократное чтение длинного окна доступным по деньгам. DeepSeek-V4.1-Flash говорит об этом прямо и строит своё позиционирование вокруг сжатия KV-кэша.

На закрытой стороне экономика двигалась в ту же сторону. Выпустив GPT-6 Sol и Luna 22 сентября, OpenAI снизила цены API на 50% и подняла долю попаданий в кэш по умолчанию, а чтение кэшированных входных токенов подешевело на 90%. В том же анонсе GitHub сообщил, что за несколько месяцев улучшения кэширования сократили долю токенов промпта, которым нужна обработка заново, более чем на 50%, и это на миллиардах запросов. Через неделю, 29 сентября, OpenAI заменила этот релиз на GPT-6.1 Sol и снова вдвое срезала цену кэшированного входа. Вот в каком ритме вам приходится строить.

Длинный контекст стал нормой потому, что кэширование удешевило повторное чтение большого промпта, а не потому, что модели научились лучше держать внимание на миллионе токенов. Это разные задачи, и решена пока только одна.

Счёт никуда не делся, он просто переехал

Большое окно не отменяет трёх статей расходов, и, если вы считаете бюджет внедрения ИИ, закладывать стоит все три.

  1. Токены по-прежнему на счётчике, и счётчик умеет переключаться на тариф выше. Чтение из кэша тоже стоит денег, просто меньше, чем чтение заново. На странице собственной модели OpenAI сказано без обиняков: промпты длиннее 272K входных токенов тарифицируются по 2x за вход и кэш и по 1.5x за выход для всего запроса. Заполните четверть окна, и ваша юнит-экономика изменится.
  2. Задержка растёт вместе с объёмом входа. Рекомендация Google звучит резко: чем длиннее запрос, тем больше время до первого токена. В переписке с клиентами это стоит вам денег напрямую. Наше исследование скорости ответа Response Velocity Study на 32,581 диалоге показало, что ответы в пределах 60 секунд конвертировались в 35.1%, против 12.2% у ответов, на которые уходило от 5 до 60 минут.
  3. Точность замечаешь последней. Неверный ответ на раздутом промпте выглядит ровно так же, как верный, пока клиент не начнёт по нему действовать.

Что это меняет, если у вас ИИ работает на клиентских диалогах

Меньше, чем обещают спецификации.

Окно на миллион токенов лишает вас оправдания. Решение о конструкции остаётся за вами. Вы по-прежнему выбираете, что модель видит на каждом ходу, и все свидетельства выше говорят, что компактный и хорошо отобранный промпт выигрывает у большого. Receptionist от Entagl достаёт именно те факты, которых требует вопрос, семантическим поиском по FAQ, услугам и каталогу бизнеса, вместо того чтобы грузить в каждый ход весь бизнес целиком. Выбор модели разнесён по уровням в зависимости от нагрузки, поэтому простой вопрос не тарифицируется по флагманским ставкам. Когда Coordinator звонит, чтобы подтвердить запись, у него уже есть история переписки из той же карточки клиента, так что ничего не приходится восстанавливать из стены сырого текста.

Это та же дисциплина, которой всегда требовал хороший поиск по базе знаний, и бенчмарки продолжают её подтверждать. Сторону памяти мы разобрали глубже в материале Память ИИ-агентов в 2026 году, где речь про бенчмарки, отделяющие запоминание от извлечения. Ценовая сторона того же тренда, где маленькие модели подешевели настолько, что тянут большую часть бизнес-задач, описана в материале Малые языковые модели в 2026 году. А если вы решаете, на какой лаборатории строить, пока характеристики сходятся, то почему не стоит строить бизнес на одной ИИ-модели объясняет, зачем оставаться переносимым.

Хотите увидеть, как дисциплинированный отбор контекста выглядит на ваших собственных диалогах? Запишитесь на 30-минутное демо, и мы пройдёмся по вашей реальной истории сообщений.

FAQ

Заменяет ли большое окно контекста поиск по базе знаний?

Нет. Оно меняет момент, когда такой поиск оправдывает вложенную работу. Сама причина для него никуда не делась. Стоимость по-прежнему растёт вместе с числом обработанных токенов, задержка растёт с длиной входа, а RULER и Chroma одинаково показывают, что точность падает по мере роста входа. Поиск сужает все три проблемы сразу.

Какое окно контекста самое большое в 2026 году?

Миллион токенов и больше принимают сразу несколько моделей: Claude Opus 5.5, GPT-6.1 Sol с 1,050,000, Gemini 3.8 Flash, DeepSeek-V4.1-Flash и Kimi K3. Единицы заявляют больше. Полезнее другой вопрос: какую часть окна модель использует надёжно. Именно это пытаются измерить бенчмарки вроде RULER, и цифра стабильно выходит ниже заявленной.

У моделей с открытыми весами окно контекста меньше?

Уже нет. DeepSeek-V4.1-Flash и Kimi K3 от Moonshot берут миллион токенов при опубликованных весах, так что размещение у себя больше не означает согласие на короткое окно. Mistral Large 3 упирается в 256K по замыслу, и про открытые модели в целом это не говорит ничего.

Сколько контекста на самом деле нужно диалогу клиентской поддержки?

Куда меньше миллиона токенов. Даже длинная переписка с одним клиентом, тянущаяся месяцами, занимает малую долю современного окна. Работа состоит в другом: решить, какие факты о бизнесе, какие прошлые заказы и какие прежние сообщения нужны именно на этом ходу.

Делает ли длинный контекст ответы ИИ медленнее?

Как правило, да. В руководстве Google по длинному контексту отмечено, что у более длинных запросов выше время до первого токена. В клиентской переписке, где скорость ответа связана с конверсией, этот компромисс стоит измерить на своём собственном трафике.

Источники: RULER (NVIDIA, arXiv:2404.06654, COLM 2024); Context Rot (Chroma, июль 2025); документация Gemini API по длинному контексту и заметки о модели Gemini 3.8 Flash; документация модели Claude Opus 5.5; справочник модели OpenAI GPT-6.1 Sol и анонсы GPT-6 Sol и Luna (22 сен 2026) и GPT-6.1 Sol (29 сен 2026); карточка модели DeepSeek-V4.1-Flash; Kimi K3 в Amazon Bedrock (18 сен 2026); Mistral Large 3 и известные ограничения; Entagl Response Velocity Study (2026). Характеристики моделей проверены 30 сентября 2026 года и часто меняются.

Опубликовано Entagl Team on