AI News · industry
Память ИИ-агентов в 2026 году: что показали новые бенчмарки
Три сентябрьских теста 2026 года измерили, что агенты действительно помнят. Лучший результат оказался 70.67%, сжатые заметки сломались при смене модели, а память иногда обходилась дороже самого агента.

Память ИИ-агента это слой, который позволяет агенту использовать то, что клиент сказал ему несколько недель назад, и по состоянию на сентябрь 2026 года она измеримо не доделана. В DolphinBench, вышедшем 22 сентября 2026 года, конфигурация с наивысшим результатом выполнила 70.67% из 600 задач, зависящих от памяти. Почти треть провалена. Отдельное контролируемое исследование Does Your Agent's Memory Survive a Model Upgrade?, опубликованное 4 сентября, показало: когда хранилище памяти, созданное одной моделью, передавали другой, точность уходила в неверную сторону на величину до 13.28 процентного пункта, и при этом никто не трогал сохранённые данные.
В сентябре вышли три вещи, на которые стоит обратить внимание, если у вас работает ИИ, разговаривающий с клиентами: бенчмарк, который оценивает память по действиям, а не по ответам на вопросы; исследование о том, переживает ли память обновление модели; и китайский конкурс, который подводит все системы памяти под один свод правил. Вот что измерил каждый из них и что они меняют.
Что такое память ИИ-агента и чем она отличается от контекстного окна?
Контекстное окно это рабочее пространство модели на время одного запуска. Когда запуск заканчивается, оно опустошается. Память агента это устойчивое состояние: то, что записывается после разговора и извлекается перед следующим.
Различие важно, потому что индустрия продолжает решать проблему памяти увеличением окна. Данные говорят, что само по себе это не работает. Статья CueMem (11 сентября 2026 года) от Mashang Consumer Finance и Харбинского технологического института в Шэньчжэне показала, что подача всей истории диалога в модель деградирует по мере приближения входных данных к пределу контекста; авторы отчасти связывают этот эффект с нерелевантным контекстом и проблемой «потери в середине». Их подход с извлечением использовал примерно 10% входных токенов от режима полной истории на бенчмарке LoCoMo и при этом набрал больше.
Заметка OpenAI от 21 сентября про V7, который строит контекст агентов для финансовых и страховых команд, говорит то же самое со стороны продакшена: граф V7 «на порядок дешевле и быстрее в обходе, чем подходы с длинным контекстом», при этом недавние сообщения остаются в активном контексте, а более старый материал лежит в графе, пока к нему кто-нибудь не обратится.
Значит, память это не окно побольше. Это решение о том, что записать и что сохранить.
Почему бенчмарки изменились в сентябре 2026 года?
До сих пор большинство бенчмарков памяти задавали вопросы. А это льстит тестируемым системам.
Аргумент DolphinBench звучит прямо. Спросите агента «каким мессенджером пользуется команда?» и вы уже сообщили ему, что факт о платформе существует и что он вам нужен. Самый трудный шаг, заметить, что извлечение вообще требуется, сделан за него. Поэтому DolphinBench убирает вопрос. Он даёт агенту три смоделированные истории офисных сотрудников (примерно по 500 000 токенов каждая, 13 539 сообщений с 2023 по 2027 год), а затем выдаёт 600 задач в симулированных приложениях, среди которых Notion, Gmail, GitHub и Discord, где неверное действие оставляет след, видимый проверяющему.
Один разобранный пример: генеральный директор один раз, в апреле 2023 года, формулирует правило канала: релизные заметки идут в #eng-releases, пока деплой не станет зелёным. Больше это нигде не повторяется. Три с половиной года спустя, в истории из 3400 сообщений, приходит запрос опубликовать апдейт по раскатке, и канал не назван. Опубликуете не туда, и вы провалились. Знать факт недостаточно: агент должен применить его без подсказки.
Каждый тест к тому же сертифицирован как решаемый: он обязан проходить, когда нужная история предоставлена, и проваливаться, когда её скрывают. Это правило снимает обычную претензию к синтетическим бенчмаркам, что никто не знает, был ли проваленный тест вообще решаемым.
Какие системы памяти показали лучший результат и во что он обошёлся?
Ниже опубликованные результаты DolphinBench для харнесса Hermes на GPT-5.6 Luna, по состоянию на 22 сентября 2026 года. Точность это доля выполненных задач из 600. Колонки со стоимостью это собственные опубликованные затраты бенчмарка на прогон всего набора, в долларах США; они полезны как соотношение между системами в одном тесте, а не как цена, которую заплатите вы.
| Система памяти | Точность | Стоимость прогона агента | Стоимость прогона памяти | Медианная задержка |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69 с |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31 с |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66 с |
| Встроенная память модели | 65.67% | 61.48 | 0.00 | 44.35 с |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68 с |
Два вывода заслуживают большего внимания, чем победитель.
Слой памяти может стоить дороже самого агента. Расходы Supermemory на память в этом прогоне были примерно в четыре с половиной раза выше расходов на агента, а по точности система пришла последней. Любой вендор, который называет вам цифру точности без цифры стоимости, показывает половину результата. Позиция DolphinBench в том, что стоимость и задержка стоят в одной строке с точностью, поэтому это и называют границей Парето, а не таблицей лидеров.
Польза от памяти сильно зависит от модели в основе. С GPT-5.6 Luna выделенный слой памяти добавил около пяти пунктов к встроенной памяти модели (70.67% против 65.67%). Подставьте MiniMax M3, китайскую модель с открытыми весами, и встроенная память обваливается до 26.50%, тогда как Mem0 доходит до 47.83%: разрыв больше двадцати пунктов. Чем хуже модель сама справляется с длинной историей, тем больше тянет на себе внешний слой памяти. Если вы берёте модель с открытыми весами ради контроля затрат, именно этот вывод стоит применить.
Переживает ли память агента обновление модели?
Обычно нет, и этот вывод большинство команд пока не заложили в свои планы.
В исследовании переносимости, упомянутом выше, 48 синтетических историй прогнали через четыре конструкции памяти, а затем поменяли модель, которая эту память записывала. Результаты по конструкциям:
- Граф знаний с фиксированной схемой: точность изменилась на +0.0004 пункта. Фактически неуязвим.
- Сжатые заметки на естественном языке: точность сместилась на +9.91 или −13.28 пункта в зависимости от направления миграции. Те же заметки, другой читатель, другой ответ.
- RAG с наполовину мигрированным индексом эмбеддингов: смешанный индекс 50/50 дал лишь 4.96 из 11.90 пункта выигрыша, доступного при полном переэмбеддинге. Половина миграции приносит заметно меньше половины выгоды.
Результат по восстановлению стоит запомнить. Когда сжатые заметки ломались, починка из одного только хранилища не дотягивала до цели в 90% восстановления во всех 48 случаях. Сохранение сырой исходной истории спасло 34 случая из 48. Если вы выбрасываете оригинальные разговоры и оставляете только резюме, вы выбросили и возможность это резюме починить.
Это напрямую связано с тем, о чём мы писали в материале почему не стоит строить бизнес на одной ИИ-модели: модели выводят из эксплуатации по циклам от 12 до 18 месяцев. Исследование добавляет к этому вот что: быть модель-агностиком это не только про смену API. Ваша накопленная память привязана к модели, которая её записала, и уведомления о миграции вам никто не пришлёт.
Кто строит память агентов и где?
Поле реально разделено между США и Китаем, между открытым и закрытым, и англоязычные обзоры этого по большей части не замечают.
| Система | Происхождение | Лицензия | Что это такое |
|---|---|---|---|
| Mem0 | США | Открытое ядро + управляемый сервис | Встраиваемый слой памяти; автор DolphinBench |
| Letta (ранее MemGPT) | США | Apache 2.0 | Сервер агентов с состоянием и явными блоками памяти |
| Honcho, Hindsight, Supermemory | США | Коммерческие | Управляемые API памяти, оценённые в таблице лидеров DolphinBench |
| ReMe | Китай (Alibaba Tongyi Lab) | Открытый код | Набор для памяти в стеке AgentScope, на файлах и векторах |
| MemoryOS | Китай (Пекинский университет почты и телекоммуникаций) | Apache 2.0 | Иерархическая ОС памяти; команда заявляет средний прирост F1 на 49.11% на LoCoMo |
| MemOS | Китай | Исследование | Рассматривает память как планируемый системный ресурс на уровнях открытого текста, активаций и параметров |
Самый ясный сигнал о том, куда всё идёт, это второй Agent Memory Challenge, стартовавший 20 сентября 2026 года. Его проводит Китайское общество изображений и графики совместно с Нанкинским университетом, Чжэцзянским университетом и Datawhale. Масштаб серьёзный: более 6000 оценочных примеров и примерно 300 миллионов токенов только в текстовом треке, плюс отдельные треки по коду и мультимодальности. Призовой фонд ¥150 000, и он зарезервирован за методами с открытым кодом. Коммерческие продукты могут участвовать и получать оценки, но идут по своей таблице лидеров и не выигрывают ничего.
Присмотритесь к этому решению внимательно. Те, кто пишет правила, вознаграждают открытые системы и при этом спрашивают с закрытых продуктов те же доказательства, просто на отдельной доске. Приём работ закрывается 4 ноября, результаты в середине ноября.
Одно из текстовых измерений конкурса никто не выносит в маркетинг: управление памятью, то есть обновления, разрешение конфликтов, удаление и забывание. Другое это эпистемическая безопасность и приватность, которые оценивают по воздержанию от ответа и минимальному раскрытию. Для регулируемого бизнеса это важнее всего, а до этого года почти ничего из этого не измерялось.
Что это значит для бизнеса, который запускает ИИ на клиентских разговорах?
Пять выводов, сделанных из результатов выше, а не из презентаций вендоров.
- Храните сырые разговоры, а не только резюме. Починка из одного хранилища провалилась во всех 48 случаях; сохранение исходной истории спасло 34. Резюме это кэш, а не система учёта.
- Спрашивайте точность и стоимость вместе. Слой памяти, который умножает ваши расходы и теряет в точности, это измеренный на бенчмарке результат, а не гипотеза.
- Проверяйте память действием, а не припоминанием. Применит ли агент предпочтение, которое ваш клиент назвал в марте, если ему об этом не напомнить?
- Спланируйте миграцию до того, как она понадобится. Наполовину мигрированные индексы эмбеддингов работают заметно хуже. Решите заранее, означает ли смена модели полный переэмбеддинг.
- Проверьте, что удаление доходит до производной памяти, а не только до карточки контакта, и попросите вендора это показать, а не описать.
Где в этом находится Entagl
У Entagl один мозг агента на все каналы, а не отдельный бот на каждый канал, и голосовой агент Coordinator перед звонком читает резюме прошлых переписок с клиентом, а не начинает с нуля. Бизнес-знания (услуги, товары, FAQ, часы работы, политики) живут в поисковой базе знаний, к которой обращаются агенты, и это ближе к подходу с фиксированной схемой, пережившему смену модели в исследовании переносимости, чем к свободным текстовым заметкам.
Перенос содержания из переписки в WhatsApp в переписку того же клиента в Instagram это отдельный слой межканальной памяти, и он сейчас в поэтапной раскатке, а не готов. Он пишет структурированное резюме по каждому разговору (на что ответили, что в ожидании, что пообещали), сохраняя при этом оригинальные сообщения. Он выключен, пока раскатка не дойдёт до рабочего пространства, владелец может отключить его в любой момент, он требует подтверждённой связки личности, прежде чем что-либо раскрыть (одного заявления клиента, что аккаунт его, недостаточно), производная память стирается при удалении контакта, а сохранённая память истекает по фиксированному сроку хранения.
В части управления принцип тот же, что мы изложили в статье что нового у ИИ-агентов в 2026 году: протоколы и ограничители: ИИ действует, люди управляют. Чек-лист покупателя по связанным карточкам клиентов в разных каналах смотрите в материале кросс-канальные разговоры с клиентами без путаницы.
Чего эти результаты не доказывают
Стоит честно обозначить границы.
DolphinBench использует синтетические персоны и симулированные приложения, поэтому потолок в 70.67% относится именно к этому набору задач и этим харнессам. Исследование переносимости шло на двух моделях с открытыми весами меньше 10 миллиардов параметров, так что его конкретные разбросы не перенесутся на фронтирную модель. Agent Memory Challenge ещё не опубликовал результаты второго цикла; у нас есть только его протокол. И Mem0 написал бенчмарк, который сам же и возглавляет: это раскрыто открыто и здесь в порядке вещей, но это причина хотеть независимого воспроизведения, прежде чем считать 70.67% решённым вопросом.
Направления это не меняет. Память впервые измеряют как положено, и измерения выходят менее лестными, чем маркетинг.
FAQ
Чем память ИИ-агента отличается от RAG?
RAG извлекает данные из корпуса документов, чтобы ответить на вопрос. Память агента управляет меняющимся состоянием по конкретному пользователю или аккаунту между сессиями: что изменилось, что устарело, что пообещали, что нужно забыть. RAG часто работает компонентом внутри системы памяти, но система памяти обязана ещё обрабатывать обновления, конфликты и удаление, чего индекс документов не делает.
Насколько точна память ИИ-агентов в 2026 году?
На DolphinBench, бенчмарке на основе действий, опубликованном 22 сентября 2026 года, лучшая конфигурация выполнила 70.67% из 600 задач, зависящих от памяти. Результаты сильно различались по базовой модели: с MiniMax M3 с открытыми весами встроенная память модели набрала 26.50%, а выделенный слой памяти дошёл до 47.83%.
Забывает ли ИИ-агент, когда вы меняете модель?
Может забыть, притом что никакие данные не удаляются. Сентябрьское исследование переносимости памяти 2026 года показало, что сжатые заметки на естественном языке сдвигали точность до 13.28 процентного пункта после смены модели, тогда как граф знаний с фиксированной схемой практически не пострадал. То, как вы храните память, и определяет, переживёт ли она смену.
Может ли клиент попросить ИИ-систему удалить то, что она о нём помнит?
Может, и такая возможность должна быть, но удаление обязано доходить и до производной памяти, а не только до оригинальных сообщений. Теперь это явно оцениваемое измерение в текстовом треке Agent Memory Challenge, наряду с обновлениями, разрешением конфликтов и забыванием. Попросите любого вендора это продемонстрировать, а не описать.
Заменяет ли память более широкое контекстное окно?
Нет. Статья CueMem показала, что модели с длинным контекстом деградируют по мере приближения входа к пределу окна, а их метод извлечения сравнялся с полной историей или обошёл её примерно на 10% входных токенов. Заметка OpenAI про V7 сообщает о том же компромиссе в продакшене: обход графа на порядок дешевле, чем длинный контекст.
Главное, что стоит запомнить
Задайте любому вендору один вопрос: что произойдёт со всем, что агент знает о моих клиентах, когда вы смените модель под ним? Исследования сентября 2026 года говорят, что честных ответов всего два: «мы храним сырую историю и выводим всё заново» или «часть деградирует, и полностью починить мы это не можем». Третьего ответа, который выдержит бенчмарки, нет.
Чтобы увидеть, как связка с общим мозгом справляется с этим в директах, веб-чате и звонках, запишитесь на 30-минутное демо и принесите свой самый трудный вопрос про непрерывность.
Источники, по состоянию на 23 сентября 2026 года: DolphinBench (Mem0, 22 сен 2026; статья); Does Your Agent's Memory Survive a Model Upgrade? (Goyal и Ray, 4 сен 2026); CueMem (11 сен 2026); Agent Memory Challenge, цикл 2 (CSIG, старт 20 сен 2026); How V7 gives AI agents institutional memory (OpenAI, 21 сен 2026); MemoryOS; MemOS; ReMe. Версии моделей и рейтинги меняются ежемесячно; по этой причине у цифр стоят даты.