Pular para o conteúdo

AI News · industry

Memória de Agentes de IA em 2026: O Que Mostram os Novos Benchmarks

Três testes de setembro de 2026 mediram o que os agentes realmente recordam. A melhor pontuação foi 70.67%, as notas comprimidas falharam quando se trocou de modelo e a memória chegou a custar mais do que o próprio agente.

Entagl Team12 min de leitura
Memória de Agentes de IA em 2026: O Que Mostram os Novos Benchmarks

A memória dos agentes de IA é a camada que permite a um agente usar algo que um cliente lhe disse há semanas e, à data de setembro de 2026, está mensuravelmente por acabar. No DolphinBench, lançado a 22 de setembro de 2026, a configuração com melhor pontuação completou 70.67% de 600 tarefas dependentes de memória. Quase um terço falhou. Um estudo controlado à parte, Does Your Agent's Memory Survive a Model Upgrade?, publicado a 4 de setembro, concluiu que, quando um repositório de memória construído por um modelo era entregue a outro, a exatidão se movia até 13.28 pontos percentuais na direção errada, sem que ninguém tocasse nos dados guardados.

Em setembro aconteceram três coisas que merecem a sua atenção se tem IA a falar com clientes: um benchmark que avalia a memória por ações em vez de respostas a perguntas, um estudo sobre se a memória sobrevive a uma atualização de modelo e um desafio alojado na China que coloca todos os sistemas de memória sob o mesmo conjunto de regras. Eis o que cada um mediu e o que muda.

O que é a memória de agentes de IA e em que difere de uma janela de contexto?

Uma janela de contexto é o espaço de trabalho que um modelo tem durante uma execução. Esvazia-se quando a execução termina. A memória do agente é estado duradouro: o que fica registado depois de uma conversa e é recuperado antes da seguinte.

A distinção importa porque a indústria insiste em resolver a memória aumentando a janela. As evidências dizem que isso, por si só, não funciona. O artigo sobre o CueMem (11 de setembro de 2026), da Mashang Consumer Finance e do Harbin Institute of Technology em Shenzhen, concluiu que alimentar o modelo com todo o histórico de diálogo degrada o desempenho à medida que a entrada se aproxima do limite de contexto, um efeito que os autores atribuem em parte ao contexto irrelevante e ao problema do «perdido a meio» (lost-in-the-middle). A abordagem de recuperação que propõem usou cerca de 10% dos tokens de entrada da configuração com histórico completo no benchmark LoCoMo e ainda assim obteve pontuação mais alta.

O texto da OpenAI de 21 de setembro sobre o V7, que constrói contexto de agentes para equipas de finanças e seguros, diz o mesmo a partir da produção: o grafo do V7 é "uma ordem de grandeza mais barato e mais rápido de percorrer do que as abordagens de contexto longo", com as trocas recentes mantidas em contexto ativo e o material mais antigo deixado no grafo até que algo o procure.

Portanto, memória não é uma janela maior. É uma decisão sobre o que registar e o que manter.

Porque é que os benchmarks mudaram em setembro de 2026?

Até agora, a maioria dos benchmarks de memória fazia perguntas. Isso favorece os sistemas testados.

O argumento do DolphinBench é direto. Se perguntar a um agente "que plataforma de mensagens é que a equipa usa?", já lhe disse que existe um facto sobre uma plataforma e que o quer. O passo mais difícil, perceber que é preciso recuperar alguma coisa, já foi feito por si. Por isso o DolphinBench elimina a pergunta. Dá ao agente três históricos simulados de trabalhadores do conhecimento (cerca de 500,000 tokens cada, 13,539 mensagens entre 2023 e 2027) e depois lança 600 tarefas contra aplicações simuladas, incluindo Notion, Gmail, GitHub e Discord, onde uma ação errada deixa um rasto que o avaliador consegue ver.

Um exemplo concreto: um CEO enuncia uma regra de canal uma única vez, em abril de 2023, segundo a qual as notas de versão vão para #eng-releases até o deploy estar verde. Nada a repete. Três anos e meio depois, enterrado num histórico de 3,400 mensagens, chega um pedido para publicar uma atualização de lançamento, e nenhum canal é indicado. Publique no canal errado e falha. Saber o facto não chega; o agente tem de o aplicar sem que ninguém lho lembre.

Cada teste é também certificado como resolúvel: tem de passar quando o histórico relevante é fornecido e falhar quando é retirado. Essa regra elimina a queixa habitual sobre benchmarks sintéticos, que é a de ninguém saber se um teste falhado alguma vez teve resposta possível.

Que sistemas de memória tiveram melhor desempenho e quanto custaram?

Seguem-se os resultados publicados do DolphinBench para o harness Hermes a correr o GPT-5.6 Luna, à data de 22 de setembro de 2026. A exatidão é a percentagem de 600 tarefas completadas. As colunas de custo são os custos de execução publicados pelo próprio benchmark para a suite completa, em dólares norte-americanos, úteis como rácio entre sistemas no mesmo teste e não como um preço que iria pagar.

Sistema de memória Exatidão Custo de execução do agente Custo de execução da memória Latência mediana
Mem0 70.67% 61.54 34.68 37.69s
Hindsight 69.50% 57.99 26.66 55.31s
Honcho 68.50% 96.56 46.30 44.66s
Memória nativa do modelo 65.67% 61.48 0.00 44.35s
Supermemory 59.17% 63.86 281.79 52.68s

Há duas conclusões que merecem mais atenção do que o vencedor.

A camada de memória pode custar mais do que o agente. O gasto em memória do Supermemory nesta execução foi cerca de quatro vezes e meia o seu gasto com o agente, e ficou em último lugar na exatidão. Qualquer fornecedor que lhe apresente um número de exatidão sem um número de custo está a mostrar-lhe metade do resultado. A posição do DolphinBench é que custo e latência pertencem à mesma linha que a exatidão, e é por isso que lhe chamam uma fronteira de Pareto em vez de uma tabela classificativa.

O quanto a memória ajuda depende muito do modelo por baixo. Com o GPT-5.6 Luna, uma camada de memória dedicada acrescentou cerca de cinco pontos face à memória nativa do modelo (70.67% contra 65.67%). Troque para o MiniMax M3, o modelo chinês de pesos abertos, e a memória nativa desaba para 26.50%, enquanto o Mem0 chegou a 47.83%, uma diferença de mais de vinte pontos. Quanto mais fraco for o tratamento nativo de históricos longos pelo modelo, mais peso a camada de memória externa carrega. Se está a usar um modelo de pesos abertos para controlar custos, é esta a conclusão sobre a qual deve agir.

A memória dos agentes sobrevive a uma atualização de modelo?

Normalmente não, e esta é a conclusão que a maioria das equipas ainda não incluiu nas contas.

O estudo de portabilidade citado acima passou 48 históricos sintéticos por quatro desenhos de memória e depois trocou o modelo que tinha escrito a memória. Resultados por desenho:

  • Grafo de conhecimento com esquema fixo: a exatidão variou +0.0004 pontos. Praticamente imune.
  • Notas comprimidas em linguagem natural: a exatidão deslocou-se +9.91 ou −13.28 pontos, consoante a direção da migração. As mesmas notas, outro leitor, outra resposta.
  • RAG com um índice de embeddings migrado a meio: um índice misto 50/50 captou apenas 4.96 dos 11.90 pontos de ganho disponíveis se tudo fosse reprocessado. Meia migração dá-lhe bastante menos de metade do benefício.

O resultado sobre reparação é o que convém guardar. Quando as notas comprimidas correram mal, corrigi-las apenas a partir do repositório falhou em atingir a meta de 90% de recuperação nos 48 casos. Manter o histórico original em bruto recuperou 34 dos 48. Se deitar fora as conversas originais e ficar só com o resumo, deitou fora a capacidade de corrigir o resumo.

Isto liga-se diretamente a algo que defendemos em porque não deve construir o seu negócio sobre um único modelo de IA: os modelos são descontinuados em ciclos de 12 a 18 meses. O que este estudo acrescenta é que ser agnóstico quanto ao modelo não é só trocar uma API. A memória que acumulou está acoplada ao modelo que a escreveu, e ninguém lhe envia um aviso de migração.

Quem está a construir memória de agentes e onde?

O campo está genuinamente dividido entre os EUA e a China, e entre aberto e fechado, de uma forma que a maior parte da cobertura em língua inglesa não capta.

Sistema Origem Licença O que é
Mem0 EUA Núcleo aberto + gerido Camada de memória pronta a integrar; autora do DolphinBench
Letta (anteriormente MemGPT) EUA Apache 2.0 Servidor de agentes com estado, com blocos de memória explícitos
Honcho, Hindsight, Supermemory EUA Comercial APIs de memória geridas, avaliadas na tabela do DolphinBench
ReMe China (Alibaba Tongyi Lab) Código aberto Kit de memória na stack AgentScope, baseado em ficheiros e vetores
MemoryOS China (Univ. de Correios e Telecomunicações de Pequim) Apache 2.0 Sistema operativo de memória hierárquica; a equipa reporta um ganho médio de F1 de 49.11% no LoCoMo
MemOS China Investigação Trata a memória como um recurso de sistema escalonável nos níveis de texto simples, ativação e parâmetros

O sinal mais claro sobre para onde isto caminha é o segundo Agent Memory Challenge, que abriu a 20 de setembro de 2026. É organizado pela China Society of Image and Graphics em conjunto com a Universidade de Nanjing, a Universidade de Zhejiang e a Datawhale. A escala é séria: mais de 6,000 instâncias de avaliação e cerca de 300 milhões de tokens só na pista textual, além de pistas separadas de programação e multimodal. O prémio total é de ¥150,000 e está reservado a métodos de código aberto. Os produtos comerciais podem participar e ser pontuados, mas correm na sua própria tabela e não ganham nada.

Leia essa opção de desenho com atenção. Quem define as regras está a premiar sistemas abertos, mantendo ao mesmo tempo os produtos fechados sujeitos às mesmas evidências numa tabela separada. As avaliações fecham a 4 de novembro, com resultados em meados de novembro.

Uma das dimensões textuais do desafio é aquela que ninguém usa no marketing: governação da memória, ou seja, atualizações, resolução de conflitos, eliminação e esquecimento. Outra é a segurança epistémica e a privacidade, pontuadas pela abstenção e pela divulgação mínima. São as que mais importam a um negócio regulado e, até este ano, quase nada as media.

O que significa isto para uma empresa que usa IA nas conversas com clientes?

Cinco conclusões, retiradas dos resultados acima e não de apresentações de fornecedores.

  1. Guarde as conversas em bruto, não apenas o resumo. A reparação feita só a partir do repositório falhou nos 48 casos; manter o histórico original recuperou 34. Um resumo é uma cache, não um sistema de registo.
  2. Peça exatidão e custo em conjunto. Uma camada de memória que multiplica o seu custo e perde exatidão é um resultado medido, não uma hipótese.
  3. Teste a memória por ação, não por recordação. O agente aplica a preferência que o seu cliente indicou em março sem que ninguém lha relembre?
  4. Planeie a migração antes de precisar dela. Índices de embeddings migrados a meio têm um desempenho muito fraco. Decida à partida se uma mudança de modelo implica reprocessar tudo de novo.
  5. Verifique se a eliminação chega à memória derivada, e não só ao registo do contacto, e peça ao seu fornecedor que o demonstre em vez de o descrever.

Onde a Entagl se posiciona

A Entagl usa um único cérebro de agente em todos os canais, em vez de um bot separado por canal, e o agente de voz Coordinator lê um resumo das conversas anteriores do cliente antes de ligar, em vez de começar do zero. O conhecimento do negócio (serviços, produtos, FAQs, horários, políticas) vive numa base de conhecimento pesquisável que os agentes consultam, o que está mais próximo da abordagem de esquema fixo que sobreviveu à troca de modelo no estudo de portabilidade do que de notas em texto livre.

Levar conteúdo de uma conversa de WhatsApp para a conversa desse mesmo cliente no Instagram é uma camada de memória entre canais à parte, e está em lançamento faseado, não terminada. Escreve um resumo estruturado por conversa (o que já foi respondido, o que está pendente, o que foi prometido) mantendo as mensagens originais. Fica desligada até o lançamento chegar a um workspace, o proprietário pode desativá-la a qualquer momento, exige uma ligação de identidade verificada antes de revelar seja o que for (não basta um cliente dizer que é dono de um handle), a memória derivada é apagada quando um contacto é eliminado e a memória guardada expira ao fim de um período de retenção fixo.

Quanto à governação, o princípio é o que definimos em o que há de novo nos agentes de IA em 2026: protocolos e salvaguardas: a IA age, as pessoas governam. Para a checklist do lado do comprador sobre registos de clientes ligados entre canais, veja conversas com clientes entre canais sem confusão.

O que estes resultados não provam

Vale a pena ser claro quanto aos limites.

O DolphinBench usa personas sintéticas e aplicações simuladas, por isso o teto de 70.67% é específico desse conjunto de tarefas e desses harnesses. O estudo de portabilidade correu sobre dois modelos de pesos abertos com menos de 10 mil milhões de parâmetros, por isso as variações exatas que reporta não se transferem para um modelo de fronteira. O Agent Memory Challenge ainda não publicou os resultados do segundo ciclo; o que temos é o seu protocolo. E a Mem0 é autora do benchmark que lidera, o que está divulgado abertamente e é normal neste campo, mas é motivo para querer replicação independente antes de tratar os 70.67% como assentes.

Nada disso muda a direção. A memória está a ser medida como deve ser pela primeira vez, e as medições são menos lisonjeiras do que o marketing.

FAQ

Qual é a diferença entre memória de agentes de IA e RAG?

O RAG recupera informação de um corpo de documentos para responder a uma pergunta. A memória do agente gere estado em evolução sobre um utilizador ou conta específicos ao longo de várias sessões: o que mudou, o que foi substituído, o que foi prometido, o que deve ser esquecido. O RAG é muitas vezes um componente dentro de um sistema de memória, mas um sistema de memória também tem de lidar com atualizações, conflitos e eliminação, coisas que um índice de documentos não faz.

Qual é a exatidão da memória de agentes de IA em 2026?

No DolphinBench, o benchmark baseado em ações publicado a 22 de setembro de 2026, a melhor configuração completou 70.67% de 600 tarefas dependentes de memória. Os resultados variaram muito consoante o modelo por baixo: com o MiniMax M3, de pesos abertos, a memória nativa do modelo obteve 26.50%, enquanto uma camada de memória dedicada chegou a 47.83%.

Um agente de IA esquece-se quando se muda o modelo?

Pode esquecer-se, sem que nenhum dado seja apagado. O estudo de portabilidade de memória de setembro de 2026 concluiu que notas comprimidas em linguagem natural deslocaram a exatidão até 13.28 pontos percentuais depois de uma troca de modelo, enquanto um grafo de conhecimento com esquema fixo ficou essencialmente inalterado. A forma como guarda a memória determina se ela sobrevive.

Um cliente pode pedir a um sistema de IA que apague o que ele recorda?

Pode, e deve poder fazê-lo, mas a eliminação tem de chegar também à memória derivada, e não apenas às mensagens originais. Esta é agora uma dimensão explicitamente pontuada na pista textual do Agent Memory Challenge, a par das atualizações, da resolução de conflitos e do esquecimento. Peça a qualquer fornecedor que o demonstre em vez de o descrever.

Uma janela de contexto maior substitui a memória?

Não. O artigo do CueMem concluiu que os modelos de contexto longo se degradam à medida que a entrada se aproxima do limite da janela, e o seu método de recuperação igualou ou superou o histórico completo com cerca de 10% dos tokens de entrada. O texto da OpenAI sobre o V7 reporta o mesmo compromisso em produção, onde percorrer um grafo é uma ordem de grandeza mais barato do que usar contexto longo.

A conclusão a reter

Faça a qualquer fornecedor uma pergunta: o que acontece a tudo o que o agente sabe sobre os meus clientes quando mudarem o modelo por baixo dele? A investigação de setembro de 2026 diz que as respostas honestas são "guardamos o histórico em bruto e voltamos a derivar" ou "parte disso degrada-se e não conseguimos reparar por completo". Não há uma terceira resposta que sobreviva aos benchmarks.

Para ver como uma configuração de cérebro partilhado lida com isto entre DMs, chat no site e chamadas, marque uma demonstração de 30 minutos e traga a sua pergunta mais difícil sobre continuidade.


Fontes, à data de 23 de setembro de 2026: DolphinBench (Mem0, 22 set. 2026; artigo); Does Your Agent's Memory Survive a Model Upgrade? (Goyal e Ray, 4 set. 2026); CueMem (11 set. 2026); Agent Memory Challenge ciclo 2 (CSIG, aberto a 20 set. 2026); How V7 gives AI agents institutional memory (OpenAI, 21 set. 2026); MemoryOS; MemOS; ReMe. As versões dos modelos e as classificações mudam todos os meses; por isso é que os números têm data.

Publicado por Entagl Team on