Sistema de Memória Automática de Código Aberto para Agentes LLM Alcança 94% de Precisão de Recuperação

✍️ OpenClawRadar📅 Publicado: March 21, 2026🔗 Source
Sistema de Memória Automática de Código Aberto para Agentes LLM Alcança 94% de Precisão de Recuperação
Ad

Um desenvolvedor disponibilizou em código aberto um sistema de memória automática para agentes baseados em LLM que extrai, classifica e persiste fatos automaticamente entre sessões sem exigir comandos explícitos de "salvar isso". Todo o projeto—incluindo código do plugin, design do benchmark e estrutura de testes—foi construído usando Claude Code como a principal ferramenta de desenvolvimento.

Como o Sistema de Memória Funciona

O sistema opera com duas camadas:

  • Camada 1 (por turno): Um LLM leve resume cada turno em tempo real e grava em um arquivo de preparação
  • Camada 2 (limite da sessão): Classificação assíncrona em quatro arquivos de habilidades: identidade, conhecimento, lições e preferências

A recuperação funciona fazendo com que o agente carregue arquivos de habilidades relevantes com base na correspondência de palavras-chave nas descrições. A abordagem usa arquivos markdown estruturados que o agente lê como "habilidades" em vez de bancos de dados vetoriais ou pipelines RAG.

Desenvolvimento com Claude Code

Claude Code auxiliou em múltiplos aspectos do projeto:

  • Design de arquitetura: Ajudou a avaliar LongMemEval como candidato a benchmark, identificou a incompatibilidade de paradigma (recuperação de contexto longo vs. memória progressiva) e propôs um benchmark adaptado com 6 tipos de perguntas
  • Criação do benchmark: Projetou o conjunto completo de testes com 20 sessões/48 fatos incluindo tabela de plantio de fatos, cadeias de atualização (A→B→C), pares de interferência, perguntas de abstenção e colocação de gatilhos de dois saltos
  • Estrutura de testes: Construiu toda a estrutura de autoteste incluindo executor serial, sondagem multi-turno, gerenciamento de ciclo de vida, avaliador de regras e pipeline de juiz LLM
  • Depuração em loop: Diagnosticou problemas ao vivo durante execuções de teste, como um popup de atualização bloqueando reinicializações do Agente, que foi corrigido travando o arquivo de estado do atualizador como somente leitura
Ad

Resultados do Benchmark

O benchmark de 20 sessões foi inspirado no LongMemEval e testou 48 fatos plantados em 6 tipos de perguntas:

  • Recuperação profunda: Fatos das sessões 1-2 testados 15+ sessões depois - 89%
  • Atualização de conhecimento: Cadeia de correção de 3 níveis (A→B→C) - 100%
  • Raciocínio entre sessões: Combinar fatos de 3+ sessões - 100%
  • Resistência à interferência: Nomes similares que não devem ser confundidos - 100%
  • Raciocínio temporal: Perguntas de ordenação "Qual veio primeiro?" - 80%
  • Abstenção: "Não sei" para fatos nunca mencionados - 86%

Geral: 49/52 pontos de verificação passados (94,2%). A única falha grave ocorreu quando o agente inferiu "você fez marketing em mídias sociais" de um fato vagamente relacionado ("trabalho de promoção") quando a resposta correta era "nunca discutido"—um problema clássico de superinferência de LLM.

Disponibilidade e Perguntas

O projeto é de código aberto com código e benchmark disponíveis no GitHub. O desenvolvedor está buscando feedback sobre a abordagem de arquivos de habilidades (markdown estruturado vs. busca vetorial), melhores formas de testar abstenção (identificada como a dimensão mais difícil) e informações sobre outros que estão avaliando memória entre sessões em agentes (não apenas contexto longo).

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Motor de Jogo de Aventura de Texto para Claude Desktop
Tools

Motor de Jogo de Aventura de Texto para Claude Desktop

Um motor de jogo de aventura de texto roda inteiramente dentro do Claude Desktop como uma habilidade, sem servidores, aplicativos ou código para executar. Inclui mecânicas completas de RPG, renderização de dados 3D, 19 módulos de expansão e arquivos de salvamento portáteis.

OpenClawRadar
Assistente de impostos com IA de prioridade local, com dados pessoais criptografados, desenvolvido sobre MCP
Tools

Assistente de impostos com IA de prioridade local, com dados pessoais criptografados, desenvolvido sobre MCP

Um desenvolvedor criou uma extensão para declaração de impostos para o Crow que criptografa todas as informações pessoais identificáveis (PII) com AES-256-GCM e funciona com qualquer cliente compatível com MCP, incluindo Claude, ChatGPT, Gemini ou modelos locais através do Ollama. O sistema processa cálculos localmente para o Formulário 1040, Anexo 1, HSA (8889), créditos educacionais (8863), trabalho autônomo (Anexo C/SE) e ganhos de capital (Anexo D).

OpenClawRadar
Antecipadamente: Um Plugin de Código Claude que Força o Pensamento Antes da Programação
Tools

Antecipadamente: Um Plugin de Código Claude que Força o Pensamento Antes da Programação

Upfront é um plugin Claude Code com 20 habilidades que desafia desenvolvedores antes de gerar código. Ele usa três comandos: /upfront:feature para questionar requisitos vagos, /upfront:plan para dividir o trabalho em fases de ~400 LOC, e /upfront:build para executar com TDD e revisão por fase.

OpenClawRadar
Orc: Orquestrador de Múltiplos Projetos de Código Aberto para Agentes de IA de Programação
Tools

Orc: Orquestrador de Múltiplos Projetos de Código Aberto para Agentes de IA de Programação

Orc é um orquestrador em nível de sistema operacional que coordena agentes de codificação de IA em múltiplos projetos usando bash, tmux e git worktrees. Ele aborda conflitos de merge, trabalho duplicado e sobrecarga de coordenação com um sistema de revisão de dois níveis e zero queima de tokens na orquestração.

OpenClawRadar