agentmemory V4 atinge 96,2% no benchmark LongMemEval, superando sistemas comerciais de memória de IA

O agentmemory V4 é um sistema de memória de código aberto para agentes de IA que acabou de alcançar uma pontuação recorde mundial de 96,2% no LongMemEval, o benchmark padrão para memória de longo prazo de agentes de IA.
Desempenho no Benchmark
O sistema superou várias empresas de memória de IA financiadas:
- PwC Chronos: 95,6%
- Mastra: 94,87%
- OMEGA: 93,2% (bruto)
- Supermemory: 85,86%
- Emergence AI: 86%
- Zep: 71,2%
Detalhes do Desenvolvimento
Desenvolvido por uma única pessoa em 16 dias em um PC gamer de médio porte (i3-12100F) com um custo total de US$ 1.000. O sistema usa o Claude Opus como gerador e o GPT-4o como avaliador, mas a arquitetura de recuperação é a principal inovação.
Arquitetura Técnica
O sistema combina várias técnicas de recuperação em um único sistema baseado em SQLite:
- HNSW (Hierarchical Navigable Small World) para busca aproximada do vizinho mais próximo
- BM25 para recuperação de texto tradicional
- Cross-encoder para pontuação de relevância
- Integração de grafo de conhecimento
- Fundamentação temporal para recuperação de memória consciente do tempo
Disponibilidade
O sistema é de código aberto sob a licença MIT e está disponível em: github.com/JordanMcCann/agentmemory
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Mercado MCP Construído com Claude Code Inclui Verificação de Segurança e Monetização
Um desenvolvedor criou mcp-marketplace.io usando Claude Code para 95% da base de código, criando um mercado curado com verificação de segurança para mais de 2.200 servidores MCP e opções de monetização para criadores.

LamBench: Um Conjunto de Benchmarks de Cálculo Lambda para Agentes de Codificação de IA
LamBench é um conjunto de benchmarks que avalia agentes de IA em tarefas de cálculo lambda, medindo inteligência, velocidade e elegância. A versão v1 inclui problemas e uma matriz de pontuações.

Claude Code v2.1.166: Modelos de Fallback, Regras Glob de Negação, Fortalecimento entre Sessões
Claude Code v2.1.166 introduz até 3 modelos de fallback, suporte a padrões glob em regras de negação, mensagens entre sessões mais seguras e correções para flickering de terminal, processos órfãos e muito mais.

Visualizador HF: Visualize Instantaneamente o Gráfico de Qualquer Modelo do Hugging Face
HF Viewer é uma ferramenta baseada em navegador que renderiza um gráfico de arquitetura interativo para qualquer modelo Hugging Face. Cole uma URL ou nome de repositório e inspecione o gráfico sem configuração local.