Mnemos: Camada de Memória Local-First de Código Aberto para Agentes de Codificação

O que o Mnemos Resolve
O Mnemos aborda três problemas específicos que o criador observou em sistemas de memória de agentes: fatos específicos de repositórios vazando para trabalhos não relacionados, fatos antigos persistindo indefinidamente junto com novos fatos e armazenamento de transcrições crescendo sem compactação adequada.
Recursos Atuais da Beta
- Arquitetura local-first
- Perfil inicial SQLite
- Suporte MCP para Claude Code, Claude Desktop e hosts stdio genéricos
- Configuração documentada do Codex através de MCP +
AGENTS.md
Componentes do Pipeline Biomimético
- SurprisalGate: Filtra ruído para evitar que interações de baixo sinal se tornem memória de longo prazo
- MutableRAG: Reescreve fatos desatualizados em vez de acumular duplicatas
- AffectiveRouter & SpreadingActivation: Tornam a recuperação mais contextual do que uma simples busca vetorial
- SleepDaemon: Consolida logs episódicos brutos em fatos duráveis e poda o restante
Instalação & Configuração
Instale com: pip install "mnemos-memory[mcp]"
Execute diagnósticos: mnemos-cli doctor
Áreas de Foco para Feedback
O criador está especificamente buscando feedback sobre: isolamento de escopo em fluxos de trabalho reais de repositórios, qualidade de recuperação durante tarefas reais de codificação, comportamento do host MCP e fluxos de trabalho do Codex.
Recursos
- Site: https://mnemos.making-minds.ai
- GitHub: https://github.com/anthony-maio/mnemos
- Análise técnica detalhada: https://anthonymaio.substack.com/p/your-agent-has-amnesia
📖 Read the full source: r/LocalLLaMA
👀 See Also
WorldClaw: Geração de Mundo Aberto 3D Agêntica em Escala
O WorldClaw da Tencent é um novo sistema para geração agêntica de mundos abertos 3D em escala, visando criar ambientes virtuais grandes e detalhados.

PaperclipAI: Orquestração de código aberto para empresas sem intervenção humana
PaperclipAI é um framework de orquestração de código aberto projetado para empresas totalmente automatizadas. O projeto conquistou 14.000 estrelas no GitHub em sua primeira semana de existência.

hipEngine: Inferência Nativa Rápida do Qwen 3.6 para RDNA3 (Strix Halo, 7900 XTX)
hipEngine é um novo mecanismo de inferência nativo ROCm (AGPLv3) para Qwen 3.6 MoE em GPUs RDNA3. Benchmarks mostram prefill de até 2718 tok/s em 7900 XTX, competitivo com llama.cpp, e cache KV INT8 permitindo contexto completo de 256K em menos de 24 GB.

Implementação do Agente Local OpenClaw com Cache TurboQuant para Hardware de Médio Porte
Um aplicativo de um clique para o OpenClaw com modelos locais agora roda em dispositivos de médio porte como o MacBook Air com 16GB de RAM usando cache TurboQuant e aquecimento de contexto. A implementação corrige o llama.cpp para chamadas de ferramentas confiáveis e alcança 10-15 tokens por segundo com o Gemma 4 e QWEN 3.5.