Sistema de Memória MCP Local com Consolidação para Conversas de IA

O Que É Isso
Um desenvolvedor criou um sistema de memória local para conversas de IA que consolida e sintetiza informações em vez de apenas armazená-las. Construído como um servidor MCP, ele funciona com clientes compatíveis como Claude Desktop e Claude Code, rodando 100% localmente sem que nenhum dado saia do seu hardware.
Como Funciona
O diferencial principal em relação aos sistemas RAG padrão é o processo de consolidação. A cada 6 horas, um LLM local (Qwen 2.5-7B rodando no LM Studio) agrupa memórias recentes por tópico e as consolida em documentos de conhecimento estruturados. Ele extrai fatos, soluções e preferências, mesclando-os com o conhecimento existente e versionando tudo.
Stack Técnica
- Embeddings: nomic-embed-text-v1.5 via LM Studio
- Busca vetorial: FAISS (híbrida semântica + por palavra-chave)
- LLM de consolidação: Qwen 2.5-7B (Q4) via LM Studio
- Armazenamento: SQLite para episódios, FAISS para vetores
- Protocolo: MCP — funciona com qualquer coisa que o suporte
- Configuração: TOML
Funcionalidades
- Deduplicação semântica com limite de similaridade de cosseno de 0,95
- Pontuação adaptativa de surpresa — memórias acessadas com frequência são impulsionadas, as desatualizadas decaem
- Escritas atômicas com tempfile + os.replace para proteção contra falhas
- Exclusão baseada em lápide no FAISS — O(1) em vez de reconstruir todo o índice
- Degradação graciosa — se o LM Studio cair, o armazenamento ainda funciona, a consolidação pausa
- 88 testes passando
Ferramentas MCP
memory_store— salva um episódio com tipo, tags, pontuação de surpresamemory_recall— busca semântica entre episódios + conhecimento consolidadomemory_forget— marca um episódio para remoçãomemory_correct— atualiza um documento de conhecimentomemory_export— backup completo em JSONmemory_status— verificação de saúde
Por Que o MCP Foi Escolhido
Os modelos são substituídos com frequência, mas o conhecimento acumulado não deve desaparecer com eles. O MCP torna a memória portátil — um armazenamento, muitas interfaces. A camada de memória se torna mais valiosa do que qualquer modelo individual.
Resultados Práticos
Após cerca de uma semana de uso, o sistema construiu documentos de conhecimento sobre hardware de PC, configuração de VR, preferências de programação e arquiteturas de projetos — tudo sintetizado a partir de conversas normais. Ao iniciar novos chats, a IA já conhece o contexto do usuário sem necessidade de reexplicação.
Requisitos
- Python 3.11+
- LM Studio com Qwen 2.5-7B e nomic-embed-text-v1.5 carregados
- Qualquer cliente MCP
📖 Leia o código-fonte completo: r/LocalLLaMA
👀 See Also
Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700
Um usuário compartilha resultados de ajuste do vLLM para os modelos Qwen3.6 27B e 35B em uma única Radeon R9700, com diferenças de configuração e benchmarks detalhados.

Claude IDE Bridge: Ferramenta WebSocket para Acesso em Tempo Real à IDE
claude-ide-bridge é uma ponte WebSocket que conecta o Claude Code diretamente ao estado interno da IDE, permitindo diagnósticos em tempo real, ir para definição, encontrar referências, passar o mouse sobre tipos, abrir arquivos, gerenciar pontos de interrupção e transmitir o estado do depurador.

Habilidades do Claude Silenciosamente Substituem Instruções: Armadilhas Não Documentadas Expostas
Usuário descobre que Claude Skills silenciosamente impõe limites rígidos na entrada do usuário via `ask_user_input_v0` (máximo 3 perguntas, 4 opções cada), `Write` sobrescreve arquivos enquanto `create_file` recusa no Claude.ai, e caminhos relativos em `references/` não resolvem. Um repositório da comunidade cataloga descobertas.

Sou compatível com OpenAI: Ferramentas e Documentos para Assinaturas de API Unificadas
Uma nova ferramenta e página de documentação mapeia a compatibilidade com a OpenAI em mecanismos de código aberto como vLLM e llama.cpp, incluindo assinaturas oficiais e não oficiais.