llmLibrarian: Motor de RAG Local com Integração MCP para Busca de IA Baseada em Arquivos

O Que É Isso
llmLibrarian é um mecanismo RAG (Geração Aumentada por Recuperação) local que expõe capacidades de recuperação através do Model Context Protocol (MCP). Ele permite indexar pastas em silos (coleções ChromaDB) e depois consultá-las de qualquer cliente MCP—incluindo o Claude—para obter respostas fundamentadas e citadas.
Recursos Principais e Arquitetura
A ferramenta indexa pastas em silos, que são coleções ChromaDB. Quando você quer respostas diretas em vez de trechos brutos, o Ollama cuida da camada de síntese. Tudo roda localmente na sua máquina.
O desenvolvedor destaca a capacidade multi-silo como particularmente poderosa: combinar silos permite que padrões surjam entre domínios que seriam difíceis de capturar manualmente. Por exemplo, uma pasta de diário se torna um parceiro de pensamento que lembra o que você escreveu, e uma base de código se torna um agente que conhece seus arquivos reais.
Ferramentas MCP Expostas
retrieve— busca vetorial híbrida RRF que retorna trechos brutos com pontuações de confiança para o Claude raciocinarretrieve_bulk— consultas multi-ângulo em uma chamada, útil ao agregar entre tipos de documentosask— resposta sintetizada pelo Ollama diretamente do contexto recuperado (padrão é llama3.1:8b, mas você pode trocar por qualquer modelo que tenha baixado)list_silos,inspect_silo,trigger_reindex— ferramentas de gerenciamento de índice
Stack Técnico
- ChromaDB para armazenamento vetorial
- Ollama para síntese de modelos
- sentence-transformers (all-mpnet-base-v2, acelerado por MPS) para embeddings
- fastmcp para a camada MCP
O desenvolvedor menciona que a marcação de metadados multi-silo no ChromaDB levou várias iterações para ficar certa e está aberto a discutir a arquitetura.
Esse tipo de ferramenta é útil para desenvolvedores que querem construir agentes de IA que possam referenciar e raciocinar sobre seus arquivos locais sem enviar dados para serviços externos.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Desenvolvedor Cria Habilidades Práticas do Claude para Projetos Kotlin Multiplatform
Um desenvolvedor criou um repositório público de habilidades do Claude especificamente para trabalho com Kotlin Multiplatform, após considerar as habilidades existentes muito genéricas, opinativas ou superficiais. As habilidades abrangem revisões de arquitetura, implementação de funcionalidades, modularização, UI Compose Multiplatform, navegação, pontes de plataforma, deep links, UI adaptativa, testes e governança de build.

Validação do padrão de habilidades de autoevolução: resultados do experimento de 5 rodadas
Um desenvolvedor testou o padrão de design Self-Evolving Skill para Claude Code com um experimento de 5 rodadas em um banco de dados MySQL com 29 tabelas e 590MB de dados de gerenciamento de edifícios inteligentes. Os principais resultados incluem uma taxa de rejeição de 63,6% no Five-Gate, convergência incremental e 100% de precisão sem conhecimento incorreto sobrevivendo.

Mozilla Thunderbolt: Cliente de IA Empresarial de Código Aberto para Infraestrutura Autogerenciada
A Mozilla anunciou o Thunderbolt, um cliente de IA de código aberto sob licença MPL 2.0, projetado para que organizações implantem infraestrutura de IA auto-hospedada com escolha de modelos, integração de dados corporativos e aplicativos nativos multiplataforma.

Feynman: Agente de Pesquisa de Código Aberto com Ferramenta de Auditoria de Base de Código de Artigos
Feynman é um agente de pesquisa CLI de código aberto que despacha quatro subagentes em paralelo para responder perguntas de pesquisa e inclui uma ferramenta de auditoria única que compara afirmações de artigos com bases de código reais. Possui instalação com um comando, licença MIT e executa em pi para tempo de execução do agente com alphaxiv para busca de artigos.