Pesquisa semântica local para conversas de IA com fastembed e LanceDB

✍️ OpenClawRadar📅 Publicado: March 20, 2026🔗 Source
Pesquisa semântica local para conversas de IA com fastembed e LanceDB
Ad

Um desenvolvedor implementou um sistema de busca semântica local para histórico de conversas de IA, processando 368 mil mensagens sem dependências de nuvem ou chaves de API. O projeto usa fastembed com o modelo BAAI/bge-small-en-v1.5 para embeddings baseados em CPU e LanceDB como armazenamento vetorial que opera como um único diretório sem processo de servidor.

Stack Técnica

  • Embeddings: fastembed com modelo BAAI/bge-small-en-v1.5 (384 dimensões)
  • Armazenamento vetorial: LanceDB - diretório único, sem processo de servidor, amigável para anexos
  • Ingestão: Coleta de transcrições de sessões JSONL (Claude Code, qualquer exportação de chat)
  • Desempenho de embedding: ~500 documentos/segundo em CPU M4

Detalhes Principais de Implementação

O desenvolvedor aprendeu várias lições práticas durante a iteração de 4 meses:

  • Embedding seletivo: Versões iniciais incorporavam todas as mensagens, o que reduzia a relação sinal-ruído. A implementação atual incorpora apenas mensagens de usuários e mensagens de assistentes com conteúdo substancial (ignorando respostas como "claro, aqui está esse código"), reduzindo a contagem de vetores em 60% enquanto melhora a qualidade da busca.
  • Estratégia de fragmentação: Mudar de fragmentos de tamanho fixo para fragmentos por turno de conversa fez uma diferença enorme na relevância da recuperação. A escolha do modelo (testados nomic-embed-text, bge-large, all-MiniLM) mostrou diferenças marginais comparadas à abordagem de fragmentação.
  • Vantagens do LanceDB: O desenvolvedor considerou o LanceDB "estupidamente subestimado para escala pessoal" - sem servidor, sem Docker, apenas um diretório com anexação instantânea de novos vetores, substituindo uma configuração pgvector superdimensionada.
  • Fluxo de trabalho de re-embedding: O modelo bge-small-en-v1.5 com 384 dimensões é rápido o suficiente para reincorporar a cada hora como um trabalho cron. Uma reindexação completa de 117 mil vetores leva aproximadamente 4 minutos em hardware M2.
Ad

Métricas de Desempenho

  • Total de mensagens ingeridas: 407 mil
  • Vetores indexados: 87 mil
  • Latência de busca (p50): 12ms em 117 mil vetores
  • Tempo de reindexação completa: ~4 minutos (M2)
  • Armazenamento: ~180MB em disco
  • Chaves de API necessárias: 0

O projeto é de código aberto sob licença MIT e está disponível em github.com/mordechaipotash/brain-mcp. A instalação é via pipx install brain-mcp && brain-mcp setup.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Sistema de 2 Prompts para Carregar Contexto Entre Chats do Claude Sem Desperdício de Tokens
Tools

Sistema de 2 Prompts para Carregar Contexto Entre Chats do Claude Sem Desperdício de Tokens

Um desenvolvedor compartilha dois prompts para comprimir toda uma conversa do Claude em um bloco de contexto estruturado e carregá-lo em um novo chat, preservando decisões, trabalho e próximos passos.

OpenClawRadar
Mestre de Prompt: Habilidade Claude para Gerar Prompts Precisos de Ferramentas de IA
Tools

Mestre de Prompt: Habilidade Claude para Gerar Prompts Precisos de Ferramentas de IA

Prompt-Master é uma habilidade gratuita do Claude que cria prompts precisos para várias ferramentas de IA, incluindo Cursor, Claude Code, GPT, Midjourney, Kling e Eleven Labs. A ferramenta alcançou mais de 600 estrelas no GitHub e processa mais de 4000 acessos.

OpenClawRadar
BetterClaw vs OpenClaw: Comparação de Chamadas de Ferramentas, Saídas Estruturadas e Controle de Fluxo de Trabalho
Tools

BetterClaw vs OpenClaw: Comparação de Chamadas de Ferramentas, Saídas Estruturadas e Controle de Fluxo de Trabalho

Uma comparação voltada para desenvolvedores entre BetterClaw e OpenClaw, abordando chamada de ferramentas, saídas estruturadas, controle de fluxo de trabalho e desenvolvimento diário de agentes.

OpenClawRadar
Claude Code reconstruiu o fluxo de integração de SaaS em 6 horas contra o prazo de 3 semanas do desenvolvedor, aumentando a ativação em 13 pontos
Tools

Claude Code reconstruiu o fluxo de integração de SaaS em 6 horas contra o prazo de 3 semanas do desenvolvedor, aumentando a ativação em 13 pontos

Um fundador de SaaS usou o Claude Code para reconstruir todo o fluxo de integração (cadastro → perfil → primeira fatura → tutorial do painel) em 6 horas, substituindo o orçamento de US$ 4.500 e 3 semanas de um desenvolvedor. A taxa de ativação melhorou 13 pontos percentuais, de 35% para 48%.

OpenClawRadar