A pesquisa híbrida com RRF melhora o sistema de memória de IA em relação à pesquisa vetorial pura.

✍️ OpenClawRadar📅 Publicado: April 15, 2026🔗 Source
A pesquisa híbrida com RRF melhora o sistema de memória de IA em relação à pesquisa vetorial pura.
Ad

Um sistema de memória de código aberto para assistentes de IA foi desenvolvido, usando PostgreSQL com pgvector em uma configuração local-first e auto-hospedada. O sistema armazena informações para que os assistentes de IA se lembrem entre sessões e as torna pesquisáveis.

Por que a busca vetorial pura não foi suficiente

O desenvolvedor começou com busca vetorial pura: incorporando consultas, usando similaridade de cosseno e retornando os resultados top-k. Embora isso funcionasse para perguntas vagas, consistentemente falhava em correspondências exatas. Por exemplo, pesquisar por "RRF merging" retornaria trechos sobre "combining ranked lists" de meses atrás, em vez do documento que literalmente diz "RRF merging".

Solução de busca híbrida

A solução envolveu adicionar um segundo braço de busca: busca de texto completo usando tsvector do PostgreSQL com um índice GIN. Essa correspondência por palavras-chave captura o que a busca vetorial perde. No entanto, isso criou duas listas classificadas que precisavam ser mescladas.

Fusão de Classificação Recíproca (RRF)

A Fusão de Classificação Recíproca provou ser a resposta para mesclar as duas listas classificadas. A fórmula é simples: pontuação = 1 / (k + classificação), onde k=60 (o valor padrão). Resultados que aparecem em ambas as listas recebem ambas as pontuações somadas. Essa abordagem não requer ajuste de pesos e nem normalização de pontuação entre similaridade de cosseno e ts_rank—usa apenas posições de classificação.

Ad

Técnica de enriquecimento de consulta

Antes de pesquisar, o sistema executa consultas através do tokenizador WordPiece do modelo de incorporação para extrair termos-chave (tokens multi-subpalavra que são provavelmente termos técnicos ou de domínio). Isso gera até 3 variações de consulta, incorpora todas elas e pesquisa em paralelo. Isso captura resultados que uma formulação poderia perder.

Stack técnico

  • PostgreSQL 16 + pgvector (índice HNSW para vetores, índice GIN para texto completo)
  • all-MiniLM-L6-v2 para incorporações (384 dimensões, executa na CPU)
  • Python com psycopg 3 assíncrono
  • 3 adaptadores de ingestão: markdown, texto simples e JSON de conversação Claude

Todo o sistema é executado localmente sem chamadas de API para incorporações e sem dependências de nuvem. O código foi recentemente lançado, e o desenvolvedor escreveu um post de blog detalhado sobre a abordagem completa.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Portão Piast: Proxy de API de Código Aberto para Anonimização de Dados de LLM
Tools

Portão Piast: Proxy de API de Código Aberto para Anonimização de Dados de LLM

Piast Gate é um proxy de API de código aberto que anonimiza dados sensíveis antes de enviar solicitações para LLMs e restaura os dados originais nas respostas. O MVP atual suporta a API do Google Gemini, idioma polonês, execução local e pode anonimizar texto ou documentos do Word sem processamento por LLM.

OpenClawRadar
DGX Sparks Duplo vs Mac Studio M3 Ultra: Comparação Prática para Executar o Qwen3.5 397B Localmente
Tools

DGX Sparks Duplo vs Mac Studio M3 Ultra: Comparação Prática para Executar o Qwen3.5 397B Localmente

Um desenvolvedor comparou a execução local do Qwen3.5 397B em um Mac Studio M3 Ultra 512GB de US$ 10 mil e uma configuração dual DGX Spark de US$ 10 mil. O Mac Studio alcançou 30-40 tok/s com largura de banda de 800 GB/s, mas pré-preenchimento lento, enquanto os Sparks entregaram 27-28 tok/s com computação mais rápida, porém configuração complexa.

OpenClawRadar
Assistente de IA da UIUC Executa 11 Modelos em Paralelo para Respostas em Menos de 2 Segundos
Tools

Assistente de IA da UIUC Executa 11 Modelos em Paralelo para Respostas em Menos de 2 Segundos

O chatbot assistente de ensino de IA da UIUC executa 11 modelos em paralelo para recuperação e geração de texto e imagem, moderação e classificação, alcançando tempo de resposta médio de 2 segundos. Código aberto com RAG Pinecone e conjunto de dados RLHF.

OpenClawRadar
Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP
Tools

Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP

Um usuário cria um clone do Pacman com um único prompt usando Qwen 3.6 27B F16 — duas de três tentativas produzem jogos quase perfeitos. Quants de 8 bits falham completamente. Notas detalhadas sobre ajuste de template de chat e ganhos de velocidade com decodificação especulativa MTP.

OpenClawRadar