Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM
Ad

Detalhes da Implementação Técnica

Um desenvolvedor compartilhou sua abordagem para construir uma ferramenta de pesquisa RAG local-first que roda inteiramente em uma única GPU. Todo o backend está contido em um único arquivo app.py.

Stack e Configuração

A ferramenta usa Nemotron Nano 9B v2 Japanese no vLLM com quantização FP16, rodando em uma GPU RTX 5090. O backend combina FastAPI + SQLite FTS5 + Jinja2. Para chamadas de ferramentas, o desenvolvedor usa os plugins de parser oficiais da NVIDIA, especificamente --tool-call-parser nemotron_json e --tool-parser-plugin, observando que o Nemotron v2 requer plugins de parser personalizados em vez dos parsers integrados do vLLM (que são para v3).

Principais Decisões de Design

O sistema implementa um fluxo de duas etapas extração → execução:

  • Quando uma pergunta é feita, o sistema primeiro extrai palavras-chave bilíngues (inglês e japonês) via LLM
  • Executa busca FTS5 em fontes locais E busca web no DuckDuckGo em paralelo
  • Mostra resultados com caixas de seleção para escolha do usuário
  • Só após a seleção do usuário ele gera a resposta final

Essa abordagem evita despejar 100k+ tokens de contexto e torcer para o modelo entender.

Ad

Desempenho e Recursos

  • Chamadas de Ferramentas: O modelo decide autonomamente quando buscar na web, funcionando surpreendentemente bem na temperatura 0.1
  • Aquecimento do Cache de Prefixo: Em vez de armazenar tudo em cache ao carregar a fonte, o cache KV é aquecido quando o usuário vê a prévia da fonte. Quando eles clicam em Executar, o prefixo já está em cache usando --enable-prefix-caching no vLLM
  • Busca FTS5 Bilíngue: Consulta do usuário → Nemotron extrai palavras-chave em inglês e japonês → consulta FTS5 MATCH com junção OR, eficaz para dados de patentes/pesquisa multilíngue

Números de Desempenho

  • ~80-120 tok/s de saída
  • 8192 tokens máximos
  • Extração de fontes: ~3-5s (extração de palavras-chave + FTS5 + DDG paralelo)
  • Resposta completa com 5 fontes + 3 resultados web: ~50s para uma resposta detalhada na RTX 5090

Configuração e Source

O código-fonte está disponível em https://github.com/soy-tuber/SoyLM. É um aplicativo de arquivo único que pode ser instalado com uv pip install -r requirements.txt. Observe que requer vLLM com os plugins de parser do Nemotron separadamente.

📖 Leia o source completo: r/LocalLLaMA

Ad

👀 See Also

A Habilidade Clawhub Permite ao OpenClaw Analisar Dados do Apple Health via API
Tools

A Habilidade Clawhub Permite ao OpenClaw Analisar Dados do Apple Health via API

Uma nova habilidade do Clawhub chamada 'apple-health-export-analyzer' permite que o OpenClaw leia e analise dados do Apple Health, servindo-os como uma API, analisando grandes arquivos XML para extrair métricas relevantes e fornecer atualizações diárias de saúde com sugestões acionáveis.

OpenClawRadar
Desenvolvedor Testa Qwen3.5 27B em Comparação com Modelos Maiores para Tarefas Locais de Programação
Tools

Desenvolvedor Testa Qwen3.5 27B em Comparação com Modelos Maiores para Tarefas Locais de Programação

Um desenvolvedor testou vários modelos Qwen3.5 e Nemotron, descobrindo que o Qwen3.5-27B-GGUF:UD-Q6_K_XL tem bom desempenho para tarefas de desenvolvimento no hardware existente de 2x RTX 3090, com 803 pp e 25 tg/s em contexto de 256k no vast.ai.

OpenClawRadar
Elodin disponibiliza em código aberto um Arreio de IA com Simulação em Tempo Real do Betaflight para Participantes do AI Grand Prix
Tools

Elodin disponibiliza em código aberto um Arreio de IA com Simulação em Tempo Real do Betaflight para Participantes do AI Grand Prix

Elodin lançou um harness de simulação open-source para o qualificador virtual do AI Grand Prix, correspondendo às restrições da competição e rodando com o Betaflight real. A ferramenta baseada em Rust/Bevy gera amostras de sensores de câmera diretamente no loop, evitando a sobrecarga de motores de jogos pesados.

OpenClawRadar
Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões
Tools

Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões

Doc Harness é uma habilidade do Claude Code que cria um sistema de documentação leve com cinco arquivos estruturados para ajudar agentes de IA a manter o contexto do projeto entre sessões. Ele aborda problemas como redefinições de contexto, regras esquecidas e a necessidade de reexplicar projetos para novos agentes.

OpenClawRadar