Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM

Detalhes da Implementação Técnica
Um desenvolvedor compartilhou sua abordagem para construir uma ferramenta de pesquisa RAG local-first que roda inteiramente em uma única GPU. Todo o backend está contido em um único arquivo app.py.
Stack e Configuração
A ferramenta usa Nemotron Nano 9B v2 Japanese no vLLM com quantização FP16, rodando em uma GPU RTX 5090. O backend combina FastAPI + SQLite FTS5 + Jinja2. Para chamadas de ferramentas, o desenvolvedor usa os plugins de parser oficiais da NVIDIA, especificamente --tool-call-parser nemotron_json e --tool-parser-plugin, observando que o Nemotron v2 requer plugins de parser personalizados em vez dos parsers integrados do vLLM (que são para v3).
Principais Decisões de Design
O sistema implementa um fluxo de duas etapas extração → execução:
- Quando uma pergunta é feita, o sistema primeiro extrai palavras-chave bilíngues (inglês e japonês) via LLM
- Executa busca FTS5 em fontes locais E busca web no DuckDuckGo em paralelo
- Mostra resultados com caixas de seleção para escolha do usuário
- Só após a seleção do usuário ele gera a resposta final
Essa abordagem evita despejar 100k+ tokens de contexto e torcer para o modelo entender.
Desempenho e Recursos
- Chamadas de Ferramentas: O modelo decide autonomamente quando buscar na web, funcionando surpreendentemente bem na temperatura 0.1
- Aquecimento do Cache de Prefixo: Em vez de armazenar tudo em cache ao carregar a fonte, o cache KV é aquecido quando o usuário vê a prévia da fonte. Quando eles clicam em Executar, o prefixo já está em cache usando
--enable-prefix-cachingno vLLM - Busca FTS5 Bilíngue: Consulta do usuário → Nemotron extrai palavras-chave em inglês e japonês → consulta FTS5 MATCH com junção OR, eficaz para dados de patentes/pesquisa multilíngue
Números de Desempenho
- ~80-120 tok/s de saída
- 8192 tokens máximos
- Extração de fontes: ~3-5s (extração de palavras-chave + FTS5 + DDG paralelo)
- Resposta completa com 5 fontes + 3 resultados web: ~50s para uma resposta detalhada na RTX 5090
Configuração e Source
O código-fonte está disponível em https://github.com/soy-tuber/SoyLM. É um aplicativo de arquivo único que pode ser instalado com uv pip install -r requirements.txt. Observe que requer vLLM com os plugins de parser do Nemotron separadamente.
📖 Leia o source completo: r/LocalLLaMA
👀 See Also

A Habilidade Clawhub Permite ao OpenClaw Analisar Dados do Apple Health via API
Uma nova habilidade do Clawhub chamada 'apple-health-export-analyzer' permite que o OpenClaw leia e analise dados do Apple Health, servindo-os como uma API, analisando grandes arquivos XML para extrair métricas relevantes e fornecer atualizações diárias de saúde com sugestões acionáveis.

Desenvolvedor Testa Qwen3.5 27B em Comparação com Modelos Maiores para Tarefas Locais de Programação
Um desenvolvedor testou vários modelos Qwen3.5 e Nemotron, descobrindo que o Qwen3.5-27B-GGUF:UD-Q6_K_XL tem bom desempenho para tarefas de desenvolvimento no hardware existente de 2x RTX 3090, com 803 pp e 25 tg/s em contexto de 256k no vast.ai.

Elodin disponibiliza em código aberto um Arreio de IA com Simulação em Tempo Real do Betaflight para Participantes do AI Grand Prix
Elodin lançou um harness de simulação open-source para o qualificador virtual do AI Grand Prix, correspondendo às restrições da competição e rodando com o Betaflight real. A ferramenta baseada em Rust/Bevy gera amostras de sensores de câmera diretamente no loop, evitando a sobrecarga de motores de jogos pesados.

Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões
Doc Harness é uma habilidade do Claude Code que cria um sistema de documentação leve com cinco arquivos estruturados para ajudar agentes de IA a manter o contexto do projeto entre sessões. Ele aborda problemas como redefinições de contexto, regras esquecidas e a necessidade de reexplicar projetos para novos agentes.