Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM
Ad

Detalhes da Implementação Técnica

Um desenvolvedor compartilhou sua abordagem para construir uma ferramenta de pesquisa RAG local-first que roda inteiramente em uma única GPU. Todo o backend está contido em um único arquivo app.py.

Stack e Configuração

A ferramenta usa Nemotron Nano 9B v2 Japanese no vLLM com quantização FP16, rodando em uma GPU RTX 5090. O backend combina FastAPI + SQLite FTS5 + Jinja2. Para chamadas de ferramentas, o desenvolvedor usa os plugins de parser oficiais da NVIDIA, especificamente --tool-call-parser nemotron_json e --tool-parser-plugin, observando que o Nemotron v2 requer plugins de parser personalizados em vez dos parsers integrados do vLLM (que são para v3).

Principais Decisões de Design

O sistema implementa um fluxo de duas etapas extração → execução:

  • Quando uma pergunta é feita, o sistema primeiro extrai palavras-chave bilíngues (inglês e japonês) via LLM
  • Executa busca FTS5 em fontes locais E busca web no DuckDuckGo em paralelo
  • Mostra resultados com caixas de seleção para escolha do usuário
  • Só após a seleção do usuário ele gera a resposta final

Essa abordagem evita despejar 100k+ tokens de contexto e torcer para o modelo entender.

Ad

Desempenho e Recursos

  • Chamadas de Ferramentas: O modelo decide autonomamente quando buscar na web, funcionando surpreendentemente bem na temperatura 0.1
  • Aquecimento do Cache de Prefixo: Em vez de armazenar tudo em cache ao carregar a fonte, o cache KV é aquecido quando o usuário vê a prévia da fonte. Quando eles clicam em Executar, o prefixo já está em cache usando --enable-prefix-caching no vLLM
  • Busca FTS5 Bilíngue: Consulta do usuário → Nemotron extrai palavras-chave em inglês e japonês → consulta FTS5 MATCH com junção OR, eficaz para dados de patentes/pesquisa multilíngue

Números de Desempenho

  • ~80-120 tok/s de saída
  • 8192 tokens máximos
  • Extração de fontes: ~3-5s (extração de palavras-chave + FTS5 + DDG paralelo)
  • Resposta completa com 5 fontes + 3 resultados web: ~50s para uma resposta detalhada na RTX 5090

Configuração e Source

O código-fonte está disponível em https://github.com/soy-tuber/SoyLM. É um aplicativo de arquivo único que pode ser instalado com uv pip install -r requirements.txt. Observe que requer vLLM com os plugins de parser do Nemotron separadamente.

📖 Leia o source completo: r/LocalLLaMA

Ad

👀 See Also

Plugin Design Studio para Claude Code Adiciona Equipe de Design Virtual com 9 Funções e 16 Comandos
Tools

Plugin Design Studio para Claude Code Adiciona Equipe de Design Virtual com 9 Funções e 16 Comandos

Um novo plugin Claude Code chamado Design Studio simula uma equipe de design completa com 9 funções especializadas, 16 comandos de barra e 5 agentes. Ele detecta automaticamente as pilhas tecnológicas e inclui mais de 8.000 linhas de conhecimento de design em arquivos de referência.

OpenClawRadar
Desenvolvimento de IA Local com Qwen3.6-27B e Opencode em uma 5090
Tools

Desenvolvimento de IA Local com Qwen3.6-27B e Opencode em uma 5090

Um usuário do Reddit compartilha sua experiência ao migrar de ferramentas de IA de codificação na nuvem (Claude Code, Cursor) para uma configuração local usando Opencode + llama-server + Qwen3.6-27B com contexto de 128K em uma única RTX 5090, citando liberdade de limites de uso e riscos de conta.

OpenClawRadar
Plugin GTM de Código Aberto para Claude Code com 166 Habilidades de Marketing e Comando Bootstrap
Tools

Plugin GTM de Código Aberto para Claude Code com 166 Habilidades de Marketing e Comando Bootstrap

Um desenvolvedor lançou um plugin de código aberto Go-To-Market para o Claude Code que oferece 166 habilidades especializadas de marketing em SEO, conteúdo, outbound, vendas, crescimento, análise, estratégia, anúncios, social, CRM e busca por IA. O plugin inclui um comando /bootstrap que entrevista os usuários sobre sua marca para gerar arquivos de contexto personalizados.

OpenClawRadar
🦀
Tools

Lathoa: Um aplicativo de matemática para crianças onde a IA deve errar

Lathoa é um app de matemática para crianças de 10 a 14 anos em que um robô chamado Errol resolve problemas passo a passo, com um passo intencionalmente errado. A parte difícil não foi fazer a IA ser inteligente — foi fazê-la errar de propósito.

OpenClawRadar