Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM

Detalhes da Implementação Técnica
Um desenvolvedor compartilhou sua abordagem para construir uma ferramenta de pesquisa RAG local-first que roda inteiramente em uma única GPU. Todo o backend está contido em um único arquivo app.py.
Stack e Configuração
A ferramenta usa Nemotron Nano 9B v2 Japanese no vLLM com quantização FP16, rodando em uma GPU RTX 5090. O backend combina FastAPI + SQLite FTS5 + Jinja2. Para chamadas de ferramentas, o desenvolvedor usa os plugins de parser oficiais da NVIDIA, especificamente --tool-call-parser nemotron_json e --tool-parser-plugin, observando que o Nemotron v2 requer plugins de parser personalizados em vez dos parsers integrados do vLLM (que são para v3).
Principais Decisões de Design
O sistema implementa um fluxo de duas etapas extração → execução:
- Quando uma pergunta é feita, o sistema primeiro extrai palavras-chave bilíngues (inglês e japonês) via LLM
- Executa busca FTS5 em fontes locais E busca web no DuckDuckGo em paralelo
- Mostra resultados com caixas de seleção para escolha do usuário
- Só após a seleção do usuário ele gera a resposta final
Essa abordagem evita despejar 100k+ tokens de contexto e torcer para o modelo entender.
Desempenho e Recursos
- Chamadas de Ferramentas: O modelo decide autonomamente quando buscar na web, funcionando surpreendentemente bem na temperatura 0.1
- Aquecimento do Cache de Prefixo: Em vez de armazenar tudo em cache ao carregar a fonte, o cache KV é aquecido quando o usuário vê a prévia da fonte. Quando eles clicam em Executar, o prefixo já está em cache usando
--enable-prefix-cachingno vLLM - Busca FTS5 Bilíngue: Consulta do usuário → Nemotron extrai palavras-chave em inglês e japonês → consulta FTS5 MATCH com junção OR, eficaz para dados de patentes/pesquisa multilíngue
Números de Desempenho
- ~80-120 tok/s de saída
- 8192 tokens máximos
- Extração de fontes: ~3-5s (extração de palavras-chave + FTS5 + DDG paralelo)
- Resposta completa com 5 fontes + 3 resultados web: ~50s para uma resposta detalhada na RTX 5090
Configuração e Source
O código-fonte está disponível em https://github.com/soy-tuber/SoyLM. É um aplicativo de arquivo único que pode ser instalado com uv pip install -r requirements.txt. Observe que requer vLLM com os plugins de parser do Nemotron separadamente.
📖 Leia o source completo: r/LocalLLaMA
👀 See Also

Plugin Design Studio para Claude Code Adiciona Equipe de Design Virtual com 9 Funções e 16 Comandos
Um novo plugin Claude Code chamado Design Studio simula uma equipe de design completa com 9 funções especializadas, 16 comandos de barra e 5 agentes. Ele detecta automaticamente as pilhas tecnológicas e inclui mais de 8.000 linhas de conhecimento de design em arquivos de referência.

Desenvolvimento de IA Local com Qwen3.6-27B e Opencode em uma 5090
Um usuário do Reddit compartilha sua experiência ao migrar de ferramentas de IA de codificação na nuvem (Claude Code, Cursor) para uma configuração local usando Opencode + llama-server + Qwen3.6-27B com contexto de 128K em uma única RTX 5090, citando liberdade de limites de uso e riscos de conta.

Plugin GTM de Código Aberto para Claude Code com 166 Habilidades de Marketing e Comando Bootstrap
Um desenvolvedor lançou um plugin de código aberto Go-To-Market para o Claude Code que oferece 166 habilidades especializadas de marketing em SEO, conteúdo, outbound, vendas, crescimento, análise, estratégia, anúncios, social, CRM e busca por IA. O plugin inclui um comando /bootstrap que entrevista os usuários sobre sua marca para gerar arquivos de contexto personalizados.
Lathoa: Um aplicativo de matemática para crianças onde a IA deve errar
Lathoa é um app de matemática para crianças de 10 a 14 anos em que um robô chamado Errol resolve problemas passo a passo, com um passo intencionalmente errado. A parte difícil não foi fazer a IA ser inteligente — foi fazê-la errar de propósito.