NerfGuard: Um Classificador que Roteia Solicitações de Codificação para Modelos Mais Baratos, Reduzindo Custos em 3x

✍️ OpenClawRadar📅 Publicado: June 6, 2026🔗 Source
NerfGuard: Um Classificador que Roteia Solicitações de Codificação para Modelos Mais Baratos, Reduzindo Custos em 3x
Ad

Uma equipe que migrou do Claude Code para o Codex em busca de velocidade e controlabilidade se viu enfrentando altos custos por token. A conta diária era impressionante, e eles perceberam que estavam usando modelos de ponta com raciocínio máximo para cada tarefa, até as mais triviais. Então, construíram o NerfGuard — um classificador rápido que roteia cada solicitação para o modelo e profundidade de raciocínio menos caros necessários.

O núcleo é um classificador que determina a inteligência mínima necessária para uma determinada solicitação de codificação. Além disso, aplica técnicas automatizadas de eficiência de tokens. O resultado: aproximadamente a mesma qualidade para um gasto de tokens muito menor e, como a inteligência e o raciocínio são adequadamente alocados, a velocidade também aumenta consideravelmente. A equipe observou uma economia de até 3x e horas por dia por pessoa economizadas esperando por turnos de ferramentas e respostas do agente.

Ad

Detalhes principais da fonte:

  • Classificador roteia para o modelo + profundidade de raciocínio mais baratos para cada solicitação
  • Técnicas adicionais automáticas de eficiência de tokens
  • Resultado: 3x mais uso pelo mesmo gasto
  • Melhorias de velocidade: horas por dia por pessoa economizadas
  • Mais uso antes de atingir limites de throttling

Atualmente, a ferramenta é usada por engenheiros em várias empresas de IA. A ferramenta está disponível em nerfguard.com.

Para quem é indicado: Equipes que usam agentes de codificação (Claude Code, Codex, etc.) que desejam maximizar a produção por dólar e reduzir o tempo de espera.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

LLMs Vazam Raciocínio em Saídas Estruturadas Apesar de Instruções Explícitas
Tools

LLMs Vazam Raciocínio em Saídas Estruturadas Apesar de Instruções Explícitas

Um desenvolvedor que construiu uma ferramenta que faz chamadas paralelas à API do Claude e analisa a saída estruturada descobriu que os modelos de validação ocasionalmente emitem texto de raciocínio antes do conteúdo corrigido, apesar de instruções explícitas para retornar apenas o texto corrigido. A correção envolveu o aperto do prompt mais uma função defensiva de remoção que é executada antes da análise.

OpenClawRadar
Servidor MCP Conecta Claude Code/Desktop ao Apple Music — Listas de Reprodução, Pesquisa, Análise de Perfil
Tools

Servidor MCP Conecta Claude Code/Desktop ao Apple Music — Listas de Reprodução, Pesquisa, Análise de Perfil

Um novo servidor MCP permite que o Claude Code e o Claude Desktop controlem o Apple Music — liste playlists, pesquise músicas, crie playlists e analise padrões de escuta por meio de linguagem natural.

OpenClawRadar
GitHub Comic Bot: Transforme Commits em Quadrinhos Diários de Cavaleiros Medievais
Tools

GitHub Comic Bot: Transforme Commits em Quadrinhos Diários de Cavaleiros Medievais

Um bot que lê commits do GitHub e gera tirinhas de 4 painéis com um cavaleiro medieval impassível, construído com Claude Code e Gemini, rodando no GitHub Actions com custos de camada gratuita.

OpenClawRadar
Plataforma de IA da Cloudflare: Camada de Inferência Unificada para Agentes de IA
Tools

Plataforma de IA da Cloudflare: Camada de Inferência Unificada para Agentes de IA

A Plataforma de IA da Cloudflare oferece uma única API para acessar mais de 70 modelos de mais de 12 provedores, incluindo suporte multimodal para modelos de imagem, vídeo e fala. Ela permite alternar entre modelos com alterações de código de uma linha e oferece monitoramento centralizado de custos com metadados personalizados.

OpenClawRadar