Claude Code Delega Codificação para Mistral/DeepSeek: 57M Tokens Economizados, 90-100% de Redução de Custos

O desenvolvedor pcx_wave publicou uma análise detalhada do vibe-skill, uma skill do Claude Code que delega tarefas de codificação para modelos mais baratos (Mistral ou DeepSeek) enquanto usa o Claude para planejamento e revisão. Após 10 dias e 254 execuções, eles economizaram 57 milhões de tokens e reduziram custos em 90-100%, mantendo a qualidade do Claude.
Como Funciona
O Vibe-skill é executado dentro do Claude Code. Você digita /vibeon <tarefa>, o Claude decompõe a tarefa e delega a codificação real para um modelo leve (através da ferramenta open-source Vibe). Em seguida, o Claude revisa o diff e corrige falhas. O modelo barato cuida do consumo de tokens; o Claude só gasta tokens com planejamento e revisão.
Resultados por Modelo
| Modelo | Tokens Delegados | Custo Real | Equivalente Claude | Economia |
|---|---|---|---|---|
| DeepSeek V4 Flash | 29M | $4,13 | $92,16 | 95% |
| Mistral Medium 3.5 | 28M | $0 (assinatura Pro) | $84,77 | 100% |
Taxa de sucesso geral: 98% em 254 execuções. Quando a delegação falha, o Claude detecta e corrige a saída.
Economia de Tokens
Os tokens do Mistral são aproximadamente 50% mais baratos que os do Claude; os do DeepSeek são 95% mais baratos. O autor usa uma assinatura Mistral Pro ($18,36/mês) que inclui cerca de 1 bilhão de tokens gratuitos. Para assinantes do Mistral Pro, a delegação custa $0 até a cota ser esgotada, após o que automaticamente volta para o DeepSeek (já que o PAYG do Mistral a $1,52/M tokens é 10× mais caro que o DeepSeek).
O ponto de equilíbrio: o DeepSeek sozinho é mais barato que a assinatura Mistral Pro se você delegar abaixo de 131M tokens/mês ($18,36 / $0,14 por M). Acima desse volume, o Mistral Pro compensa com ~10× mais margem antes de atingir a cota.
Configuração
A skill é open-source em github.com/pcx-wave/vibe-skill. Uma skill similar para Gemini também está disponível, mas é menos configurável e instável. Para usar, clone o repositório e carregue a skill no Claude Code — depois, use /vibeon para sua tarefa.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Memória Persistente para o Claude: Stack Local com MCP, Recuperação de 39ms, Redução de 82% de Tokens
Um desenvolvedor construiu uma camada de memória persistente para Claude usando busca vetorial local (Qdrant + Qwen3) e integração MCP, alcançando redução de 82% em tokens, recuperação em 39ms em caminho quente e cristalização de sessão via nós L4.

Construindo uma Infraestrutura de Conhecimento de IA Persistente com OpenClaw
Um desenvolvedor criou o 'Brain' — um serviço central de conhecimento com RAG local, coordenação multiagente e um sistema de plugins tipados — para resolver o problema de ausência de estado em configurações de IA. O sistema roda inteiramente em hardware local usando Ollama, Postgres, MongoDB, Qdrant e Memgraph.

Gemma 4 26B vs Qwen 3.5 27B: Benchmark de Fluxo de Trabalho Empresarial Local em RTX 4090
Um desenvolvedor testou o Gemma 4 26B e o Qwen 3.5 27B em uma estação de trabalho RTX 4090 para 18 tarefas reais de operador de negócios. O Gemma venceu por 13 a 5, mostrando velocidade mais rápida e melhor disciplina para trabalho de execução diária, enquanto o Qwen se destacou em pensamento estratégico mais amplo.

Semble: Um Servidor MCP Local para Claude Code com Redução de 98% de Tokens
Semble é um servidor MCP de código aberto para Claude Code que substitui fluxos de trabalho com grep+read, usando embeddings, BM25 e reranking para reduzir o uso de tokens em ~98% enquanto indexa repositórios em ~250ms.