Reduza Custos do Claude em 60x Transferindo Tarefas Mecânicas para o DeepSeek V4 Flash via MCP

✍️ OpenClawRadar📅 Publicado: May 4, 2026🔗 Source
Reduza Custos do Claude em 60x Transferindo Tarefas Mecânicas para o DeepSeek V4 Flash via MCP
Ad

Um usuário do Reddit analisou seu uso do Claude e descobriu que a maior parte era gasta em tarefas mecânicas: classificar arquivos, reformatar JSON, extrair campos de texto e resumir documentos que ele já folhearia. Nada disso precisava do Sonnet. A solução: um modelo pequeno e barato rodando como trabalhador auxiliar via MCP, além de uma única regra no CLAUDE.md instruindo o Claude a não realizar essas tarefas.

Configuração: uma ferramenta MCP + lista de negação no CLAUDE.md

A configuração usa uma única ferramenta MCP que envia texto e recebe texto de volta. O modelo padrão é o DeepSeek V4 Flash (barato, 1M de contexto). O endpoint é uma única linha de configuração e funciona com qualquer provedor compatível com OpenAI (ollama local, vllm, lm studio). O repositório é github.com/arizen-dev/deepseek-mcp (MIT, Python 3.10+).

A peça crítica: a regra no CLAUDE.md usa enquadramento negativo — uma lista de negação, não uma lista de permissões. O usuário relata que o enquadramento positivo ("use DeepSeek para X") era ignorado cerca de 30% das vezes. A abordagem de lista de negação funciona de forma confiável.

# No CLAUDE.md:
# NÃO use o Claude para:
# - formatação JSON
# - extração de campos
# - classificação de arquivos
# - sumarização que você revisará de qualquer forma
Ad

Resultados: redução de 60x nos custos

Ao longo de 3 semanas de uso real: 217 chamadas mecânicas transferidas para o DeepSeek V4 Flash, gasto total de $0,41. A mesma carga de trabalho no Sonnet teria custado aproximadamente $7. Isso é um multiplicador de ~17x apenas nessas tarefas, e o usuário afirma que a conta total caiu 60x quando consideradas tarefas mais pesadas ainda no Sonnet.

Como o trabalhador auxiliar opera

O trabalhador auxiliar é uma ferramenta supervisionada, não um agente — sem chamadas de ferramenta, sem acesso a arquivos, sem cadeias. A latência é de 3 a 25 segundos. Você revisa a saída. O formato geral é: enviar texto, receber texto de volta, revisar, seguir em frente.

Para quem é

Desenvolvedores que usam a API do Claude ou o Claude Code e querem reduzir gastos com tarefas mecânicas de alto volume sem perder a capacidade de raciocínio do Sonnet para trabalhos complexos.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Construindo um Sistema de Glossário Personalizado em Hindi com Claude: De 76% a 92% de Precisão em 10 Meses
Guides

Construindo um Sistema de Glossário Personalizado em Hindi com Claude: De 76% a 92% de Precisão em 10 Meses

Um desenvolvedor solo em Bangalore construiu um sistema de glossário personalizado para Claude, melhorando a precisão do vocabulário de domínio em Hindi de 76% para 92%. Termos baseados em exemplos com frases de contexto funcionaram melhor.

OpenClawRadar
Método para Transferir o Contexto do Usuário do ChatGPT para o Claude
Guides

Método para Transferir o Contexto do Usuário do ChatGPT para o Claude

Um usuário do Reddit compartilha um método de dois prompts para extrair um perfil cognitivo detalhado do ChatGPT e criar uma constituição de IA portátil para transferir para o Claude, abordando a dificuldade de migração entre sistemas de IA.

OpenClawRadar
Método de Codificação de IA com Rédea Curta: Vença a Fábula Mantendo o Controle
Guides

Método de Codificação de IA com Rédea Curta: Vença a Fábula Mantendo o Controle

O método de coleira curta de Greg Slepak para agentes de IA de código: planejar, revisar cada diff, negar mudanças ruins, commit após subtarefas. Supera a qualidade do Fable mantendo o desenvolvedor no loop.

OpenClawRadar
Como Pequenos Modelos de Avaliação de Prompts Podem Enganar e Como Corrigi-los
Guides

Como Pequenos Modelos de Avaliação de Prompts Podem Enganar e Como Corrigi-los

Uma postagem no Reddit explica que prompts de avaliação para modelos pequenos frequentemente produzem resultados enganosos devido à ativação de vias cognitivas incorretas nos transformadores, especificamente identificando três modos distintos: recuperação factual, aplicação/seguimento de instruções e inferência emocional/empática.

OpenClawRadar