Usando um LLM Local como Subagente de Código do Claude para Reduzir o Uso de Contexto

O Claude Code pode orquestrar tarefas delegando para um LLM local executado em sua máquina, semelhante a como usa subagentes do Claude. Essa abordagem mantém o conteúdo dos arquivos fora do contexto do Claude—apenas o resumo e as percepções do modelo local são repassados.
Como Funciona
Um pequeno script Python (~120 linhas, apenas biblioteca padrão) executa um loop de agente:
- Você passa ao Claude uma descrição da tarefa sem o conteúdo do arquivo
- O script a envia para o endpoint
/v1/chat/completionsdo LM Studio com definições de ferramentasread_fileelist_dir - O modelo local chama essas ferramentas para ler os arquivos de que precisa
- O loop continua até produzir uma resposta final
- O Claude vê apenas o resultado
Exemplo de comando:
python3 agent_lm.py --dir /caminho/para/projeto "resumir solar-system.html"
Isso resulta em:
- [turno 1] →
read_file({'path': 'solar-system.html'}) - [turno 2] → Este arquivo HTML cria um sistema solar animado interativo...
O conteúdo do arquivo vai para o contexto do modelo local (testado com o contexto do Qwen), não do Claude.
Casos de Uso e Limitações
Com base em testes com Qwen3.5 35B 4-bit via MLX no Apple Silicon, essa abordagem é boa para:
- Resumo e explicação de código
- Encontrar bugs
- Geração de boilerplate / primeiro rascunho
- Transformação e tradução de texto (testado com hebraico)
- Tarefas de lógica e raciocínio (use a flag
--thinkpara problemas mais difíceis)
Não é bom para:
- Tarefas que exigem o contexto completo do Claude
- Compreensão de múltiplos arquivos onde relacionamentos importam
- Tarefas que precisam do histórico atual da conversa
- Qualquer coisa onde a precisão seja crítica
Pense nisso como um assistente de nível Haiku, não como um substituto para o Claude.
Requisitos de Configuração
- LM Studio executando localmente com o servidor de API habilitado
- Um script Python para o loop do agente, outro para consultas simples apenas com prompt
- Ambos conectados a um
~/.claude/CLAUDE.mdglobal para que o Claude Code saiba oferecer delegação quando relevante - Nenhum servidor MCP, nenhuma dependência pip, nenhuma infraestrutura de plugin necessária
Dica de configuração: Adicione {%- set enable_thinking = false %} ao topo do template Jinja. Para a maioria das tarefas, você não precisa que o modelo local raciocine, e isso economiza tempo e tokens enquanto aumenta a velocidade sem degradação real na qualidade para tais tarefas.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Motor de Contexto Agente: Loop de Melhoria Automatizada de Agentes com Ganho de Precisão de 34,2%
Uma ferramenta de código aberto automatiza todo o ciclo de melhoria de agentes, desde a análise de rastreamento até a implementação de correções, alcançando uma melhoria de 34,2% na precisão no Tau-2 Bench em uma única iteração. O sistema utiliza o Claude Code em um ambiente REPL para analisar falhas e decidir entre correções de prompt ou de código.

Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça
Freddy é um servidor MCP pessoal que conecta wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, além de WHOOP, Strava, Dexcom em beta) a clientes de IA como Claude Code, ChatGPT e Notion AI via OAuth. O novo login sem interface permite fluxos de trabalho agendados para agentes autônomos.

Arquitetura de Compilador Determinístico para Fluxos de Trabalho de LLM Multi-Etapas Apresenta Fortes Resultados em Benchmarks
Uma arquitetura de compilação determinística para fluxos de trabalho estruturados de LLM utiliza registros de nós tipados, contratos de parâmetros e validação estática para compilar grafos de fluxo de trabalho antecipadamente. Os benchmarks mostram que ela supera o GPT-4.1 e o Claude Sonnet 4.6 em profundidades de fluxo de trabalho de 3 a 12+ nós.

Construindo um Agente de Codificação para Contexto de 8k: Divisão Planejador/Executor, Orçamento de Tokens e Execução Paralela
Uma análise detalhada da construção de um agente de codificação CLI projetado em torno de limites de 8 mil tokens, usando uma arquitetura de planejador/executor, orçamento de tokens rigoroso e execução paralela de tarefas.