Usando um LLM Local como Subagente de Código do Claude para Reduzir o Uso de Contexto

O Claude Code pode orquestrar tarefas delegando para um LLM local executado em sua máquina, semelhante a como usa subagentes do Claude. Essa abordagem mantém o conteúdo dos arquivos fora do contexto do Claude—apenas o resumo e as percepções do modelo local são repassados.
Como Funciona
Um pequeno script Python (~120 linhas, apenas biblioteca padrão) executa um loop de agente:
- Você passa ao Claude uma descrição da tarefa sem o conteúdo do arquivo
- O script a envia para o endpoint
/v1/chat/completionsdo LM Studio com definições de ferramentasread_fileelist_dir - O modelo local chama essas ferramentas para ler os arquivos de que precisa
- O loop continua até produzir uma resposta final
- O Claude vê apenas o resultado
Exemplo de comando:
python3 agent_lm.py --dir /caminho/para/projeto "resumir solar-system.html"
Isso resulta em:
- [turno 1] →
read_file({'path': 'solar-system.html'}) - [turno 2] → Este arquivo HTML cria um sistema solar animado interativo...
O conteúdo do arquivo vai para o contexto do modelo local (testado com o contexto do Qwen), não do Claude.
Casos de Uso e Limitações
Com base em testes com Qwen3.5 35B 4-bit via MLX no Apple Silicon, essa abordagem é boa para:
- Resumo e explicação de código
- Encontrar bugs
- Geração de boilerplate / primeiro rascunho
- Transformação e tradução de texto (testado com hebraico)
- Tarefas de lógica e raciocínio (use a flag
--thinkpara problemas mais difíceis)
Não é bom para:
- Tarefas que exigem o contexto completo do Claude
- Compreensão de múltiplos arquivos onde relacionamentos importam
- Tarefas que precisam do histórico atual da conversa
- Qualquer coisa onde a precisão seja crítica
Pense nisso como um assistente de nível Haiku, não como um substituto para o Claude.
Requisitos de Configuração
- LM Studio executando localmente com o servidor de API habilitado
- Um script Python para o loop do agente, outro para consultas simples apenas com prompt
- Ambos conectados a um
~/.claude/CLAUDE.mdglobal para que o Claude Code saiba oferecer delegação quando relevante - Nenhum servidor MCP, nenhuma dependência pip, nenhuma infraestrutura de plugin necessária
Dica de configuração: Adicione {%- set enable_thinking = false %} ao topo do template Jinja. Para a maioria das tarefas, você não precisa que o modelo local raciocine, e isso economiza tempo e tokens enquanto aumenta a velocidade sem degradação real na qualidade para tais tarefas.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Implementação do Agente Local OpenClaw com Cache TurboQuant para Hardware de Médio Porte
Um aplicativo de um clique para o OpenClaw com modelos locais agora roda em dispositivos de médio porte como o MacBook Air com 16GB de RAM usando cache TurboQuant e aquecimento de contexto. A implementação corrige o llama.cpp para chamadas de ferramentas confiáveis e alcança 10-15 tokens por segundo com o Gemma 4 e QWEN 3.5.

Nakkas MCP Server Gera SVGs Animados a partir de Descrições de IA
Nakkas é um servidor MCP onde a IA constrói configurações completas de SVG animado a partir de descrições, renderizando SVGs animados limpos com formas, gradientes, animações e filtros. Ele suporta curvas paramétricas, 15 predefinições de filtro, animações CSS @keyframes e SMIL, e funciona em qualquer lugar onde SVG seja renderizado.

Módulo: Orquestração de conhecimento entre repositórios para agentes de IA de codificação
Modulus é um aplicativo de desktop que executa múltiplos agentes de programação de IA com memória de projeto compartilhada entre repositórios. Ele resolve problemas de contexto entre repositórios permitindo que os agentes compreendam dependências entre diferentes bases de código sem explicação manual.

civStation: Um Sistema VLM para Jogar Civilization VI por Comandos de Linguagem Natural
civStation é um sistema VLM de uso computacional que joga Civilization VI traduzindo comandos de linguagem natural de alto nível em ações dentro do jogo. O sistema utiliza uma arquitetura de 3 camadas que separa estratégia e execução, com suporte para intervenção humana em tempo real.