Usando um LLM Local como Subagente de Código do Claude para Reduzir o Uso de Contexto

Um desenvolvedor no r/LocalLLaMA demonstra como usar o Claude Code para delegar tarefas a um LLM local rodando via LM Studio, reduzindo o uso de contexto do Claude mantendo o conteúdo dos arquivos local.
Como Funciona
O sistema usa um pequeno script Python (~120 linhas, apenas biblioteca padrão) que executa um loop de agente:
- Você passa para o Claude uma descrição da tarefa sem o conteúdo do arquivo
- O script envia para o endpoint
/v1/chat/completionsdo LM Studio com definições de ferramentasread_fileelist_dir - O modelo local chama essas ferramentas ele mesmo para ler os arquivos que precisa
- O loop continua até produzir uma resposta final
- O Claude vê apenas o resultado, não o conteúdo do arquivo
Exemplo de Uso
python3 agent_lm.py --dir /caminho/para/projeto "resuma solar-system.html"
# [turno 1] → read_file({'path': 'solar-system.html'})
# [turno 2] → Este arquivo HTML cria um sistema solar animado interativo...
O conteúdo do arquivo vai para o contexto do modelo local (testado com Qwen3.5 35B 4-bit via MLX no Apple Silicon), não para o do Claude.
Para que Serve
- Resumo e explicação de código
- Encontrar bugs
- Geração de boilerplate / primeiro rascunho
- Transformação e tradução de texto (testado com hebraico)
- Tarefas de lógica e raciocínio (use a flag
--thinkpara problemas mais difíceis)
Para que Não Serve
- Tarefas que exigem o contexto completo do Claude, como compreensão de múltiplos arquivos onde relacionamentos importam
- Tarefas que precisam do histórico atual da conversa
- Qualquer coisa onde a precisão seja crítica
O autor descreve como "um assistente de nível Haiku, não um substituto".
Configuração
- LM Studio rodando localmente com o servidor API habilitado
- Um script Python para o loop do agente, um para consultas simples apenas com prompt
- Ambos conectados a um
~/.claude/CLAUDE.mdglobal para que o Claude Code saiba oferecer delegação quando relevante - Sem servidor MCP, sem dependências pip, sem infraestrutura de plugin necessária
- Recomendação: Adicione
{%- set enable_thinking = false %}ao topo do template jinja - para a maioria das tarefas isso economiza tempo e tokens sem degradação de qualidade
O autor observa que teve ajuda do Claude para escrever o post, mas com supervisão e correções, e fica feliz em compartilhar os scripts se houver interesse.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Ferramenta de Código Aberto Mede a Autonomia de Agentes de IA com Análise de Dados Locais
Codelens-AI é uma ferramenta CLI de código aberto que analisa arquivos de sessão do Claude Code junto com o histórico do git para calcular métricas de autonomia como Proporção de Piloto Automático e Pontuação de Autocorreção. A ferramenta é executada localmente sem configuração usando npx claude-roi e mantém todos os dados na sua máquina.

Modelo Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2 Lançado com Configuração LM Studio
Um modelo não censurado combinado, que une a arquitetura Qwen3.5-9B com dados de treinamento do Claude 4.6 Opus, está agora disponível, com configurações específicas do LM Studio 0.4.7 fornecidas para desempenho ideal, incluindo temperatura 0.7 e amostragem top K 20.

Plugin de Memória do Agente OpenClaw: Contexto Persistente Entre Sessões
Um desenvolvedor criou um plugin de memória para o OpenClaw que injeta contexto relevante de conversas passadas antes de cada turno e armazena novos fatos e eventos após cada turno, resolvendo o problema de agentes esquecerem tudo entre sessões.

Técnica de Double-Buffering para Janelas de Contexto de LLM Elimina a Compactação "Stop-the-World"
Uma técnica chamada de double-buffering pode impedir que agentes de LLM congelem durante a compactação da janela de contexto, resumindo antecipadamente e mantendo dois buffers, permitindo uma transição perfeita sem custo adicional de inferência.