Usando um LLM Local como Subagente de Código do Claude para Reduzir o Uso de Contexto

✍️ OpenClawRadar📅 Publicado: March 2, 2026🔗 Source
Usando um LLM Local como Subagente de Código do Claude para Reduzir o Uso de Contexto
Ad

O Claude Code pode orquestrar tarefas delegando para um LLM local executado em sua máquina, semelhante a como usa subagentes do Claude. Essa abordagem mantém o conteúdo dos arquivos fora do contexto do Claude—apenas o resumo e as percepções do modelo local são repassados.

Como Funciona

Um pequeno script Python (~120 linhas, apenas biblioteca padrão) executa um loop de agente:

  • Você passa ao Claude uma descrição da tarefa sem o conteúdo do arquivo
  • O script a envia para o endpoint /v1/chat/completions do LM Studio com definições de ferramentas read_file e list_dir
  • O modelo local chama essas ferramentas para ler os arquivos de que precisa
  • O loop continua até produzir uma resposta final
  • O Claude vê apenas o resultado

Exemplo de comando:

python3 agent_lm.py --dir /caminho/para/projeto "resumir solar-system.html"

Isso resulta em:

  • [turno 1] → read_file({'path': 'solar-system.html'})
  • [turno 2] → Este arquivo HTML cria um sistema solar animado interativo...

O conteúdo do arquivo vai para o contexto do modelo local (testado com o contexto do Qwen), não do Claude.

Ad

Casos de Uso e Limitações

Com base em testes com Qwen3.5 35B 4-bit via MLX no Apple Silicon, essa abordagem é boa para:

  • Resumo e explicação de código
  • Encontrar bugs
  • Geração de boilerplate / primeiro rascunho
  • Transformação e tradução de texto (testado com hebraico)
  • Tarefas de lógica e raciocínio (use a flag --think para problemas mais difíceis)

Não é bom para:

  • Tarefas que exigem o contexto completo do Claude
  • Compreensão de múltiplos arquivos onde relacionamentos importam
  • Tarefas que precisam do histórico atual da conversa
  • Qualquer coisa onde a precisão seja crítica

Pense nisso como um assistente de nível Haiku, não como um substituto para o Claude.

Requisitos de Configuração

  • LM Studio executando localmente com o servidor de API habilitado
  • Um script Python para o loop do agente, outro para consultas simples apenas com prompt
  • Ambos conectados a um ~/.claude/CLAUDE.md global para que o Claude Code saiba oferecer delegação quando relevante
  • Nenhum servidor MCP, nenhuma dependência pip, nenhuma infraestrutura de plugin necessária

Dica de configuração: Adicione {%- set enable_thinking = false %} ao topo do template Jinja. Para a maioria das tarefas, você não precisa que o modelo local raciocine, e isso economiza tempo e tokens enquanto aumenta a velocidade sem degradação real na qualidade para tais tarefas.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Motor de Contexto Agente: Loop de Melhoria Automatizada de Agentes com Ganho de Precisão de 34,2%
Tools

Motor de Contexto Agente: Loop de Melhoria Automatizada de Agentes com Ganho de Precisão de 34,2%

Uma ferramenta de código aberto automatiza todo o ciclo de melhoria de agentes, desde a análise de rastreamento até a implementação de correções, alcançando uma melhoria de 34,2% na precisão no Tau-2 Bench em uma única iteração. O sistema utiliza o Claude Code em um ambiente REPL para analisar falhas e decidir entre correções de prompt ou de código.

OpenClawRadar
Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça
Tools

Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça

Freddy é um servidor MCP pessoal que conecta wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, além de WHOOP, Strava, Dexcom em beta) a clientes de IA como Claude Code, ChatGPT e Notion AI via OAuth. O novo login sem interface permite fluxos de trabalho agendados para agentes autônomos.

OpenClawRadar
Arquitetura de Compilador Determinístico para Fluxos de Trabalho de LLM Multi-Etapas Apresenta Fortes Resultados em Benchmarks
Tools

Arquitetura de Compilador Determinístico para Fluxos de Trabalho de LLM Multi-Etapas Apresenta Fortes Resultados em Benchmarks

Uma arquitetura de compilação determinística para fluxos de trabalho estruturados de LLM utiliza registros de nós tipados, contratos de parâmetros e validação estática para compilar grafos de fluxo de trabalho antecipadamente. Os benchmarks mostram que ela supera o GPT-4.1 e o Claude Sonnet 4.6 em profundidades de fluxo de trabalho de 3 a 12+ nós.

OpenClawRadar
Construindo um Agente de Codificação para Contexto de 8k: Divisão Planejador/Executor, Orçamento de Tokens e Execução Paralela
Tools

Construindo um Agente de Codificação para Contexto de 8k: Divisão Planejador/Executor, Orçamento de Tokens e Execução Paralela

Uma análise detalhada da construção de um agente de codificação CLI projetado em torno de limites de 8 mil tokens, usando uma arquitetura de planejador/executor, orçamento de tokens rigoroso e execução paralela de tarefas.

OpenClawRadar