Usar un LLM local como subagente de código de Claude para reducir el uso de contexto

Claude Code puede orquestar tareas delegándolas a un LLM local que se ejecuta en tu máquina, similar a cómo utiliza subagentes de Claude. Este enfoque mantiene el contenido de los archivos fuera del contexto de Claude: solo se devuelven el resumen y las ideas del modelo local.
Cómo Funciona
Un pequeño script de Python (~120 líneas, solo biblioteca estándar) ejecuta un bucle de agente:
- Pasas a Claude una descripción de la tarea sin contenido de archivo
- El script la envía al endpoint
/v1/chat/completionsde LM Studio con definiciones de herramientasread_fileylist_dir - El modelo local llama a esas herramientas por sí mismo para leer los archivos que necesita
- El bucle continúa hasta que produce una respuesta final
- Claude solo ve el resultado
Comando de ejemplo:
python3 agent_lm.py --dir /ruta/al/proyecto "resumir solar-system.html"
Esto resulta en:
- [turno 1] →
read_file({'path': 'solar-system.html'}) - [turno 2] → Este archivo HTML crea un sistema solar animado interactivo...
El contenido del archivo va al contexto del modelo local (probado con el contexto de Qwen), no al de Claude.
Casos de Uso y Limitaciones
Basado en pruebas con Qwen3.5 35B 4-bit vía MLX en Apple Silicon, este enfoque es bueno para:
- Resumen y explicación de código
- Búsqueda de errores
- Generación de código repetitivo / primer borrador
- Transformación y traducción de texto (probado con hebreo)
- Tareas lógicas y de razonamiento (usa la bandera
--thinkpara problemas más difíciles)
No es bueno para:
- Tareas que requieren el contexto completo de Claude
- Comprensión de múltiples archivos donde importan las relaciones
- Tareas que necesitan el historial de conversación actual
- Cualquier cosa donde la precisión sea crítica
Piensa en ello como un asistente de nivel Haiku, no como un reemplazo de Claude.
Requisitos de Configuración
- LM Studio ejecutándose localmente con el servidor API habilitado
- Un script de Python para el bucle del agente, otro para consultas simples solo con prompts
- Ambos conectados a un
~/.claude/CLAUDE.mdglobal para que Claude Code sepa ofrecer delegación cuando sea relevante - No se necesita servidor MCP, dependencias pip ni infraestructura de plugins
Consejo de configuración: Agrega {%- set enable_thinking = false %} al inicio de la plantilla Jinja. Para la mayoría de las tareas, no necesitas que el modelo local razone, y esto ahorra tiempo y tokens mientras aumenta la velocidad sin degradación real en la calidad para tales tareas.
📖 Read the full source: r/ClaudeAI
👀 Ver también

CAL: Capa de Optimización de Contexto de Código Abierto para Agentes de LLM
CAL (Context Assembly Layer) es una biblioteca de Python que reduce el uso de tokens de la API de Claude en un 83% mediante la selección y compresión inteligente del contexto. Está disponible a través de pip install y tiene licencia MIT.

Kubeez MCP Server Conecta a Claude con Más de 70 Modelos de IA para Medios
Kubeez ha lanzado un servidor MCP que conecta Claude con más de 70 modelos de IA para generar imágenes, video, música y voz. El servidor admite autenticación OAuth y proporciona generación asíncrona, donde Claude consulta el estado y devuelve URLs de CDN.

Benchmark Flash-MOE en M5 Max: 12.99 tok/s con Qwen3.5-397B
Una evaluación comparativa del modelo Qwen3.5 de 397 mil millones de parámetros ejecutándose localmente en un MacBook Pro M5 Max con 128 GB de RAM logró 12.99 tokens por segundo utilizando cuantización de 4 bits y cache-io-split 4, tres veces más rápido que la evaluación original de 48 GB.

OpenClaw Nerve WebUI agrega control por voz y panel de gestión de equipos
Nerve es una interfaz WebUI para OpenClaw que proporciona un panel de control integral para monitorear y gestionar agentes de IA, con control por voz mediante doble toque de la tecla shift para Whisper y capacidades de creación de equipos de subagentes.