Usar un LLM local como subagente de código de Claude para reducir el uso de contexto

Un desarrollador en r/LocalLLaMA demuestra cómo usar Claude Code para delegar tareas a un LLM local que se ejecuta mediante LM Studio, reduciendo el uso del contexto de Claude al mantener el contenido de los archivos localmente.
Cómo funciona
El sistema utiliza un pequeño script de Python (~120 líneas, solo biblioteca estándar) que ejecuta un bucle de agente:
- Le pasas a Claude una descripción de la tarea sin el contenido del archivo
- El script lo envía al endpoint
/v1/chat/completionsde LM Studio con definiciones de herramientasread_fileylist_dir - El modelo local llama a esas herramientas por sí mismo para leer los archivos que necesita
- El bucle continúa hasta que produce una respuesta final
- Claude solo ve el resultado, no el contenido del archivo
Ejemplo de uso
python3 agent_lm.py --dir /ruta/al/proyecto "resumir solar-system.html"
# [turno 1] → read_file({'path': 'solar-system.html'})
# [turno 2] → Este archivo HTML crea un sistema solar animado interactivo...
El contenido del archivo va al contexto del modelo local (probado con Qwen3.5 35B 4-bit mediante MLX en Apple Silicon), no al de Claude.
Para qué sirve
- Resumen y explicación de código
- Búsqueda de errores
- Generación de plantillas / primeros borradores
- Transformación y traducción de texto (probado con hebreo)
- Tareas de lógica y razonamiento (usa la bandera
--thinkpara problemas más difíciles)
Para qué no sirve
- Tareas que requieren el contexto completo de Claude, como la comprensión de múltiples archivos donde importan las relaciones
- Tareas que necesitan el historial de conversación actual
- Cualquier cosa donde la precisión sea crítica
El autor lo describe como "un asistente de nivel Haiku, no un reemplazo".
Configuración
- LM Studio ejecutándose localmente con el servidor API habilitado
- Un script de Python para el bucle del agente, otro para consultas simples solo de prompt
- Ambos conectados a un
~/.claude/CLAUDE.mdglobal para que Claude Code sepa ofrecer delegación cuando sea relevante - No se necesita servidor MCP, dependencias de pip ni infraestructura de plugins
- Recomendación: Agregar
{%- set enable_thinking = false %}al inicio de la plantilla jinja - para la mayoría de las tareas esto ahorra tiempo y tokens sin degradar la calidad
El autor señala que hizo que Claude ayudara a escribir la publicación pero con supervisión y correcciones, y está feliz de compartir los scripts si hay interés.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

OpenHelm: Una Aplicación para macOS que Automatiza Tareas de Código con Claude
OpenHelm es una aplicación gratuita y local para macOS que automatiza tareas repetitivas de codificación con Claude ejecutando trabajos en un horario, reintentando automáticamente los fallos y dividiendo el trabajo en fragmentos para evitar los límites de sesión. Utiliza tu suscripción existente a Claude para las llamadas al LLM.

Servidor MCP Blip: Dibuja Cambios en la Interfaz de Usuario para el Código de Claude en Lugar de Describirlos
Blip es un servidor MCP para Claude Code que reemplaza las descripciones verbales de cambios en la interfaz de usuario con anotaciones visuales. Dibujas directamente en tu aplicación en ejecución, y Claude escribe el código correspondiente basado en la captura de pantalla anotada.

Opendesk: algoritmo MCP + SOM para control de escritorio de IA mediante Claude Code
Opendesk le da a los agentes de IA ojos y manos en tu escritorio mediante un servidor MCP con un algoritmo SOM personalizado. Se integra con Claude Code o cualquier arnés de agente para control de ratón/teclado, aprendizaje, repetición y programación.

Cinco complementos de OpenClaw que abordan problemas centrales de producción.
Un usuario de Reddit identifica cinco complementos de OpenClaw que resuelven problemas comunes de producción: Manifest para enrutamiento de modelos, Composio para gestión de integraciones, Hyperspell para memoria, Foundry para automatización de flujos de trabajo y Opik para trazabilidad.