Usar un LLM local como subagente de código de Claude para reducir el uso de contexto

✍️ OpenClawRadar📅 Publicado: 2 de marzo de 2026🔗 Source
Usar un LLM local como subagente de código de Claude para reducir el uso de contexto
Ad

Claude Code puede orquestar tareas delegándolas a un LLM local que se ejecuta en tu máquina, similar a cómo utiliza subagentes de Claude. Este enfoque mantiene el contenido de los archivos fuera del contexto de Claude: solo se devuelven el resumen y las ideas del modelo local.

Cómo Funciona

Un pequeño script de Python (~120 líneas, solo biblioteca estándar) ejecuta un bucle de agente:

  • Pasas a Claude una descripción de la tarea sin contenido de archivo
  • El script la envía al endpoint /v1/chat/completions de LM Studio con definiciones de herramientas read_file y list_dir
  • El modelo local llama a esas herramientas por sí mismo para leer los archivos que necesita
  • El bucle continúa hasta que produce una respuesta final
  • Claude solo ve el resultado

Comando de ejemplo:

python3 agent_lm.py --dir /ruta/al/proyecto "resumir solar-system.html"

Esto resulta en:

  • [turno 1] → read_file({'path': 'solar-system.html'})
  • [turno 2] → Este archivo HTML crea un sistema solar animado interactivo...

El contenido del archivo va al contexto del modelo local (probado con el contexto de Qwen), no al de Claude.

Ad

Casos de Uso y Limitaciones

Basado en pruebas con Qwen3.5 35B 4-bit vía MLX en Apple Silicon, este enfoque es bueno para:

  • Resumen y explicación de código
  • Búsqueda de errores
  • Generación de código repetitivo / primer borrador
  • Transformación y traducción de texto (probado con hebreo)
  • Tareas lógicas y de razonamiento (usa la bandera --think para problemas más difíciles)

No es bueno para:

  • Tareas que requieren el contexto completo de Claude
  • Comprensión de múltiples archivos donde importan las relaciones
  • Tareas que necesitan el historial de conversación actual
  • Cualquier cosa donde la precisión sea crítica

Piensa en ello como un asistente de nivel Haiku, no como un reemplazo de Claude.

Requisitos de Configuración

  • LM Studio ejecutándose localmente con el servidor API habilitado
  • Un script de Python para el bucle del agente, otro para consultas simples solo con prompts
  • Ambos conectados a un ~/.claude/CLAUDE.md global para que Claude Code sepa ofrecer delegación cuando sea relevante
  • No se necesita servidor MCP, dependencias pip ni infraestructura de plugins

Consejo de configuración: Agrega {%- set enable_thinking = false %} al inicio de la plantilla Jinja. Para la mayoría de las tareas, no necesitas que el modelo local razone, y esto ahorra tiempo y tokens mientras aumenta la velocidad sin degradación real en la calidad para tales tareas.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

CAL: Capa de Optimización de Contexto de Código Abierto para Agentes de LLM
Herramientas

CAL: Capa de Optimización de Contexto de Código Abierto para Agentes de LLM

CAL (Context Assembly Layer) es una biblioteca de Python que reduce el uso de tokens de la API de Claude en un 83% mediante la selección y compresión inteligente del contexto. Está disponible a través de pip install y tiene licencia MIT.

OpenClawRadar
Kubeez MCP Server Conecta a Claude con Más de 70 Modelos de IA para Medios
Herramientas

Kubeez MCP Server Conecta a Claude con Más de 70 Modelos de IA para Medios

Kubeez ha lanzado un servidor MCP que conecta Claude con más de 70 modelos de IA para generar imágenes, video, música y voz. El servidor admite autenticación OAuth y proporciona generación asíncrona, donde Claude consulta el estado y devuelve URLs de CDN.

OpenClawRadar
Benchmark Flash-MOE en M5 Max: 12.99 tok/s con Qwen3.5-397B
Herramientas

Benchmark Flash-MOE en M5 Max: 12.99 tok/s con Qwen3.5-397B

Una evaluación comparativa del modelo Qwen3.5 de 397 mil millones de parámetros ejecutándose localmente en un MacBook Pro M5 Max con 128 GB de RAM logró 12.99 tokens por segundo utilizando cuantización de 4 bits y cache-io-split 4, tres veces más rápido que la evaluación original de 48 GB.

OpenClawRadar
OpenClaw Nerve WebUI agrega control por voz y panel de gestión de equipos
Herramientas

OpenClaw Nerve WebUI agrega control por voz y panel de gestión de equipos

Nerve es una interfaz WebUI para OpenClaw que proporciona un panel de control integral para monitorear y gestionar agentes de IA, con control por voz mediante doble toque de la tecla shift para Whisper y capacidades de creación de equipos de subagentes.

OpenClawRadar