Dándole a Claude un LLM local como asistente mediante MCP en Mac

Un usuario de Reddit detalló cómo le dio a Claude acceso a un LLM local ejecutándose en un Mac Mini M4 (24 GB de RAM) a través de una conexión MCP con Ollama. La configuración usa Ollama sirviendo Qwen 2.5 Coder (14B) como un asistente llamado 'Frank', al que Claude puede delegar tareas bajo reglas específicas: debe usar menos tokens que el propio Claude, no debe afectar la calidad y requiere una revisión final.
Detalles de la configuración
- Hardware: Mac Mini M4 con 24 GB de RAM.
- LLM local: Qwen 2.5 Coder (14B) ejecutándose mediante Ollama (también probado con LM Studio).
- Conexión: MCP (Protocolo de Contexto del Modelo) para vincular Claude (CLI o aplicación de escritorio) con el modelo local.
- Instrucciones: A Claude se le dio un archivo Markdown de memoria (
memory.md) con pautas sobre cuándo y cómo usar Frank — por ejemplo, delegar procesamiento de texto, manejo de archivos grandes CSS/HTML, y usarlo solo cuando ahorre tokens sin degradar la calidad de salida.
Casos de uso prácticos
- Procesamiento y transformación de texto — delegado a Frank para reducir el uso de tokens de Claude.
- Manejo de archivos grandes CSS/HTML que serían costosos para que Claude los procesara directamente.
- Ejecución de pruebas de rendimiento, codificación y lógica — Claude evaluó modelos locales a través de Frank en lugar de hacerlo manualmente.
El usuario señaló que está operando al límite de su RAM/GPU y no puede probar modelos más grandes (30B+). Invitó a otros con hardware más potente a probar configuraciones similares y compartir resultados.
Este enfoque crea efectivamente un asistente sin costo para Claude, delegando tareas pesadas en tokens mientras mantiene la calidad mediante la revisión final de Claude.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

AgentPeek: Panel de control de código abierto para monitorear equipos de agentes Claude Code.
AgentPeek es un panel de control local que se conecta a Claude Code para proporcionar visibilidad sobre los equipos de agentes, mostrando jerarquías de orquestación, trazas de ejecución, costos de tokens y operaciones de archivos. La instalación requiere clonar el repositorio de GitHub y ejecutar pipx install.

Gráfico en Cascada: Mapa Interactivo de las Restricciones Energéticas y los Puntos Críticos de Suministro de la IA
El Cascade Graph es un grafo de conocimiento dirigido de la economía física, que mapea 405 nodos (impulsores, cuellos de botella, geografías, tickers) conectados por 597 aristas con fuentes para rastrear cómo la presión estructural se transmite desde las limitaciones de energía y física hasta los activos invertibles.

Logira: Auditoría en Tiempo de Ejecución eBPF para Ejecuciones de Agentes de IA
Logira es una herramienta de línea de comandos (CLI) para Linux de solo observación que registra eventos de ejecución, archivos y red mediante eBPF durante la ejecución de agentes de IA, con almacenamiento local por ejecución en JSONL y SQLite y reglas de detección integradas para acceso a credenciales, cambios de persistencia y patrones sospechosos.

Claude Session Tracker: Guardar automáticamente sesiones de código de Claude en Issues de GitHub
Una nueva herramienta llamada claude-session-tracker guarda automáticamente las sesiones de Claude Code en GitHub Issues, registrando cada solicitud y respuesta como comentarios con marcas de tiempo. Crea un Issue de GitHub por sesión vinculado a un tablero de Projects y funciona a través del sistema de hooks nativo de Claude Code sin consumir tokens de contexto.