Descargar trabajo rutinario de Claude Code a Gemma mediante el servidor MCP offload-mcp

La herramienta offload-mcp es un servidor MCP diseñado para permitir que Claude delegue trabajo rutinario a APIs de modelos gratuitos, utilizando específicamente Gemma a través de la API de Google GenAI. El objetivo es evitar consumir tokens costosos de Claude Code o Codex en tareas pequeñas y superar las limitaciones de rendimiento de ejecutar modelos locales en hardware como un MacBook Air.
Detalles clave
- Gestiona: mensajes de commit, resúmenes de PR, traducciones, docstrings, resúmenes de diffs/archivos fuente y prompts de formato libre.
- Modo libre: enviar casi cualquier prompt rutinario a un modelo más barato en lugar de usar Claude.
- Modo basado en fuente: lee diffs/archivos locales directamente a través del servidor MCP e informa los tokens de entrada primarios estimados ahorrados.
- La cadena de modelos por defecto usa Gemma, pero los IDs de modelo son configurables.
- Repositorio: https://github.com/peterhadorn/offload-mcp
El autor señala que no encontró otra herramienta en GitHub para manejar esto, y la ruta de la API es mucho más práctica para trabajos pequeños que ejecutar localmente.
📖 Lee la fuente completa: r/ClaudeAI
👀 Ver también

Red Queen: Un Orquestrador Determinista que Ejecuta Claude Code como un Pool de Trabajadores
Red Queen utiliza una máquina de estados para orquestar subprocesos de Claude Code, eliminando errores de enrutamiento de LLM y desperdicio de tokens de los mega-prompts.

Beagle SCM: Un Sistema de Gestión de Código Fuente que Almacena Árboles AST
Beagle es un sistema experimental de gestión de código fuente que almacena árboles de sintaxis abstracta en lugar de blobs binarios, utilizando un formato de datos similar a CRDT llamado BASON y respaldando el almacenamiento con bases de datos clave-valor como RocksDB.

Configurar OpenClaw con Alquiler de GPU VAST.AI para Prompts Ilimitados de Ollama
Un usuario describe combinar el alquiler de GPU de VAST.AI con Ollama y OpenClaw para superar los límites de prompts, pero encontró desafíos de configuración que requirieron edición manual de JSON.

Experiencia de Usuario: Cambiar de OpenClaw a Hermes Agent en LLM Local
Un desarrollador informa haber cambiado de OpenClaw a Hermes Agent usando Qwen3.5-9B en una RX 9070 XT con 16 GB de VRAM. Hermes completó una tarea compleja con 5 llamadas a herramientas correctas frente a los 50+ pasos de OpenClaw, ejecutándose 2:30 minutos más rápido mientras mantenía la funcionalidad de RAG, llamadas a herramientas y memoria persistente.