Tu agente no es el modelo: Harness vs Servicio de inferencia explicados
La gente suele hablar de Claude como si fuera una entidad única, pero un agente de IA es una pila de tres capas distintas. Conocer la diferencia te ahorra horas de depuración: cuando algo sale mal, necesitas saber si culpar al modelo, al servicio o a la lógica que lo rodea.
Las Tres Capas
- Modelo — la función matemática que transforma tokens de entrada en tokens de salida. Ejemplos: Sonnet, Opus, Gemini.
- Servicio de inferencia — el servicio alojado que ejecuta el modelo y rastrea el uso. Ejemplos: AWS Bedrock, API de Anthropic.
- Harness — la lógica que da forma a las entradas, interpreta las salidas y toca el mundo exterior. Esto incluye MCP y Skills — el modelo no los conoce de forma inherente.
En conjunto, un sistema de agente es un harness que llama a un servicio de inferencia, el cual ejecuta un modelo. Eso es todo.
Desglose en el Mundo Real
| Sistema de Agente | Harness | Servicio de Inferencia | Modelo |
|---|---|---|---|
| Claude Desktop | UI + MCP + lógica local | Servicio de inferencia de Anthropic | Sonnet / Opus / Haiku |
| Claude CLI | Parsing de herramientas + E/S de archivos | Servicio de inferencia de Anthropic | Sonnet / Opus / Haiku |
| Cursor | Ensamblaje de contexto + enrutamiento de herramientas | Capa de inferencia de Cursor | Sonnet / GPT / Gemini |
| Agente LangChain personalizado | Plantillas de prompt + definiciones de herramientas | Bedrock, OpenAI, etc. | El modelo que elijas |
El mismo modelo (por ejemplo, Sonnet) puede comportarse de manera diferente dependiendo del harness — porque el harness da forma a las entradas e interpreta las salidas. Por eso tus prompts funcionan en Claude CLI pero no en Cursor.
Depura con Este Modelo Mental
- ¿Respuestas malas? Mira el harness — quizás no está proporcionando suficiente contexto.
- ¿Demasiado lento o caro? Revisa el servicio de inferencia — el precio y el rendimiento viven ahí.
- ¿Salida inesperada? ¿El modelo está equivocado, o el harness le está dando basura?
El artículo también señala que a medida que los modelos se vuelven más inteligentes, parte de la lógica del harness (como MCP o Skills) podría volverse obsoleta — así que la forma en que construimos harnesses ahora puede no envejecer bien.
La próxima vez que digas "mi modelo hizo X", detente y pregunta: ¿fue el modelo, o fue el harness orquestándolo?
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Actualización de OpenClaw Fix: Resolviendo errores de "allowlist miss" en la ejecución de Telegram
Una actualización reciente de OpenClaw provocó que los comandos exec de Telegram fallaran con errores 'exec denied: allowlist miss' incluso después de deshabilitar las aprobaciones. La solución requiere habilitar acceso elevado, configurar explícitamente la seguridad de exec y actualizar tanto los archivos openclaw.json como exec-approvals.json.

Configuración Rentable de Multi-Agente OpenClaw Utilizando Modelos de Suscripción
Un usuario de Reddit describe cómo enrutar todas las operaciones de múltiples agentes de OpenClaw a través de suscripciones existentes de $200 a Anthropic Pro Max y $200 a ChatGPT OpenAI Codex, en lugar de usar llamadas directas a la API, utilizando modelos más económicos de Anthropic para agentes simples y modelos más complejos para otros.

Ejecutando Qwen3.6-35B-A3B con ~190k de contexto en 8GB de VRAM + 32GB de RAM – Configuración y benchmarks
Un usuario de Reddit comparte una configuración funcional de llama.cpp para modelos Qwen3.6-35B-A3B GGUF en una RTX 4060 (8 GB de VRAM) + 32 GB DDR5, alcanzando 37-51 tok/s en contexto de 192k usando TurboQuant y banderas específicas.

Guía Visual del Ciclo de Vida de los 27 Hooks de Claude Code
Un recurso creado por la comunidad proporciona un recorrido visual y auditivo de los 27 ganchos de Claude Code, mostrando cuándo se activa cada uno, su orden y qué datos reciben. El proyecto fue construido completamente utilizando el propio Claude Code.