Tu agente no es el modelo: Harness vs Servicio de inferencia explicados
La gente suele hablar de Claude como si fuera una entidad única, pero un agente de IA es una pila de tres capas distintas. Conocer la diferencia te ahorra horas de depuración: cuando algo sale mal, necesitas saber si culpar al modelo, al servicio o a la lógica que lo rodea.
Las Tres Capas
- Modelo — la función matemática que transforma tokens de entrada en tokens de salida. Ejemplos: Sonnet, Opus, Gemini.
- Servicio de inferencia — el servicio alojado que ejecuta el modelo y rastrea el uso. Ejemplos: AWS Bedrock, API de Anthropic.
- Harness — la lógica que da forma a las entradas, interpreta las salidas y toca el mundo exterior. Esto incluye MCP y Skills — el modelo no los conoce de forma inherente.
En conjunto, un sistema de agente es un harness que llama a un servicio de inferencia, el cual ejecuta un modelo. Eso es todo.
Desglose en el Mundo Real
| Sistema de Agente | Harness | Servicio de Inferencia | Modelo |
|---|---|---|---|
| Claude Desktop | UI + MCP + lógica local | Servicio de inferencia de Anthropic | Sonnet / Opus / Haiku |
| Claude CLI | Parsing de herramientas + E/S de archivos | Servicio de inferencia de Anthropic | Sonnet / Opus / Haiku |
| Cursor | Ensamblaje de contexto + enrutamiento de herramientas | Capa de inferencia de Cursor | Sonnet / GPT / Gemini |
| Agente LangChain personalizado | Plantillas de prompt + definiciones de herramientas | Bedrock, OpenAI, etc. | El modelo que elijas |
El mismo modelo (por ejemplo, Sonnet) puede comportarse de manera diferente dependiendo del harness — porque el harness da forma a las entradas e interpreta las salidas. Por eso tus prompts funcionan en Claude CLI pero no en Cursor.
Depura con Este Modelo Mental
- ¿Respuestas malas? Mira el harness — quizás no está proporcionando suficiente contexto.
- ¿Demasiado lento o caro? Revisa el servicio de inferencia — el precio y el rendimiento viven ahí.
- ¿Salida inesperada? ¿El modelo está equivocado, o el harness le está dando basura?
El artículo también señala que a medida que los modelos se vuelven más inteligentes, parte de la lógica del harness (como MCP o Skills) podría volverse obsoleta — así que la forma en que construimos harnesses ahora puede no envejecer bien.
La próxima vez que digas "mi modelo hizo X", detente y pregunta: ¿fue el modelo, o fue el harness orquestándolo?
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Comprensión de la Arquitectura de Agentes de IA: Capas Deterministas vs. Probabilísticas
Un usuario de Reddit comparte un modelo mental para sistemas de agentes de IA que separa capas deterministas (scripts, comandos, APIs) de capas probabilísticas (razonamiento y decisiones del LLM). La idea clave: trasladar la mayor cantidad de trabajo posible al lado determinista.

Guía de configuración de OpenClaw según análisis de Reddit: hardware, costo, memoria y prácticas de seguridad
Un usuario de Reddit analizó errores comunes de OpenClaw y creó una guía de configuración que cubre requisitos de hardware, optimización de costos a $10/mes, gestión de memoria usando archivos MEMORY.md y prácticas de seguridad para prevenir ataques de inyección de prompts.

12 Consejos para Usuarios Expertos de OpenClaw para Flujos de Trabajo Eficientes con Agentes de IA
Una publicación de Reddit describe estrategias prácticas para optimizar el uso de OpenClaw, incluyendo dividir conversaciones en hilos específicos por tema, usar notas de voz para entrada, emparejar modelos con tareas, delegar trabajo a subagentes e implementar capas de seguridad.

Cómo ejecutar OpenClaw completamente local con Ollama
Una publicación de Reddit describe un proceso para ejecutar OpenClaw completamente de manera local sin APIs en la nube ni facturación por token, utilizando Ollama y LLMFit para evaluar modelos locales.