Tu agente no es el modelo: Harness vs Servicio de inferencia explicados

✍️ OpenClawRadar📅 Publicado: 25 de agosto de 2026🔗 Source
Ad

La gente suele hablar de Claude como si fuera una entidad única, pero un agente de IA es una pila de tres capas distintas. Conocer la diferencia te ahorra horas de depuración: cuando algo sale mal, necesitas saber si culpar al modelo, al servicio o a la lógica que lo rodea.

Las Tres Capas

  • Modelo — la función matemática que transforma tokens de entrada en tokens de salida. Ejemplos: Sonnet, Opus, Gemini.
  • Servicio de inferencia — el servicio alojado que ejecuta el modelo y rastrea el uso. Ejemplos: AWS Bedrock, API de Anthropic.
  • Harness — la lógica que da forma a las entradas, interpreta las salidas y toca el mundo exterior. Esto incluye MCP y Skills — el modelo no los conoce de forma inherente.

En conjunto, un sistema de agente es un harness que llama a un servicio de inferencia, el cual ejecuta un modelo. Eso es todo.

Desglose en el Mundo Real

Sistema de AgenteHarnessServicio de InferenciaModelo
Claude DesktopUI + MCP + lógica localServicio de inferencia de AnthropicSonnet / Opus / Haiku
Claude CLIParsing de herramientas + E/S de archivosServicio de inferencia de AnthropicSonnet / Opus / Haiku
CursorEnsamblaje de contexto + enrutamiento de herramientasCapa de inferencia de CursorSonnet / GPT / Gemini
Agente LangChain personalizadoPlantillas de prompt + definiciones de herramientasBedrock, OpenAI, etc.El modelo que elijas

El mismo modelo (por ejemplo, Sonnet) puede comportarse de manera diferente dependiendo del harness — porque el harness da forma a las entradas e interpreta las salidas. Por eso tus prompts funcionan en Claude CLI pero no en Cursor.

Ad

Depura con Este Modelo Mental

  • ¿Respuestas malas? Mira el harness — quizás no está proporcionando suficiente contexto.
  • ¿Demasiado lento o caro? Revisa el servicio de inferencia — el precio y el rendimiento viven ahí.
  • ¿Salida inesperada? ¿El modelo está equivocado, o el harness le está dando basura?

El artículo también señala que a medida que los modelos se vuelven más inteligentes, parte de la lógica del harness (como MCP o Skills) podría volverse obsoleta — así que la forma en que construimos harnesses ahora puede no envejecer bien.

La próxima vez que digas "mi modelo hizo X", detente y pregunta: ¿fue el modelo, o fue el harness orquestándolo?

📖 Lee la fuente completa: HN AI Agents

Ad

👀 Ver también

Comprensión de la Arquitectura de Agentes de IA: Capas Deterministas vs. Probabilísticas
Guías

Comprensión de la Arquitectura de Agentes de IA: Capas Deterministas vs. Probabilísticas

Un usuario de Reddit comparte un modelo mental para sistemas de agentes de IA que separa capas deterministas (scripts, comandos, APIs) de capas probabilísticas (razonamiento y decisiones del LLM). La idea clave: trasladar la mayor cantidad de trabajo posible al lado determinista.

OpenClawRadar
Guía de configuración de OpenClaw según análisis de Reddit: hardware, costo, memoria y prácticas de seguridad
Guías

Guía de configuración de OpenClaw según análisis de Reddit: hardware, costo, memoria y prácticas de seguridad

Un usuario de Reddit analizó errores comunes de OpenClaw y creó una guía de configuración que cubre requisitos de hardware, optimización de costos a $10/mes, gestión de memoria usando archivos MEMORY.md y prácticas de seguridad para prevenir ataques de inyección de prompts.

OpenClawRadar
12 Consejos para Usuarios Expertos de OpenClaw para Flujos de Trabajo Eficientes con Agentes de IA
Guías

12 Consejos para Usuarios Expertos de OpenClaw para Flujos de Trabajo Eficientes con Agentes de IA

Una publicación de Reddit describe estrategias prácticas para optimizar el uso de OpenClaw, incluyendo dividir conversaciones en hilos específicos por tema, usar notas de voz para entrada, emparejar modelos con tareas, delegar trabajo a subagentes e implementar capas de seguridad.

OpenClawRadar
Cómo ejecutar OpenClaw completamente local con Ollama
Guías

Cómo ejecutar OpenClaw completamente local con Ollama

Una publicación de Reddit describe un proceso para ejecutar OpenClaw completamente de manera local sin APIs en la nube ni facturación por token, utilizando Ollama y LLMFit para evaluar modelos locales.

OpenClawRadar