Votre agent n'est pas le modèle : Harness vs service d'inférence expliqués

✍️ OpenClawRadar📅 Publié: August 25, 2026🔗 Source
Ad

Les gens parlent souvent de Claude comme s'il s'agissait d'une entité unique, mais un agent IA est une pile de trois couches distinctes. Connaître la différence vous fait gagner des heures de débogage — lorsque quelque chose ne va pas, vous devez savoir si le problème vient du modèle, du service ou de la logique qui l'entoure.

Les trois couches

  • Modèle — la fonction mathématique qui transforme les jetons d'entrée en jetons de sortie. Exemples : Sonnet, Opus, Gemini.
  • Service d'inférence — le service hébergé qui exécute le modèle et suit l'utilisation. Exemples : AWS Bedrock, l'API d'Anthropic.
  • Harnais — la logique qui façonne les entrées, interprète les sorties et interagit avec le monde extérieur. Cela inclut MCP et Skills — le modèle ne les connaît pas intrinsèquement.

En résumé, un système d'agent est un harnais qui appelle un service d'inférence, qui exécute un modèle. C'est tout.

Répartition dans le monde réel

Système d'agentHarnaisService d'inférenceModèle
Claude DesktopUI + MCP + logique localeService d'inférence d'AnthropicSonnet / Opus / Haiku
Claude CLIAnalyse des outils + I/O de fichiersService d'inférence d'AnthropicSonnet / Opus / Haiku
CursorAssemblage du contexte + routage des outilsCouche d'inférence de CursorSonnet / GPT / Gemini
Agent LangChain personnaliséModèles de prompt + définitions d'outilsBedrock, OpenAI, etc.Votre modèle choisi

Le même modèle (par exemple, Sonnet) peut se comporter différemment selon le harnais — car le harnais façonne les entrées et interprète les sorties. C'est pourquoi vos prompts fonctionnent dans Claude CLI mais pas dans Cursor.

Ad

Déboguer avec ce modèle mental

  • Mauvaises réponses ? Regardez le harnais — il ne fournit peut-être pas assez de contexte.
  • Trop lent ou coûteux ? Vérifiez le service d'inférence — les prix et les performances s'y trouvent.
  • Sortie inattendue ? Le modèle est-il erroné, ou le harnais lui fournit-il des données erronées ?

L'article note également que, à mesure que les modèles deviennent plus intelligents, certaines logiques de harnais (comme MCP ou Skills) pourraient devenir obsolètes — donc la façon dont nous construisons les harnais aujourd'hui pourrait mal vieillir.

La prochaine fois que vous direz « mon modèle a fait X », arrêtez-vous et demandez : était-ce le modèle, ou le harnais qui l'orchestrait ?

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks
Guides

Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks

Un utilisateur partage des configurations ik_llama détaillées et des métriques de performance pour exécuter les modèles Qwen3.6 27B et 35B A3B sur un RTX2060 mobile (6 Go VRAM, 32 Go RAM), avec des vitesses de préremplissage de 40-100 t/s et une génération jusqu'à 11 t/s.

OpenClawRadar
Conseils de configuration d'OpenClaw tirés de l'expérience d'un utilisateur : MCP Gmail, drapeaux de profil et problèmes de réseau
Guides

Conseils de configuration d'OpenClaw tirés de l'expérience d'un utilisateur : MCP Gmail, drapeaux de profil et problèmes de réseau

Un utilisateur exécutant OpenClaw sur un Mac via UTM avec une machine virtuelle Ubuntu partage des problèmes de configuration spécifiques rencontrés : le serveur MCP Gmail nécessite le paramètre html_body au lieu de body, le drapeau --profile prod est nécessaire pour éviter une identité dev codée en dur, et les clés API doivent être placées dans auth-profiles.json via la commande paste-token.

OpenClawRadar
Exécuter OpenClaw en local avec Ollama pour éviter les coûts d'API
Guides

Exécuter OpenClaw en local avec Ollama pour éviter les coûts d'API

Un utilisateur de Reddit partage son expérience de passage de l'API OpenClaw à une exécution locale avec Ollama, éliminant les coûts d'API tout en conservant ses flux de travail. Il a créé un guide vidéo d'installation étape par étape.

OpenClawRadar
Démarrage avec OpenCode pour la Configuration d'un Agent d'IA de Codage Local
Guides

Démarrage avec OpenCode pour la Configuration d'un Agent d'IA de Codage Local

Un guide pour débutants explique comment configurer OpenCode en tant qu'agent d'IA de codage entièrement local en utilisant les modèles optimisés de ByteShape avec LM Studio, llama.cpp ou Ollama sur Mac, Linux et Windows (WSL2).

OpenClawRadar