Ihr Agent ist nicht das Modell: Harness vs. Inferenzdienst erklärt

✍️ OpenClawRadar📅 Veröffentlicht: 25. August 2026🔗 Source
Ad

Menschen sprechen oft über Claude, als wäre es eine einzelne Einheit, aber ein KI-Agent ist ein Stapel aus drei verschiedenen Schichten. Den Unterschied zu kennen spart Stunden beim Debuggen – wenn etwas schiefgeht, müssen Sie wissen, ob Sie dem Modell, dem Dienst oder der Logik darum die Schuld geben müssen.

Die drei Schichten

  • Modell – die mathematische Funktion, die Eingabetoken in Ausgabetoken umwandelt. Beispiele: Sonnet, Opus, Gemini.
  • Inferenzdienst – der gehostete Dienst, der das Modell ausführt und die Nutzung verfolgt. Beispiele: AWS Bedrock, Anthropics API.
  • Harness – die Logik, die Eingaben formt, Ausgaben interpretiert und die Außenwelt berührt. Dazu gehören MCP und Skills – das Modell kennt sie nicht von Natur aus.

Zusammengefasst ist ein Agentensystem ein Harness, der einen Inferenzdienst aufruft, der ein Modell ausführt. Das ist alles.

Beispiele aus der Praxis

AgentensystemHarnessInferenzdienstModell
Claude DesktopUI + MCP + lokale LogikAnthropics InferenzdienstSonnet / Opus / Haiku
Claude CLITool-Parsing + Datei-I/OAnthropics InferenzdienstSonnet / Opus / Haiku
CursorKontextaufbereitung + Tool-RoutingCursor InferenzschichtSonnet / GPT / Gemini
Eigener LangChain-AgentPrompt-Vorlagen + Tool-DefinitionenBedrock, OpenAI, etc.Ihr gewähltes Modell

Dasselbe Modell (z.B. Sonnet) kann sich je nach Harness unterschiedlich verhalten – weil der Harness Eingaben formt und Ausgaben interpretiert. Deshalb funktionieren Ihre Prompts in Claude CLI, aber nicht in Cursor.

Ad

Debugging mit diesem mentalen Modell

  • Schlechte Antworten? Schauen Sie auf den Harness – vielleicht liefert er nicht genug Kontext.
  • Zu langsam oder teuer? Prüfen Sie den Inferenzdienst – Preis und Leistung liegen dort.
  • Unerwartete Ausgabe? Ist das Modell falsch oder füttert der Harness es mit Müll?

Der Artikel stellt auch fest, dass mit zunehmender Intelligenz der Modelle einige Harness-Logiken (wie MCP oder Skills) überflüssig werden könnten – die Art, wie wir Harnesses jetzt bauen, könnte also nicht gut altern.

Wenn Sie das nächste Mal sagen: „Mein Modell hat X getan“, halten Sie inne und fragen Sie: War es das Modell oder der Harness, der es orchestriert hat?

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

Verwendung des Dispatcher-Musters zur Reduzierung der Claude-API-Kosten um 95 %
Anleitungen

Verwendung des Dispatcher-Musters zur Reduzierung der Claude-API-Kosten um 95 %

Ein Entwickler reduzierte seine Claude-API-Kosten von 800–2.000 $/Monat auf etwa 215 $/Monat, indem er ein Dispatcher-Muster implementierte, das schwere Aufgaben an die Claude Code CLI auf einem Claude Max-Abonnement delegiert, während für die Orchestrierung nur minimale API-Token verwendet werden.

OpenClawRadar
Mit OpenClaws sieben Optimierungstechniken Token-Kosten um 95 % senken
Anleitungen

Mit OpenClaws sieben Optimierungstechniken Token-Kosten um 95 % senken

Ein umfassender Leitfaden, der sieben Techniken zur Reduzierung des KI-Agenten-Tokenverbrauchs um über 95% beschreibt, darunter baumstrukturierte Boot-Dateien, KI-Auto-Kompression, lokale Modellauslagerung und cron-basierte CPU-Aufgaben.

OpenClawRadar
Optimierung von Qwen 3.6 27B/35B auf RTX 3090: Flags, Quantisierung und Auto-Routing
Anleitungen

Optimierung von Qwen 3.6 27B/35B auf RTX 3090: Flags, Quantisierung und Auto-Routing

Ein Benutzer teilt seine llama-server-Flags für die Qwen 3.6 27B- und 35B-GGUF-Modelle auf einer RTX 3090 (24 GB) mit und berichtet von langsamen Geschwindigkeiten für das 35B-Modell sowie unzuverlässiger Code-Ausgabe des 27B-Modells. Der Beitrag fragt nach besseren Quantisierungen, Flag-Optimierung und automatischem Modellwechsel.

OpenClawRadar
72-Schritte Claude Einrichtungs-Checkliste: Von Standard zum Power-User
Anleitungen

72-Schritte Claude Einrichtungs-Checkliste: Von Standard zum Power-User

Ein detaillierter Medium-Artikel beschreibt eine 72-Schritte-Checkliste zur Konfiguration von Claude, die von den Standardeinstellungen zu erweiterten Power-User-Funktionen führt. Geteilt auf HN mit 10 Punkten und 1 Kommentar.

OpenClawRadar