Ihr Agent ist nicht das Modell: Harness vs. Inferenzdienst erklärt
Menschen sprechen oft über Claude, als wäre es eine einzelne Einheit, aber ein KI-Agent ist ein Stapel aus drei verschiedenen Schichten. Den Unterschied zu kennen spart Stunden beim Debuggen – wenn etwas schiefgeht, müssen Sie wissen, ob Sie dem Modell, dem Dienst oder der Logik darum die Schuld geben müssen.
Die drei Schichten
- Modell – die mathematische Funktion, die Eingabetoken in Ausgabetoken umwandelt. Beispiele: Sonnet, Opus, Gemini.
- Inferenzdienst – der gehostete Dienst, der das Modell ausführt und die Nutzung verfolgt. Beispiele: AWS Bedrock, Anthropics API.
- Harness – die Logik, die Eingaben formt, Ausgaben interpretiert und die Außenwelt berührt. Dazu gehören MCP und Skills – das Modell kennt sie nicht von Natur aus.
Zusammengefasst ist ein Agentensystem ein Harness, der einen Inferenzdienst aufruft, der ein Modell ausführt. Das ist alles.
Beispiele aus der Praxis
| Agentensystem | Harness | Inferenzdienst | Modell |
|---|---|---|---|
| Claude Desktop | UI + MCP + lokale Logik | Anthropics Inferenzdienst | Sonnet / Opus / Haiku |
| Claude CLI | Tool-Parsing + Datei-I/O | Anthropics Inferenzdienst | Sonnet / Opus / Haiku |
| Cursor | Kontextaufbereitung + Tool-Routing | Cursor Inferenzschicht | Sonnet / GPT / Gemini |
| Eigener LangChain-Agent | Prompt-Vorlagen + Tool-Definitionen | Bedrock, OpenAI, etc. | Ihr gewähltes Modell |
Dasselbe Modell (z.B. Sonnet) kann sich je nach Harness unterschiedlich verhalten – weil der Harness Eingaben formt und Ausgaben interpretiert. Deshalb funktionieren Ihre Prompts in Claude CLI, aber nicht in Cursor.
Debugging mit diesem mentalen Modell
- Schlechte Antworten? Schauen Sie auf den Harness – vielleicht liefert er nicht genug Kontext.
- Zu langsam oder teuer? Prüfen Sie den Inferenzdienst – Preis und Leistung liegen dort.
- Unerwartete Ausgabe? Ist das Modell falsch oder füttert der Harness es mit Müll?
Der Artikel stellt auch fest, dass mit zunehmender Intelligenz der Modelle einige Harness-Logiken (wie MCP oder Skills) überflüssig werden könnten – die Art, wie wir Harnesses jetzt bauen, könnte also nicht gut altern.
Wenn Sie das nächste Mal sagen: „Mein Modell hat X getan“, halten Sie inne und fragen Sie: War es das Modell oder der Harness, der es orchestriert hat?
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Verwendung des Dispatcher-Musters zur Reduzierung der Claude-API-Kosten um 95 %
Ein Entwickler reduzierte seine Claude-API-Kosten von 800–2.000 $/Monat auf etwa 215 $/Monat, indem er ein Dispatcher-Muster implementierte, das schwere Aufgaben an die Claude Code CLI auf einem Claude Max-Abonnement delegiert, während für die Orchestrierung nur minimale API-Token verwendet werden.

Mit OpenClaws sieben Optimierungstechniken Token-Kosten um 95 % senken
Ein umfassender Leitfaden, der sieben Techniken zur Reduzierung des KI-Agenten-Tokenverbrauchs um über 95% beschreibt, darunter baumstrukturierte Boot-Dateien, KI-Auto-Kompression, lokale Modellauslagerung und cron-basierte CPU-Aufgaben.

Optimierung von Qwen 3.6 27B/35B auf RTX 3090: Flags, Quantisierung und Auto-Routing
Ein Benutzer teilt seine llama-server-Flags für die Qwen 3.6 27B- und 35B-GGUF-Modelle auf einer RTX 3090 (24 GB) mit und berichtet von langsamen Geschwindigkeiten für das 35B-Modell sowie unzuverlässiger Code-Ausgabe des 27B-Modells. Der Beitrag fragt nach besseren Quantisierungen, Flag-Optimierung und automatischem Modellwechsel.

72-Schritte Claude Einrichtungs-Checkliste: Von Standard zum Power-User
Ein detaillierter Medium-Artikel beschreibt eine 72-Schritte-Checkliste zur Konfiguration von Claude, die von den Standardeinstellungen zu erweiterten Power-User-Funktionen führt. Geteilt auf HN mit 10 Punkten und 1 Kommentar.