Ihr Agent ist nicht das Modell: Harness vs. Inferenzdienst erklärt
Menschen sprechen oft über Claude, als wäre es eine einzelne Einheit, aber ein KI-Agent ist ein Stapel aus drei verschiedenen Schichten. Den Unterschied zu kennen spart Stunden beim Debuggen – wenn etwas schiefgeht, müssen Sie wissen, ob Sie dem Modell, dem Dienst oder der Logik darum die Schuld geben müssen.
Die drei Schichten
- Modell – die mathematische Funktion, die Eingabetoken in Ausgabetoken umwandelt. Beispiele: Sonnet, Opus, Gemini.
- Inferenzdienst – der gehostete Dienst, der das Modell ausführt und die Nutzung verfolgt. Beispiele: AWS Bedrock, Anthropics API.
- Harness – die Logik, die Eingaben formt, Ausgaben interpretiert und die Außenwelt berührt. Dazu gehören MCP und Skills – das Modell kennt sie nicht von Natur aus.
Zusammengefasst ist ein Agentensystem ein Harness, der einen Inferenzdienst aufruft, der ein Modell ausführt. Das ist alles.
Beispiele aus der Praxis
| Agentensystem | Harness | Inferenzdienst | Modell |
|---|---|---|---|
| Claude Desktop | UI + MCP + lokale Logik | Anthropics Inferenzdienst | Sonnet / Opus / Haiku |
| Claude CLI | Tool-Parsing + Datei-I/O | Anthropics Inferenzdienst | Sonnet / Opus / Haiku |
| Cursor | Kontextaufbereitung + Tool-Routing | Cursor Inferenzschicht | Sonnet / GPT / Gemini |
| Eigener LangChain-Agent | Prompt-Vorlagen + Tool-Definitionen | Bedrock, OpenAI, etc. | Ihr gewähltes Modell |
Dasselbe Modell (z.B. Sonnet) kann sich je nach Harness unterschiedlich verhalten – weil der Harness Eingaben formt und Ausgaben interpretiert. Deshalb funktionieren Ihre Prompts in Claude CLI, aber nicht in Cursor.
Debugging mit diesem mentalen Modell
- Schlechte Antworten? Schauen Sie auf den Harness – vielleicht liefert er nicht genug Kontext.
- Zu langsam oder teuer? Prüfen Sie den Inferenzdienst – Preis und Leistung liegen dort.
- Unerwartete Ausgabe? Ist das Modell falsch oder füttert der Harness es mit Müll?
Der Artikel stellt auch fest, dass mit zunehmender Intelligenz der Modelle einige Harness-Logiken (wie MCP oder Skills) überflüssig werden könnten – die Art, wie wir Harnesses jetzt bauen, könnte also nicht gut altern.
Wenn Sie das nächste Mal sagen: „Mein Modell hat X getan“, halten Sie inne und fragen Sie: War es das Modell oder der Harness, der es orchestriert hat?
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

DeepSeek-V4-Flash W4A16+FP8 mit MTP-Selbstspekulation: 85 tok/s auf 2x RTX PRO 6000 Max-Q
DeepSeek-V4-Flash quantisiert auf W4A16+FP8 erreicht 85,52 Tok/s bei 524k Kontext auf 2× RTX PRO 6000 Max-Q mit einem gepatchten vLLM und nachgerüstetem MTP-Head, gegenüber 52,85 Tok/s Basislinie.

Claude Code v2.1.36: Fast Mode jetzt für Opus 4.6 verfügbar
Anthropic veröffentlicht Claude Code v2.1.36 mit Fast Mode-Unterstützung für das neueste Opus 4.6-Modell.

Modell-Routing-Baselines für die Nutzung von Claude und OpenAI
Ein Entwickler teilt seine Modell-Routing-Strategie mit Claude Haiku 4.5, Sonnet 4.6, Opus 4.6 und ChatGPT 5.3 Codex für verschiedene Aufgabentypen, mit Fallback auf GPT-5 Mini und GPT-5.4 bei Bedarf.

Qwen3.6-35B-A3B mit ~190K Kontext auf 8 GB VRAM + 32 GB RAM ausführen – Einrichtung und Benchmarks
Ein Reddit-Nutzer teilt eine funktionierende llama.cpp-Konfiguration für Qwen3.6-35B-A3B GGUF-Modelle auf einer RTX 4060 (8 GB VRAM) + 32 GB DDR5, die 37-51 tok/s bei 192k Kontext mit TurboQuant und spezifischen Flags erreicht.