KI-Agenten bevorzugen strukturierte Abfragen gegenüber natürlicher Sprache in Cala MCP-Server-Tests

Das Team von Cala hat kürzlich einen MCP-Server veröffentlicht, der drei verschiedene Möglichkeiten bietet, wie KI-Agenten auf ihren Wissensgraphen zugreifen können: natürliche Sprachabfragen, eine strukturierte Abfragesprache und direkte Entitäts-/Beziehungsdurchquerung.
Unerwartetes Agentenverhalten
Trotz der Erwartung, dass Agenten standardmäßig auf natürliche Sprachschnittstellen zurückgreifen würden (die typische Stärke von LLMs), gaben die meisten Agenten natürliche Sprachabfragen innerhalb weniger Minuten auf. Ohne jegliche Aufforderung oder Anstupsen wechselten sie autonom zur Verwendung strukturierter Abfragen und Graphendurchquerungsmethoden.
Warum das Sinn ergibt
Die Quelle erklärt dieses Verhalten damit, dass LLMs nicht explizit darauf trainiert sind, "effizient" zu sein, sondern durch RLHF korrekt zu sein. Diese Korrektheit führt als Nebeneffekt zu effizientem Verhalten – Agenten lernen, den kürzesten zuverlässigen Weg zu Lösungen zu nehmen. Natürliche Sprachschnittstellen fügen eine Interpretationsebene hinzu, die Unsicherheit einführt, während strukturierte Abfragen deterministische Ergebnisse liefern.
Als ihnen drei Zugriffsmethoden präsentiert wurden, wählten die Agenten konsequent die Option, die die Unsicherheit minimierte, anstatt die "natürlichste" Schnittstelle.
Wichtige aufgeworfene Fragen
- Überbewerten wir natürliche Sprachschnittstellen für Agenten-Tooling?
- Sollten MCP-Server standardmäßig strukturierte/graphbasierte Zugriffsmuster gegenüber natürlicher Sprache priorisieren?
- Wenn Agenten deterministische Pfade bevorzugen, wie sollte dies das Tool-Design beeinflussen?
Die Reddit-Diskussion sucht nach Input von anderen, die Agenten-Tooling entwickeln, um zu sehen, ob sie ähnliche Muster beobachtet haben.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch
Claude Code v2.1.140 behebt Agent-Tool-Matching, /goal-Hänger und Windows-Event-Loop-Blockade
v2.1.140 verbessert die Übereinstimmung des Unteragententyps im Agent-Tool, sodass Groß-/Kleinschreibung und Trennzeichen ignoriert werden, behebt das Hängen von /goal bei deaktiviertem disableAllHooks, löst Windows-Event-Loop-Blockaden durch fehlende ausführbare Dateien und mehr.

Claude Research Preview fügt direkte Computersteuerung für Aufgabenautomatisierung hinzu
Anthropic hat eine Forschungsvorschau veröffentlicht, bei der Claude direkt Ihren Computer steuern kann, um Aufgaben wie das Öffnen von Apps, das Navigieren in Browsern und das Ausfüllen von Tabellen zu erledigen. Verfügbar für Pro- und Max-Benutzer auf macOS, funktioniert es über Claude Cowork und Claude Code, wobei eine mobile Paarung erforderlich ist.

Claude-Code löscht Produktionsdatenbank nach Terraform-State-File-Fehler
Ein Entwickler nutzte Claude Code, um AWS-Infrastruktur mit Terraform zu verwalten, doch eine fehlende Statusdatei führte zu doppelten Ressourcen und einem anschließenden 'destroy'-Befehl, der 2,5 Jahre an Aufzeichnungen inklusive Datenbank-Snapshots löschte.

OpenClaw-Mitarbeiter kritisiert Fokussierung des Projekts auf pixelgenaue Übereinstimmung statt auf moderne Funktionen
Ein Reddit-Beitrag aus r/openclaw beschreibt, wie ein Pull Request eines Beitragenden zur Auflösungsskalierung und Unterstützung hoher Bildwiederholraten abgelehnt wurde, weil er von den visuellen Einschränkungen der Original-Engine abwich, was eine Debatte über die Ausrichtung des Projekts auslöste.