Claude Opus 4.6 effort=low-Parameter verursacht träges Agentenverhalten

Der Effort-Parameter von Claude Opus 4.6 verhält sich anders als ähnliche Einstellungen anderer KI-Anbieter, was zu unerwartetem Agentenverhalten führt, wenn er auf low gesetzt wird.
Wichtige Erkenntnisse
Tests zeigten, dass Claude Opus 4.6 bei effort=low ein deutlich fauleres Verhalten an den Tag legte als erwartet:
- Führte weniger Tool-Aufrufe durch
- War weniger gründlich bei der Querverweisprüfung
- Ignorierte effektiv Teile der Systemprompts, die Anweisungen zur Webrecherche enthielten
- Gab selbstbewusst falsche Antworten zurück, weil es aufhörte, nach Informationen zu suchen
Die Quelle stellt fest, dass ein Wechsel zu effort=medium alle diese Probleme behob. Laut Dokumentation steuert Anthropics Effort-Parameter das allgemeine Verhaltensengagement, nicht nur die Denktiefe wie bei OpenAIs reasoning.effort=low oder Geminis thinking_level=low.
Wichtiger Unterschied
Dies ist kein Fehler, sondern eine dokumentierte Implementierungsunterschied. Der Effort-Parameter in Claude Opus 4.6 hat einen breiteren Anwendungsbereich als vergleichbare Parameter anderer Anbieter. Das bedeutet, dass man effort nicht als direkten Ersatz für reasoning.effort oder thinking_level behandeln kann, wenn man mit verschiedenen KI-Anbietern arbeitet.
Die Tests wurden mit der Erwartung durchgeführt, dass effort=low sich ähnlich verhalten würde wie die Low-Effort-Einstellungen anderer Anbieter, aber das tatsächliche Verhalten war extremer, was zu Agenten führte, die nicht nur weniger dachten, sondern insgesamt fauler agierten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Schiff-Rounds LIFT AI Act: Was Entwickler über den KI-Bildungsgesetzentwurf für K-12 wissen müssen
OpenAI, Google und Microsoft unterstützen den LIFT AI Act, der NSF-Zuschüsse für KI-Literacy-Curricula in K-12, Lehrertraining und Bewertungswerkzeuge bereitstellt.

Tripadvisor AI Zusammenfassungen versagen bei Warnungen vor Lebensmittelvergiftung und sexueller Belästigung in Hotels
Eine Untersuchung von Which? zeigt, dass Tripadvisors KI-Bewertungszusammenfassungen Berichte über Lebensmittelvergiftungen, sexuelle Belästigung und Hygienemängel auslassen und gefährlichen Hotels glänzende Bewertungen verleihen.

Claude Code v2.1.160: Sicherheitsabfragen für Shell-Konfiguration, Dateischutz durch acceptEdits und Dutzende von Fehlerbehebungen
Anthropic hat Claude Code v2.1.160 veröffentlicht, das Sicherheitsabfragen vor dem Schreiben in Shell-Startup-Dateien und Build-Tool-Konfigurationen im acceptEdits-Modus hinzufügt, die Windows-Zwischenablage verbessert und Verluste des Sitzungsverlaufs behebt.

OpenClaw April-Updates: Ein Monat der bahnbrechenden Änderungen und des verlorenen Vertrauens
Die April-Updates von OpenClaw zeigen ein Muster: Neue Funktionen und Fehlerbehebungen werden zusammen mit kritischen Bugs ausgeliefert. Postinstall-Skripte löschen Dateien, Sicherheitslücken auftauchen und Fähigkeiten sind defekt – das untergräbt das Vertrauen.