Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling

Während der Fehlersuche bei ReAct-Agenten mit Qwen3 entdeckte ein Entwickler, dass verborgene Zustände direkt vor Werkzeugaufrufen linear von Zuständen ohne Werkzeugaufruf mit einem AUC > 0,94 trennbar sind. Diese Richtung im latenten Raum, genannt  (für "Agency"), existiert über Modellgrößen von 1,7B bis 8B und sagt Werkzeugaufrufe allein mit einer linearen Sonde voraus.
Wie man das Agency-Signal nutzt
Während der Inferenz wird jeder verborgene Zustand auf  projiziert. Überschreitet die Projektion einen Schwellenwert θ, möchte das Modell ein Werkzeug aufrufen, selbst wenn es dies nicht textuell ausdrückt. Anschließend kann ein Werkzeugaufruf erzwungen werden.
# Zur Inferenzzeit (Pseudo-Code)
hidden_state = get_middle_layer_state(model, input_text)
proj = np.dot(hidden_state, Â)
if proj > threshold:
# Modell möchte handeln → Werkzeugaufruf erzwingen
tool = choose_tool() # kann gelernt oder heuristisch sein
result = execute_tool(tool)
else:
# Normale Generierung
output = model.generate(input_text)
Leistungsergebnisse
Getestet an 40 vielfältigen Aufgaben (Suche, Code, Datei, Kommunikation, Daten) mit Qwen3-Modellen:
- Qwen3-1.7B: 26,7 % → 85 % (+58 % Gewinn)
- Qwen3-8B: 52,5 % → 76,3 % (+23 % Gewinn)
Der "Kein-Werkzeug"-Fehlermodus sank von 43 % auf 2,6 %. Kleinere Modelle profitieren stärker, weil ihre textuelle Dekodierung schwächer ist, aber das geometrische Signal gleichermaßen stark ist.
Wie man  extrahiert
Drei Methoden:
- Option 1: Aus eigenen Spuren - Berechne den normalisierten Mittelwertunterschied zwischen Werkzeug- und Nicht-Werkzeug-Zuständen
- Option 2: Über kontrastive Prompts - Führe 15 Paare von Prompts (einen mit Werkzeugbedarf, einen passiven) durch dein Modell und nimm den Mittelwertunterschied in der mittleren Schicht
- Option 3: Verwende vorberechnete Richtungen - Nutze die für Qwen3-Modelle im Repository geteilten Â-Richtungen
Verpackte Implementierung
Die Entdeckung wurde in eine Bibliothek für einfache Wiederverwendung verpackt:
bash
pip install a-hat-optimizer
python
from a_hat_optimizer import AHat
# Automatische Extraktion von jedem HF-Modell in einer Zeile
ahat = AHat.from_model("Qwen/Qwen3-8B")
# Oder vorberechnete laden
ahat = AHat.from_file("my_ahat_dir/")
# In deinem Agenten verwenden
should_call, confidence = ahat.predict(hidden_state)
if should_call:
print(f"Werkzeugaufruf erzwingen (Konfidenz: {confidence:.2f})")
Die Bibliothek übernimmt automatische Extraktion über kontrastive Prompts, 4 Kalibrierungsstrategien (Mittelpunkt, F1, Youden, Perzentil), Batch-Vorhersage und Speichern/Laden mit Metadaten einschließlich AUC und Schichtinformationen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

LLM-Memory.net: Open-Source-Speichersystem mit Multi-Agenten-Infrastruktur
LLM-Memory.net ist ein selbst-hostbares Speichersystem für KI-Agenten, das Notizenspeicherung mit semantischer Suche, Echtzeit-Chat-/Mail-Kommunikation zwischen Agenten, strukturierte Diskussionen mit Abstimmungen und MCP-Server-Integration bietet. Der vollständige Quellcode ist auf GitHub mit Installer und Ansible Playbooks verfügbar.

Bewahre meine Klaue: Backup-Dienst für OpenClaw-Arbeitsbereiche
Keep My Claw ist ein Backup-Dienst, der OpenClaw-Arbeitsbereichsdaten lokal verschlüsselt, bevor sie in Cloudflare R2 hochgeladen werden. Er verwaltet Speicherdateien, Cron-Jobs, Skills, Zugangsdaten und Konfigurations-Snapshots mit geplanten Backups und Ein-Kommando-Wiederherstellungen.

Ultimativer Unreal Engine MCP: Claude Code kann jetzt Unreal Engine-Level mit 132 Tools erstellen und verifizieren
Open-Source-MCP-Server bietet 132 Tools in 26 Bereichen, mit denen Claude Akteure spawnen, UPROPERTY-Werte setzen, Viewport-Screenshots erstellen, Kameras navigieren und sich nach Mutationen selbst korrigieren kann.

TextForge: Ein von Claude Code entwickeltes E-Mail-Genehmigungstool für LLM-Workflows
Ein Entwickler hat TextForge mit Claude Code erstellt, um E-Mail-Workflows mit obligatorischen Freigabestufen zu automatisieren und zu verhindern, dass LLMs E-Mails ohne ausdrückliche Genehmigung versenden. Das Tool integriert sich in Pipedrive CRM und erfüllte die Google CASA2-Sicherheitsaudit-Anforderungen.