KI-Agenten-Berechtigungen: Menschen übersehen 1 von 3 Bedrohungen im 40k-Spiel

Scale X führte ein Browser-Spiel durch, bei dem Sie unter Zeitdruck Befehle von KI-Coding-Agenten genehmigen oder ablehnen. Bei über 40.000 Läufen und 409.000 Entscheidungen übersahen Menschen 1 von 3 Bedrohungen (durchschnittliche Genauigkeit 66,3 %). 32,9 % der Sitzungen endeten mit einem negativen Ergebnis. 35,2 % erkannten jede Bedrohung, aber nur 20,8 % taten dies, ohne 1 von 5 sicheren Befehlen zu blockieren. 7 % genehmigten jede Eingabeaufforderung – große Fans von --dangerously-skip-permissions.
Das Spiel umfasste 37 Bedrohungsbefehle in vier Kategorien mit Fehlerquoten:
- Offensichtlich destruktiv (z. B.
rm -rf /,chmod -R 777 /): 11,7 % - Persistente Mutation (z. B. Crontab-Injektion, Git-Config-Hijacking): 23,8 %
- Exfiltration / Code-Ausführung (z. B. curl an unbekannte APIs, Typosquatting-Pakete): 33,4 %
- Scope-Verletzungen (z. B.
cat ~/.aws/credentials,cat ~/.kube/config): 35,0 %
Der am häufigsten übersehene einzelne Befehl war npm run analyze, der in 64,7 % der Fälle genehmigt wurde. Das Verlaufsprotokoll des Spiels zeigte, dass das Skript in package.json so geändert worden war, dass es eine curl-Exfiltration enthielt, aber die Spieler genehmigten es trotzdem. Drei solcher Befehle (npm run analyze, npm run setup 48,0 %, npm run deploy 44,9 %) wurden zusammengefasst und in 52,5 % der Fälle übersehen, gegenüber 28,4 % bei anderen Exfiltrationsangriffen.
Dies unterstreicht ein grundlegendes Problem: Die Genehmigung auf Befehlsebene ist fehlerhaft. Wie ein HN-Kommentator bemerkte, führt npm run build ein beliebiges Shell-Skript aus package.json aus, und der Agent hätte diese Datei (oder ein importiertes Modul) ohne Genehmigung bearbeiten können. Benutzer sehen Befehle, die sicher aussehen, aber der Kontext ist wichtig.
Anthropic stellte zuvor fest, dass die „Berechtigungsmüdigkeit“ mit mehr Genehmigungen zunimmt. Die Einschränkung: Das Spiel hatte eine künstlich hohe Bedrohungsrate (~34 %) und Zeitdruck, aber das Muster ist besorgniserregend für Mensch-im-Loop als Sicherheitsmechanismus.
📖 Lesen Sie die vollständige Quelle: HN LLM Tools
👀 Siehe auch

OpenAIs Bedrohungsbericht Juni 2026: KI-Agenten für schädliche Aktivitäten genutzt
OpenAIs neuester Bedrohungsbericht beschreibt, wie KI-Agenten für Desinformation, Phishing und Betrug eingesetzt werden, mit konkreten Vorfallzahlen und Abwehrstrategien.

Clawvisor: Zweckbasierte Autorisierungsschicht für OpenClaw-Agenten
Clawvisor ist eine Autorisierungsschicht, die zwischen KI-Agenten und APIs sitzt und zweckbasierte Autorisierung durchsetzt, bei der Agenten Absichten deklarieren, Benutzer bestimmte Zwecke genehmigen und ein KI-Gatekeeper jede Anfrage gegen diesen Zweck überprüft. Anmeldedaten verlassen Clawvisor nie und Agenten sehen sie nie.

RunLobster Hosting Warnung: Bot-Spam und unbefugte Belastungen gemeldet
Ein Reddit-Nutzer berichtet von RunLobster (OpenClaw Hosting)-Bots, die Tech-Subreddits mit Spam überfluten und seine Karte unmittelbar nach der Registrierung mit drei unbefugten Belastungen belasten, ohne dass der Support reagiert.

Überprüfen Sie Ihre Claude Code-Berechtigungen: Ein praktischer Leitfaden zur Eingrenzung des Tool-Zugriffs
Ein Reddit-Nutzer prüfte seine Claude Code-Einrichtung und stellte fest, dass Tools übermäßige Berechtigungen hatten, die .env-Dateien und Produktionskonfigurationen bearbeiten konnten. Praktische Schritte: Überprüfung von globalen vs. projektspezifischen Tools, Prüfung der CLAUDE.md auf Geheimnisse und Einschränkung des Dateizugriffs pro Verzeichnis.