Bullshit-Benchmark-Tests testen die Widerstandsfähigkeit von LLMs gegenüber unsinnigen Eingabeaufforderungen

Was der Bullshit-Benchmark misst
Der Bullshit-Benchmark ist ein Werkzeug, um zu testen, ob große Sprachmodelle (LLMs) unsinnige Anfragen erkennen und zurückweisen, anstatt sie selbstbewusst zu beantworten. Er misst, wie sehr ein Modell bereit ist, offensichtlichem Unsinn zu folgen, und adressiert damit die Befürchtung, dass Modelle durch ihren Hilfswillen Halluzinationen selbst induzieren könnten, anstatt problematische Anfragen zu kritisieren.
Wichtige Benchmark-Ergebnisse
Laut dem Quellenmaterial zeigen Claude-Modelle eine deutlich bessere Leistung als Gemini-Modelle bei der Erkennung von Unsinn. Die Ergebnisse stützen die Annahme, dass Claude-Modelle in dieser spezifischen Fähigkeit besser sind.
Ein Beispiel aus dem Benchmark zeigt, dass Claude eine unsinnige Frage erfolgreich identifiziert hat, während Gemini versagte. Konkret konnte Gemini 3.1 Pro eine offensichtlich unsinnige Frage selbst bei aktiviertem hohem Denkaufwand nicht erkennen und generierte stattdessen eine unsinnige Antwort.
Die Quelle deutet an, dass Anthropics Nachschulungsansatz zu Claudes besserer Leistung beiträgt, und merkt an, dass LLMs natürlicherweise zu oberflächlichem assoziativem Denken neigen, das fälschlicherweise Zusammenhänge zwischen Konzepten herstellt. Anthropic scheint dieses Problem in ihrer Nachschulungspipeline angegangen zu haben.
Warum das für KI-Coding-Assistenten wichtig ist
Für Entwickler, die KI-Coding-Assistenten nutzen, ist die Fähigkeit eines Modells, unsinnige Anfragen zu erkennen, entscheidend. Wenn Modelle unsinnige Fragen selbstbewusst beantworten, anstatt sie zurückzuweisen, können sie Nutzer in die Irre führen und falschen Code oder Erklärungen generieren. Dieser Benchmark bietet eine konkrete Möglichkeit, dieses spezifische Sicherheitsverhalten bei verschiedenen Modellen zu bewerten.
Die vollständigen Benchmark-Ergebnisse können Sie unter https://petergpt.github.io/bullshit-benchmark/viewer/index.html einsehen.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

CLI-Anything-WEB: Open-Source-Plugin, das jede Website in ein Python-CLI für Claude Code zurückentwickelt
CLI-Anything-WEB ist ein Open-Source-Claude-Code-Plugin, das Ihren Browserverkehr überwacht, das Protokoll rückentwickelt und ein vollständiges Python-CLI mit Authentifizierung, Tests und --json-Unterstützung generiert. 19 Beispiel-CLIs für Seiten wie Reddit, Booking, Airbnb, ChatGPT und LinkedIn sind enthalten.

Mengram AI: Automatisches Speicher-Tool für Claude-Code-Sitzungen
Mengram AI erhält automatisch den Kontext zwischen Claude Code-Sitzungen aufrecht, indem es kognitive Profile lädt, relevante vergangene Kontexte in Prompts einfügt und neues Wissen speichert. Es speichert semantisches, episodisches und prozedurales Gedächtnis, das sich basierend auf Fehlern weiterentwickelt.

Krasis LLM Runtime zeigt 8,9-fache Prefill- und 4,7-fache Decode-Geschwindigkeitssteigerungen gegenüber Llama.cpp
Die Krasis-LLM-Laufzeitumgebung führt nun sowohl Prefill als auch Decode vollständig auf der GPU mit unterschiedlichen Optimierungsstrategien aus und erreicht eine 8,9-mal schnellere Prefill- und eine 4,7-mal schnellere Decode-Geschwindigkeit als llama.cpp bei Qwen3.5-122B mit einer einzelnen 5090-GPU.

Entwickler misst Frustration mit 'F-Bombs pro tausend Prompts'-Metrik über 44.212 Claude Code-Logs
Ein Entwickler hat über 5 Monate hinweg 'fpk' (F-Bomben pro tausend Prompts) in 44.212 Claude-Code-Prompts gemessen. Die Frustration sank zwischen Claude Opus 4-5 und 4-7 um das 3,4-fache. Das meiste Fluchen bezog sich auf die Umgebungstools, nicht auf das Modell.