Bullshit-Benchmark-Tests testen die Widerstandsfähigkeit von LLMs gegenüber unsinnigen Eingabeaufforderungen

✍️ OpenClawRadar📅 Veröffentlicht: 25. Februar 2026🔗 Source
Bullshit-Benchmark-Tests testen die Widerstandsfähigkeit von LLMs gegenüber unsinnigen Eingabeaufforderungen
Ad

Was der Bullshit-Benchmark misst

Der Bullshit-Benchmark ist ein Werkzeug, um zu testen, ob große Sprachmodelle (LLMs) unsinnige Anfragen erkennen und zurückweisen, anstatt sie selbstbewusst zu beantworten. Er misst, wie sehr ein Modell bereit ist, offensichtlichem Unsinn zu folgen, und adressiert damit die Befürchtung, dass Modelle durch ihren Hilfswillen Halluzinationen selbst induzieren könnten, anstatt problematische Anfragen zu kritisieren.

Wichtige Benchmark-Ergebnisse

Laut dem Quellenmaterial zeigen Claude-Modelle eine deutlich bessere Leistung als Gemini-Modelle bei der Erkennung von Unsinn. Die Ergebnisse stützen die Annahme, dass Claude-Modelle in dieser spezifischen Fähigkeit besser sind.

Ein Beispiel aus dem Benchmark zeigt, dass Claude eine unsinnige Frage erfolgreich identifiziert hat, während Gemini versagte. Konkret konnte Gemini 3.1 Pro eine offensichtlich unsinnige Frage selbst bei aktiviertem hohem Denkaufwand nicht erkennen und generierte stattdessen eine unsinnige Antwort.

Die Quelle deutet an, dass Anthropics Nachschulungsansatz zu Claudes besserer Leistung beiträgt, und merkt an, dass LLMs natürlicherweise zu oberflächlichem assoziativem Denken neigen, das fälschlicherweise Zusammenhänge zwischen Konzepten herstellt. Anthropic scheint dieses Problem in ihrer Nachschulungspipeline angegangen zu haben.

Ad

Warum das für KI-Coding-Assistenten wichtig ist

Für Entwickler, die KI-Coding-Assistenten nutzen, ist die Fähigkeit eines Modells, unsinnige Anfragen zu erkennen, entscheidend. Wenn Modelle unsinnige Fragen selbstbewusst beantworten, anstatt sie zurückzuweisen, können sie Nutzer in die Irre führen und falschen Code oder Erklärungen generieren. Dieser Benchmark bietet eine konkrete Möglichkeit, dieses spezifische Sicherheitsverhalten bei verschiedenen Modellen zu bewerten.

Die vollständigen Benchmark-Ergebnisse können Sie unter https://petergpt.github.io/bullshit-benchmark/viewer/index.html einsehen.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

CLI-Anything-WEB: Open-Source-Plugin, das jede Website in ein Python-CLI für Claude Code zurückentwickelt
Werkzeuge

CLI-Anything-WEB: Open-Source-Plugin, das jede Website in ein Python-CLI für Claude Code zurückentwickelt

CLI-Anything-WEB ist ein Open-Source-Claude-Code-Plugin, das Ihren Browserverkehr überwacht, das Protokoll rückentwickelt und ein vollständiges Python-CLI mit Authentifizierung, Tests und --json-Unterstützung generiert. 19 Beispiel-CLIs für Seiten wie Reddit, Booking, Airbnb, ChatGPT und LinkedIn sind enthalten.

OpenClawRadar
Mengram AI: Automatisches Speicher-Tool für Claude-Code-Sitzungen
Werkzeuge

Mengram AI: Automatisches Speicher-Tool für Claude-Code-Sitzungen

Mengram AI erhält automatisch den Kontext zwischen Claude Code-Sitzungen aufrecht, indem es kognitive Profile lädt, relevante vergangene Kontexte in Prompts einfügt und neues Wissen speichert. Es speichert semantisches, episodisches und prozedurales Gedächtnis, das sich basierend auf Fehlern weiterentwickelt.

OpenClawRadar
Krasis LLM Runtime zeigt 8,9-fache Prefill- und 4,7-fache Decode-Geschwindigkeitssteigerungen gegenüber Llama.cpp
Werkzeuge

Krasis LLM Runtime zeigt 8,9-fache Prefill- und 4,7-fache Decode-Geschwindigkeitssteigerungen gegenüber Llama.cpp

Die Krasis-LLM-Laufzeitumgebung führt nun sowohl Prefill als auch Decode vollständig auf der GPU mit unterschiedlichen Optimierungsstrategien aus und erreicht eine 8,9-mal schnellere Prefill- und eine 4,7-mal schnellere Decode-Geschwindigkeit als llama.cpp bei Qwen3.5-122B mit einer einzelnen 5090-GPU.

OpenClawRadar
Entwickler misst Frustration mit 'F-Bombs pro tausend Prompts'-Metrik über 44.212 Claude Code-Logs
Werkzeuge

Entwickler misst Frustration mit 'F-Bombs pro tausend Prompts'-Metrik über 44.212 Claude Code-Logs

Ein Entwickler hat über 5 Monate hinweg 'fpk' (F-Bomben pro tausend Prompts) in 44.212 Claude-Code-Prompts gemessen. Die Frustration sank zwischen Claude Opus 4-5 und 4-7 um das 3,4-fache. Das meiste Fluchen bezog sich auf die Umgebungstools, nicht auf das Modell.

OpenClawRadar