でたらめなプロンプトに対するLLMの耐性を測るベンチマークテスト

Bullshit Benchmarkが測定するもの
Bullshit Benchmarkは、大規模言語モデル(LLM)がナンセンスなプロンプトを識別し、それに抵抗するかどうか、自信を持って回答するのではなく評価するためのツールです。これは、モデルが明らかなナンセンスにどれだけ従うかを測定し、モデルが問題のあるプロンプトを指摘するのではなく、役に立とうとして自己誘発的な幻覚を引き起こす可能性があるという懸念に対処します。
主要なベンチマーク結果
ソース資料によると、Claudeモデルはナンセンスを検出する点でGeminiモデルよりも有意に優れたパフォーマンスを示しています。結果は、Claudeモデルがこの特定の能力において優れているという直感を支持しています。
ベンチマークの一例では、Claudeがナンセンスな質問を正常に識別した一方で、Geminiは失敗しました。具体的には、Gemini 3.1 Proは高度な思考努力が有効になっていても明らかなナンセンスな質問を検出できず、代わりにナンセンスな回答を生成しました。
ソースは、AnthropicのポストトレーニングアプローチがClaudeの優れたパフォーマンスに貢献していると示唆しており、LLMは自然に概念間の偽りの関係を生成する表面的な連想的思考に向かう傾向があると指摘しています。Anthropicは、自社のポストトレーニングパイプラインでこの問題に対処したようです。
AIコーディングエージェントにとってこれが重要な理由
AIコーディングアシスタントを使用する開発者にとって、モデルがナンセンスなプロンプトを認識する能力は重要です。モデルがナンセンスな質問に自信を持って回答し、抵抗しない場合、ユーザーを誤解させ、誤ったコードや説明を生成する可能性があります。このベンチマークは、異なるモデル間でこの特定の安全性の行動を評価する具体的な方法を提供します。
完全なベンチマーク結果はhttps://petergpt.github.io/bullshit-benchmark/viewer/index.htmlでご覧いただけます。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

vLLM内部解析:高吞吐量LLM推理系统的解剖
Aleksa GordićがvLLMの中核コンポーネント(エンジン、KVキャッシュマネージャ、ページドアテンション、連続バッチ処理)を解説します。また、チャンク化プリフィルや分離型P/Dなどの高度な機能もカバーしています。

Steam City: Claude Codeで構築したあなたのSteamライブラリの3Dピクセルアートマップ
開発者がClaude Codeを使って作ったSteam Cityは、あなたのSteamライブラリを3Dピクセルアートの街に変換します。プレイ時間がビルの高さに、未プレイのゲームは暗く表示されます。すでに1,000人以上のプレイヤーが参加しています。

RedditユーザーがAIアシスタントから個人の知識をエクスポートするための詳細なプロンプトを共有
Redditユーザーが、AnthropicのChatGPTインポート機能の限界を補うため、ClaudeなどのAIアシスタントから構造化された個人知識を抽出する包括的なプロンプトを作成しました。このプロンプトは、個人知識ベース、知的フレームワーク、知識グラフの3つの異なるJSON成果物を生成します。

オープンソースのClaudeコードスキルでパーソナライズされたソーシャルメディアコンテンツ
開発者が、Claudeがソーシャルメディアコンテンツをユーザーの本来の声で書けるようにする13のClaude Codeスキルをオープンソース化しました。これらのスキルには、LinkedIn、Twitter/X、Threads、Bluesky向けのコンテキスト定義、戦略策定、作成、分析ツールが含まれています。