でたらめなプロンプトに対するLLMの耐性を測るベンチマークテスト

Bullshit Benchmarkが測定するもの
Bullshit Benchmarkは、大規模言語モデル(LLM)がナンセンスなプロンプトを識別し、それに抵抗するかどうか、自信を持って回答するのではなく評価するためのツールです。これは、モデルが明らかなナンセンスにどれだけ従うかを測定し、モデルが問題のあるプロンプトを指摘するのではなく、役に立とうとして自己誘発的な幻覚を引き起こす可能性があるという懸念に対処します。
主要なベンチマーク結果
ソース資料によると、Claudeモデルはナンセンスを検出する点でGeminiモデルよりも有意に優れたパフォーマンスを示しています。結果は、Claudeモデルがこの特定の能力において優れているという直感を支持しています。
ベンチマークの一例では、Claudeがナンセンスな質問を正常に識別した一方で、Geminiは失敗しました。具体的には、Gemini 3.1 Proは高度な思考努力が有効になっていても明らかなナンセンスな質問を検出できず、代わりにナンセンスな回答を生成しました。
ソースは、AnthropicのポストトレーニングアプローチがClaudeの優れたパフォーマンスに貢献していると示唆しており、LLMは自然に概念間の偽りの関係を生成する表面的な連想的思考に向かう傾向があると指摘しています。Anthropicは、自社のポストトレーニングパイプラインでこの問題に対処したようです。
AIコーディングエージェントにとってこれが重要な理由
AIコーディングアシスタントを使用する開発者にとって、モデルがナンセンスなプロンプトを認識する能力は重要です。モデルがナンセンスな質問に自信を持って回答し、抵抗しない場合、ユーザーを誤解させ、誤ったコードや説明を生成する可能性があります。このベンチマークは、異なるモデル間でこの特定の安全性の行動を評価する具体的な方法を提供します。
完全なベンチマーク結果はhttps://petergpt.github.io/bullshit-benchmark/viewer/index.htmlでご覧いただけます。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

ジェンティック・ミニ:OpenClaw用セルフホスト型APIおよびアクション実行レイヤー
Jentic Miniは、AIエージェントと外部APIの間に位置するセルフホスト型のAPIおよびアクション実行レイヤーで、認証情報を暗号化された保管庫に保存し、個別に取り消し可能なキーを持つスコープ付きツールキットを提供します。認証情報を追加すると、10,000以上のOpenAPI仕様とArazzoワークフローソースを自動的にインポートします。

Claude Fableデモ:ブラウザ自動化による積極的なバグ修正
Simon Willison氏は、Claude Fable 5が指示なしに水平スクロールバーのバグを自動デバッグした方法を説明しています。ブラウザ自動化、JavaScriptインジェクション、カスタムCORSウェブサーバーを使用しました。

スケールズ:Ollamaサポート搭載のデスクトップAIエージェント、300MBのアイドル時RAM
Skalesは、.exe/.dmgインストーラーを備えたネイティブElectronデスクトップアプリで、自律型AIエージェントを提供します。Ollamaと連携してローカル推論を行ったり、クラウドプロバイダーと連携したりでき、約300MBのアイドルRAMを使用し、データはローカルの~/.skales-dataに保存されます。

YantrikClawフォークは、ZeroClawに認知メモリ、コンパニオンモード、階層対応ツールを追加します。
YantrikClawは、ZeroClawのフォークであり、3つの主要機能を導入しています:永続的な意味的記憶のためのYantrikDBを備えた認知記憶、絆追跡と積極的行動を伴うコンパニオンモード、そしてRaspberry Piから大規模クラスターまでのモデルサイズに適応する階層対応ツール選択です。