EsoLang-Bench:LLMの推論をテストするための難解プログラミング言語を用いたコーディングベンチマーク

EsoLang-Benchは、大規模言語モデルが問題を真に推論できるか、単に学習データに対してパターンマッチングしているかをテストするために設計された新しいコーディングベンチマークです。このベンチマークは、学習データにほとんど存在しない難解プログラミング言語を使用しています。
ベンチマークの設計
このベンチマークは5つの難解プログラミング言語を使用します:Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeareです。これらの言語は、典型的な事前学習パイプラインにおいて学習データがほぼゼロであるため選ばれました。ベンチマークには、HumanEvalと同じアルゴリズム問題が同じ難易度範囲で含まれており、単にこれらの難解言語に翻訳されたものです。
テスト方法
研究者たちは5つのモデルをテストしました:GPT-5.2、O4-mini、Gemini 3 Pro、Qwen3-235B、Kimi K2です。以下の5つのプロンプト戦略を使用しました:
- 自己足場かけ
- コーダー-批評家ペア
- ReActパイプライン
結果
最高の単一結果は、Befunge-98での自己足場かけによる11.2%でした。中程度、困難、超困難の難易度問題は、すべてのモデル、言語、戦略で0%のままでした。Few-shotプロンプティングは平均でわずか+0.8パーセントポイントの向上しかなく、研究者はこれを統計的にノイズと区別できないと述べています。
Claude CodeやCodexなどのエージェントシステムは、非エージェントアプローチよりも2〜3倍優れた性能を示しましたが、この改善は主に、より鋭いフィードバックループとコンテキスト管理によるものであり、実際の推論転移の証拠ではありませんでした。
エラー分析
エラーの内訳は興味深いパターンを明らかにしています:
- Brainfuck(オンライン上にいくらか存在)では、モデルは有効な構文を生成できたが、論理で失敗した
- Whitespace(学習データがほぼない)では、モデルは有効なプログラムさえ生成できなかった
これは、ある程度事前学習データがある言語と、基本的にない言語でのモデルの性能に明確なギャップがあることを示しています。
目的と利用可能性
このベンチマークは、高いスコアを実際に偽装することが難しい評価を作成することを目指しており、Pythonのような主流言語でのより難しい問題を超えたものに移行しています。研究者は、このアプローチがベンチマークをゲームする経済的インセンティブが存在せず、良い性能への唯一の道が真の一般化学習である評価を作成すると示唆しています。
EsoLang-Benchは、新しい言語、新しい問題タイプ、または完全に異なる分布外ドメインを通じて、他の人が構築するためのテンプレートとして利用可能です。
📖 Read the full source: r/LocalLLaMA
👀 See Also

オープンクロー・エージェントのためのアイデンティティと評判レイヤー
開発者チームは、マルチステップのエージェントワークフローにおけるアイデンティティ消失の問題を解決するためにMCP-IとIdentiClawを構築し、さらに評判レジストリとしてknowthat.aiを開発しました。彼らはMCP-I仕様を分散型アイデンティティ財団に寄贈しました。

ベンチマーク結果:メモリシステム搭載のClaudeエージェントスウォームで、30〜43%のトークンコスト削減を実現
開発者が、Stompyと呼ばれるカスタムメモリシステムを使用した場合と使用しない場合で、6エージェントのClaudeスウォームを40ポイントのコーディングタスクでテストしました。結果によると、Sonnet 4.6はメモリを使用することで3.98ドルで完璧なスコアを達成したのに対し、メモリなしでは7.04ドルでした。一方、Haiku 4.5はメモリなしでは完全に失敗しましたが、メモリを使用すると39/40のスコアを獲得しました。

SiteTest.ai、ChatGPT・Perplexity・Gemini向けの無料AI可視性チェッカーをリリース
新しい無料ツールsitetest.aiは、168項目のGEO監査を実行し、実際のサーバー上でGPTBot、PerplexityBot、Google-Extendedを調査します。エンジンごとにA~Fの評価と、コピー&ペーストで使えるコード修正を提供します。

NarrateAI MCPサーバーデモで、Claudeが動画に音声解説を追加する様子を紹介
ライブデモでは、ClaudeがNarrateAI MCPサーバーを使用してURLから動画を自動的にナレーションし、非同期ポーリングを処理し、無音の画面録画を分析してナレーションを生成する様子が示されています。