EsoLang-Bench: Ein Programmier-Benchmark, der esoterische Sprachen verwendet, um das logische Denken von LLMs zu testen

EsoLang-Bench ist ein neuer Programmier-Benchmark, der testen soll, ob große Sprachmodelle Probleme tatsächlich durchdacht lösen oder lediglich Muster aus ihren Trainingsdaten abgleichen. Der Benchmark nutzt exotische Programmiersprachen, die in Trainingsdaten kaum vorkommen.
Benchmark-Design
Der Benchmark verwendet fünf exotische Programmiersprachen: Brainfuck, Befunge-98, Whitespace, Unlambda und Shakespeare. Diese Sprachen wurden ausgewählt, weil sie in typischen Vor-Trainings-Pipelines praktisch keine Trainingsdaten haben. Der Benchmark enthält dieselben algorithmischen Probleme wie HumanEval im gleichen Schwierigkeitsbereich, nur in diese exotischen Sprachen übersetzt.
Testmethodik
Die Forscher testeten fünf Modelle: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B und Kimi K2. Sie verwendeten fünf Prompting-Strategien, darunter:
- Selbstgestütztes Scaffolding
- Coder-Kritiker-Paare
- ReAct-Pipeline
Ergebnisse
Das beste Einzelergebnis war 11,2 % bei Befunge-98 mit selbstgestütztem Scaffolding. Probleme mittlerer, hoher und sehr hoher Schwierigkeit blieben bei 0 % über alle Modelle, Sprachen und Strategien hinweg. Few-Shot-Prompting brachte im Durchschnitt nur +0,8 Prozentpunkte, was die Forscher als statistisch nicht vom Rauschen unterscheidbar beschreiben.
Agenten-Systeme wie Claude Code und Codex schnitten 2-3 mal besser ab als nicht-agentische Ansätze, aber diese Verbesserung kam hauptsächlich von schärferen Feedback-Schleifen und besserem Kontextmanagement, nicht von Belegen für tatsächlichen Denktransfer.
Fehleranalyse
Die Fehleraufschlüsselung zeigt interessante Muster:
- Bei Brainfuck (das online etwas präsent ist) konnten Modelle gültige Syntax erzeugen, scheiterten aber an der Logik
- Bei Whitespace (das fast keine Trainingsdaten hat) konnten Modelle nicht einmal gültige Programme erzeugen
Dies zeigt eine deutliche Kluft zwischen der Leistung der Modelle bei Sprachen mit etwas Vor-Trainings-Daten gegenüber solchen mit praktisch keinen.
Zweck und Verfügbarkeit
Der Benchmark zielt darauf ab, Bewertungen zu schaffen, bei denen hohe Punktzahlen tatsächlich schwer zu fälschen sind, und geht damit über bloß schwierigere Probleme in gängigen Sprachen wie Python hinaus. Die Forscher schlagen vor, dass dieser Ansatz Bewertungen schafft, bei denen der wirtschaftliche Anreiz, den Benchmark zu manipulieren, nicht existiert und der einzige Weg zu guter Leistung echtes Lernen zur Verallgemeinerung ist.
EsoLang-Bench ist als Vorlage für andere verfügbar, um darauf aufzubauen, sei es durch neue Sprachen, neue Problemtypen oder völlig andere Bereiche außerhalb der Verteilung.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

AgentMail-Gründer erläutert agentennatives Onboarding nachdem OpenClaw CAPTCHA-Block aufdeckte
AgentMail, eine E-Mail-API für KI-Agenten, hat seinen Onboarding-Prozess neu aufgebaut, nachdem sein eigener OpenClaw-Agent an einem Cloudflare-CAPTCHA gescheitert war. Das neue System bietet einen einzigen REST-Endpunkt für die programmatische Kontenerstellung, während Menschen für die Verifizierung im Prozess bleiben.

AlphaCreek: Ein MCP-Server, der SEC-Einreichungen in Chunks aufteilt, um die Token-Nutzung um 85 % zu reduzieren
AlphaCreek ist ein kostenloser MCP-Konnektor für Claude, der den Tokenverbrauch bei SEC-Einreichungen um etwa 85 % reduziert, indem zuerst ein Inhaltsverzeichnis zurückgegeben und dann nur die vom Agenten angeforderten Abschnitte abgerufen werden.

AutoSkillUpdate: Ein Claude-Code-Plugin, das veraltete Fähigkeiten erkennt
AutoSkillUpdate ist ein Open-Source-Claude-Code-Plugin, das Ihre Codebasis scannt, sie mit vorhandenen Skills vergleicht und Abweichungen identifiziert. Es liefert Abweichungsberichte mit Dateipfaden und Zeilenreferenzen und bietet dann an, veraltete Skills nach Benutzerbestätigung neu zu schreiben.

Jan fügt Ein-Klick-OpenClaw-Installation mit Jan-v3-Base-Modell-Integration hinzu
Jan unterstützt jetzt die Ein-Klick-Installation von OpenClaw mit direkter Integration in das Jan-v3-Basismodell, wobei alle Vorgänge lokal und privat auf Ihrem Computer bleiben.