EsoLang-Bench: Ein Programmier-Benchmark, der esoterische Sprachen verwendet, um das logische Denken von LLMs zu testen

EsoLang-Bench ist ein neuer Programmier-Benchmark, der testen soll, ob große Sprachmodelle Probleme tatsächlich durchdacht lösen oder lediglich Muster aus ihren Trainingsdaten abgleichen. Der Benchmark nutzt exotische Programmiersprachen, die in Trainingsdaten kaum vorkommen.
Benchmark-Design
Der Benchmark verwendet fünf exotische Programmiersprachen: Brainfuck, Befunge-98, Whitespace, Unlambda und Shakespeare. Diese Sprachen wurden ausgewählt, weil sie in typischen Vor-Trainings-Pipelines praktisch keine Trainingsdaten haben. Der Benchmark enthält dieselben algorithmischen Probleme wie HumanEval im gleichen Schwierigkeitsbereich, nur in diese exotischen Sprachen übersetzt.
Testmethodik
Die Forscher testeten fünf Modelle: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B und Kimi K2. Sie verwendeten fünf Prompting-Strategien, darunter:
- Selbstgestütztes Scaffolding
- Coder-Kritiker-Paare
- ReAct-Pipeline
Ergebnisse
Das beste Einzelergebnis war 11,2 % bei Befunge-98 mit selbstgestütztem Scaffolding. Probleme mittlerer, hoher und sehr hoher Schwierigkeit blieben bei 0 % über alle Modelle, Sprachen und Strategien hinweg. Few-Shot-Prompting brachte im Durchschnitt nur +0,8 Prozentpunkte, was die Forscher als statistisch nicht vom Rauschen unterscheidbar beschreiben.
Agenten-Systeme wie Claude Code und Codex schnitten 2-3 mal besser ab als nicht-agentische Ansätze, aber diese Verbesserung kam hauptsächlich von schärferen Feedback-Schleifen und besserem Kontextmanagement, nicht von Belegen für tatsächlichen Denktransfer.
Fehleranalyse
Die Fehleraufschlüsselung zeigt interessante Muster:
- Bei Brainfuck (das online etwas präsent ist) konnten Modelle gültige Syntax erzeugen, scheiterten aber an der Logik
- Bei Whitespace (das fast keine Trainingsdaten hat) konnten Modelle nicht einmal gültige Programme erzeugen
Dies zeigt eine deutliche Kluft zwischen der Leistung der Modelle bei Sprachen mit etwas Vor-Trainings-Daten gegenüber solchen mit praktisch keinen.
Zweck und Verfügbarkeit
Der Benchmark zielt darauf ab, Bewertungen zu schaffen, bei denen hohe Punktzahlen tatsächlich schwer zu fälschen sind, und geht damit über bloß schwierigere Probleme in gängigen Sprachen wie Python hinaus. Die Forscher schlagen vor, dass dieser Ansatz Bewertungen schafft, bei denen der wirtschaftliche Anreiz, den Benchmark zu manipulieren, nicht existiert und der einzige Weg zu guter Leistung echtes Lernen zur Verallgemeinerung ist.
EsoLang-Bench ist als Vorlage für andere verfügbar, um darauf aufzubauen, sei es durch neue Sprachen, neue Problemtypen oder völlig andere Bereiche außerhalb der Verteilung.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

AI mit kleinen Bots erkunden: Künstliche Intelligenz-Agenten durch Nanobot-Tutoren verstehen
Ein Mitglied der OpenClaw-Community teilt Einblicke in den 'Nanobot Tutor', ein kompaktes Framework, das darauf abzielt, die Funktionsweise von KI-Agenten zu entmystifizieren. Entdecken Sie, wie das Eintauchen in diese kompakte Lernumgebung die Arbeitsweise intelligenter Agenten enthüllt.

Spectyra Plugin für OpenClaw: Echtzeit-KI-Kostenoptimierung durch Analyse des vollständigen Anfrageflusses
Das Spectyra-Plugin senkt die Kosten von KI-APIs, indem es verborgene Verschwendung wie wiederholte Aufrufe, übermäßigen Kontext und teure Fehlnutzung von Modellen in Echtzeit aufdeckt.

Lokale KI-Entwicklung mit Qwen3.6-27B und Opencode auf einer 5090
Ein Reddit-Nutzer berichtet über seinen Wechsel von cloudbasierten KI-Coding-Tools (Claude Code, Cursor) zu einem lokalen Setup mit Opencode + llama-server + Qwen3.6-27B bei 128K Kontext auf einer einzelnen RTX 5090 und hebt die Freiheit von Nutzungslimits und Account-Risiken hervor.

Rote Königin: Ein deterministischer Orchestrator, der Claude Code als Worker-Pool ausführt
Red Queen nutzt eine Zustandsmaschine, um Claude-Code-Subprozesse zu orchestrieren, wodurch LLM-Routing-Fehler und Token-Verschwendung durch Mega-Prompts vermieden werden.