EsoLang-Bench: Бенчмарк для программирования с использованием эзотерических языков для проверки логики языковых моделей

EsoLang-Bench — это новый кодирующий бенчмарк, разработанный для проверки того, могут ли большие языковые модели действительно рассуждать при решении задач или просто сопоставлять шаблоны с обучающими данными. Бенчмарк использует эзотерические языки программирования с минимальным присутствием в обучающих данных.
Дизайн бенчмарка
Бенчмарк использует пять эзотерических языков программирования: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Эти языки были выбраны потому, что в типичных конвейерах предварительного обучения для них практически нет обучающих данных. Бенчмарк содержит те же алгоритмические задачи, что и HumanEval, в том же диапазоне сложности, просто переведённые на эти эзотерические языки.
Методология тестирования
Исследователи протестировали пять моделей: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B и Kimi K2. Они использовали пять стратегий промптинга, включая:
- Самоскаффолдинг
- Пары «кодер-критик»
- Конвейер ReAct
Результаты
Лучший единичный результат составил 11,2% на Befunge-98 с самоскаффолдингом. Задачи средней, высокой и сверхвысокой сложности оставались на уровне 0% для всех моделей, языков и стратегий. Фью-шот промптинг дал в среднем лишь +0,8 процентных пункта, что исследователи описывают как статистически неотличимое от шума.
Агентские системы, такие как Claude Code и Codex, показали результат в 2-3 раза лучше, чем неагентские подходы, но это улучшение в основном было связано с более точными циклами обратной связи и управлением контекстом, а не с доказательствами реального переноса способности рассуждать.
Анализ ошибок
Разбор ошибок выявляет интересные закономерности:
- На Brainfuck (который имеет некоторое присутствие в сети) модели могли генерировать корректный синтаксис, но терпели неудачу в логике
- На Whitespace (для которого практически нет обучающих данных) модели не могли даже сгенерировать валидные программы вообще
Это показывает чёткий разрыв между производительностью моделей на языках с некоторыми данными предварительного обучения и на тех, у которых их практически нет.
Цель и доступность
Цель бенчмарка — создать оценки, в которых высокие баллы действительно сложно подделать, выходя за рамки просто более сложных задач на популярных языках, таких как Python. Исследователи предполагают, что этот подход создаёт оценки, в которых экономический стимул для манипулирования бенчмарком отсутствует, и единственный путь к хорошей производительности — это настоящее умение обобщать.
EsoLang-Bench доступен как шаблон для дальнейшего развития другими, будь то через новые языки, новые типы задач или совершенно другие домены вне распределения.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

API браузера WebMCP могут сократить потребность в веб-скрапинге для ИИ-агентов.
Google WebMCP представляет API браузера, которые позволяют веб-сайтам регистрировать инструменты для прямого вызова AI-агентами, что потенциально устраняет большую часть парсинга DOM и обходов антибот-систем, которые сейчас создают разработчики.

Клод AI оценивает каждый стартап YC Spring 2026 — полная сводка конвейера
Пользователь Reddit запустил Claude для каждой стартап-компании YC Spring 2026, собирая данные из LinkedIn и прессы, чтобы присвоить рейтинг от S до D. Большинство получили оценку B или C.

Сделай Дело: Мета-система промптов для ИИ-агентов в программировании
Get Shit Done — это система мета-промптов, инженерии контекста и разработки на основе спецификаций, которая работает с Claude Code, OpenCode, Gemini CLI, Codex, Copilot и Antigravity. Она решает проблему «гниения контекста» за счёт структурированных промптов и рабочих процессов проверки.

Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Среда выполнения Krasis LLM теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации, достигая ускорения предварительного заполнения в 8,9 раза и декодирования в 4,7 раза по сравнению с llama.cpp на Qwen3.5-122B с использованием одного GPU 5090.