EsoLang-Bench: Бенчмарк для программирования с использованием эзотерических языков для проверки логики языковых моделей

✍️ OpenClawRadar📅 Опубликовано: 16 марта 2026 г.🔗 Source
EsoLang-Bench: Бенчмарк для программирования с использованием эзотерических языков для проверки логики языковых моделей
Ad

EsoLang-Bench — это новый кодирующий бенчмарк, разработанный для проверки того, могут ли большие языковые модели действительно рассуждать при решении задач или просто сопоставлять шаблоны с обучающими данными. Бенчмарк использует эзотерические языки программирования с минимальным присутствием в обучающих данных.

Дизайн бенчмарка

Бенчмарк использует пять эзотерических языков программирования: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Эти языки были выбраны потому, что в типичных конвейерах предварительного обучения для них практически нет обучающих данных. Бенчмарк содержит те же алгоритмические задачи, что и HumanEval, в том же диапазоне сложности, просто переведённые на эти эзотерические языки.

Методология тестирования

Исследователи протестировали пять моделей: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B и Kimi K2. Они использовали пять стратегий промптинга, включая:

  • Самоскаффолдинг
  • Пары «кодер-критик»
  • Конвейер ReAct

Результаты

Лучший единичный результат составил 11,2% на Befunge-98 с самоскаффолдингом. Задачи средней, высокой и сверхвысокой сложности оставались на уровне 0% для всех моделей, языков и стратегий. Фью-шот промптинг дал в среднем лишь +0,8 процентных пункта, что исследователи описывают как статистически неотличимое от шума.

Агентские системы, такие как Claude Code и Codex, показали результат в 2-3 раза лучше, чем неагентские подходы, но это улучшение в основном было связано с более точными циклами обратной связи и управлением контекстом, а не с доказательствами реального переноса способности рассуждать.

Ad

Анализ ошибок

Разбор ошибок выявляет интересные закономерности:

  • На Brainfuck (который имеет некоторое присутствие в сети) модели могли генерировать корректный синтаксис, но терпели неудачу в логике
  • На Whitespace (для которого практически нет обучающих данных) модели не могли даже сгенерировать валидные программы вообще

Это показывает чёткий разрыв между производительностью моделей на языках с некоторыми данными предварительного обучения и на тех, у которых их практически нет.

Цель и доступность

Цель бенчмарка — создать оценки, в которых высокие баллы действительно сложно подделать, выходя за рамки просто более сложных задач на популярных языках, таких как Python. Исследователи предполагают, что этот подход создаёт оценки, в которых экономический стимул для манипулирования бенчмарком отсутствует, и единственный путь к хорошей производительности — это настоящее умение обобщать.

EsoLang-Bench доступен как шаблон для дальнейшего развития другими, будь то через новые языки, новые типы задач или совершенно другие домены вне распределения.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Создание саморазвивающейся системы знаний с помощью Claude Code и Obsidian
Инструменты

Создание саморазвивающейся системы знаний с помощью Claude Code и Obsidian

Разработчик создал систему из 25 инструментов, которая обеспечивает Claude Code постоянную память через семантический поиск, графы знаний и интервальное повторение на основе хранилища Obsidian. Система индексирует контент с помощью эмбеддингов bge-m3, обнаруживает противоречия, автоматически удаляет устаревшие заметки и генерирует карты Obsidian Canvas.

OpenClawRadar
Монитор использования Claude: Бесплатное приложение для macOS в строке меню для отслеживания лимитов Claude.ai
Инструменты

Монитор использования Claude: Бесплатное приложение для macOS в строке меню для отслеживания лимитов Claude.ai

Разработчик создал Claude Usage Monitor — бесплатное приложение для macOS в строке меню, которое отображает использование Claude.ai с помощью цветных значков, счетчиков в реальном времени и таймеров сброса. Приложение считывает данные напрямую из сессий Claude.ai, не требуя API-ключа.

OpenClawRadar
cc-lens: Локальная панель управления для анализа сессий кода Claude
Инструменты

cc-lens: Локальная панель управления для анализа сессий кода Claude

Разработчик создал cc-lens — локальную панель управления, которая читает файлы сессий Claude Code из ~/.claude/ и предоставляет аналитику использования, отслеживание затрат и воспроизведение сессий. Она работает полностью на вашем компьютере без облачной синхронизации, регистрации или телеметрии.

OpenClawRadar
Настройка OpenClaw в UTM-виртуальной машине Ubuntu с доступом к LLM API и Ollama
Инструменты

Настройка OpenClaw в UTM-виртуальной машине Ubuntu с доступом к LLM API и Ollama

Пользователь успешно настроил OpenClaw в изолированной виртуальной машине Ubuntu на Mac с процессором M3, получив доступ как к локальному Ollama на macOS, так и к внешним API LLM, таким как Gemini, Claude и DeepSeek. Примеры файлов конфигурации и заметки по устранению неполадок доступны на GitHub.

OpenClawRadar