Детерминированная архитектура компилятора для многошаговых LLM-процессов демонстрирует высокие результаты в тестах.

Детерминированная компиляция для рабочих процессов LLM
Разработчик экспериментирует с детерминированной архитектурой компиляции для структурированных рабочих процессов LLM. Вместо того чтобы позволять модели планировать и выполнять всё авторегрессивно, система компилирует граф рабочего процесса заранее, используя типизированные реестры узлов, контракты параметров и статическую валидацию.
Цель — предотвратить накопление ошибок, которое обычно возникает в более глубоких многошаговых цепочках. Этот подход представляет собой переход от чисто авторегрессивного выполнения к более структурированной, предварительно скомпилированной системе рабочих процессов.
Результаты бенчмарков
Разработчик провёл бенчмарки для глубины рабочих процессов от 3 до 12+ узлов и сравнил с базовым промптингом на GPT-4.1 и Claude Sonnet 4.6:
- Рабочие процессы на 3-5 узлов: Компилятор: 1.00, базовый GPT-4.1: 0.76, Claude Sonnet 4.6: 0.60
- 5-8 узлов: Компилятор: 1.00, GPT-4.1: 0.72, Claude: 0.46
- 8-10 узлов: Компилятор: 0.88, GPT-4.1: 0.68, Claude: 0.54
- 10+ узлов: Компилятор: 0.96, GPT-4.1: 0.76, Claude: 0.72
Архитектура компилятора сохраняла идеальную производительность до 8 узлов, показывая лишь незначительное снижение на 8-10 узлах, прежде чем вернуться к почти идеальной производительности на 10+ узлах. В то же время и GPT-4.1, и Claude демонстрировали последовательное снижение производительности по мере увеличения глубины рабочего процесса.
Статус проекта
Статья скоро появится на arXiv, но страница проекта была опубликована досрочно для тех, кто интересуется подходом или хочет оценить исследование. Страница проекта доступна по адресу: https://prnvh.github.io/compiler.html
Этот подход может быть особенно полезен разработчикам, создающим сложные многошаговые AI-рабочие процессы, где накопление ошибок в традиционных авторегрессивных подходах становится проблемой. Модель детерминированной компиляции обеспечивает более предсказуемое поведение и потенциально лучшую обработку ошибок в сложных цепочках.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Локальная система памяти MCP с консолидацией для AI-диалогов
Разработчик создал MCP-сервер, предоставляющий постоянную локальную память для AI-клиентов, используя Qwen 2.5-7B для консолидации диалогов в структурированные документы знаний каждые 6 часов. Система полностью работает на вашем оборудовании с семантическим дедуплицированием, адаптивной оценкой и векторным поиском FAISS.

Код Клода переписывает SQL-парсер PostHog с ускорением в 70 раз – как работают тестирование на основе свойств и параллельные агенты
PostHog использовал несколько параллельных сессий Claude Code для переписывания своего SQL-парсера, добившись ускорения в 70 раз. Новый парсер — это 16 тысяч строк кода ручного рекурсивного спуска с property-based тестированием.

Система антител: внешний сторожевой таймер для агентов OpenClaw
Система Antibody — это система мониторинга с открытым исходным кодом, которая работает на отдельной машине и отслеживает агентов OpenClaw через SSH, реализуя многоуровневые реакции от обнаружения до восстановления сервиса. Она спроектирована так, чтобы переживать сбои, которые выводят из строя основного агента.

Rails создан для ИИ: Соглашения, Эффективность токенов и Результаты бенчмарков
Соглашения Rails дают ИИ-агентам карту, сокращая токены и повышая точность. Бенчмарк показывает OPUS-5 с точностью 92.1% и 47k токенов за запуск.