LamBench: Набор тестов лямбда-исчисления для агентов ИИ-кодирования

✍️ OpenClawRadar📅 Опубликовано: 25 апреля 2026 г.🔗 Source
LamBench: Набор тестов лямбда-исчисления для агентов ИИ-кодирования
Ad

Виктор Тэлин выпустил LamBench v1 — эталонный фреймворк для проверки ИИ-агентов на задачах лямбда-исчисления. Проект размещён на GitHub по адресу github.com/VictorTaelin/LamBench, также доступен сайт victortaelin.github.io/lambench/.

Ключевые детали

  • Метрики: тест оценивает три параметра: :intelligence, :speed и :elegance.
  • Компоненты: набор :problems (задач) и :matrix (матрица для оценки результатов).
  • Версия: v1 (первый релиз).

LamBench — часть более масштабной работы Тэлина по созданию строгих методов оценки ИИ-систем в символьных вычислениях. Для контекста: лямбда-исчисление — это формальная система в математической логике и информатике, часто используемая для проверки способности к рассуждению и функциональному программированию — поэтому данный бенчмарк особенно актуален для ИИ-агентов, работающих с символьными манипуляциями, рекурсией и функциями высшего порядка.

Ad

Для кого это

Для ИИ-исследователей и разработчиков, создающих или оценивающих агентов для написания кода, особенно тех, кто работает с функциональным программированием или задачами символьного рассуждения.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Реестр AbsolutelySkilled пополнился 156 готовыми к использованию навыками для Claude Code.
Инструменты

Реестр AbsolutelySkilled пополнился 156 готовыми к использованию навыками для Claude Code.

Разработчик создал AbsolutelySkilled — реестр из 156 структурированных модулей навыков для Claude Code, которые сохраняются между сессиями. Каждый навык включает условия запуска, справочные файлы, тестовые случаи и антипаттерны в файлах SKILL.md.

OpenClawRadar
Результаты тестирования: система агентов Claude с памятью демонстрирует экономию токенов на 30-43%
Инструменты

Результаты тестирования: система агентов Claude с памятью демонстрирует экономию токенов на 30-43%

Разработчик протестировал рой из 6 агентов Claude на задаче по кодированию из 40 пунктов с использованием пользовательской системы памяти Stompy и без неё. Результаты показали, что Sonnet 4.6 с памятью достиг идеального результата за $3,98 против $7,04 без памяти, в то время как Haiku 4.5 полностью провалился без памяти, но набрал 39/40 с её использованием.

OpenClawRadar
Плагин SLOP добавляет агентам OpenClaw осведомленность о состоянии приложений в реальном времени.
Инструменты

Плагин SLOP добавляет агентам OpenClaw осведомленность о состоянии приложений в реальном времени.

Новый плагин OpenClaw интегрируется с SLOP (State Layer for Observable Programs), предоставляя ИИ-агентам структурированный доступ к состоянию приложений и контекстным действиям. Плагин автоматически обнаруживает приложения с поддержкой SLOP через каталог ~/.slop/providers/ и мост расширения Chrome.

OpenClawRadar
Расширение RelayCode для VS Code направляет код Claude через суверенные RDU.
Инструменты

Расширение RelayCode для VS Code направляет код Claude через суверенные RDU.

OpenGPU выпустила RelayCode — расширение для VS Code, которое работает как локальный прокси для маршрутизации запросов от Claude Code или Copilot через их децентрализованную сеть к открытым моделям, таким как DeepSeek-R1 и MiniMax M2.5, работающим на суверенных реконфигурируемых блоках потоковой обработки данных.

OpenClawRadar