LamBench: Набор тестов лямбда-исчисления для агентов ИИ-кодирования

Виктор Тэлин выпустил LamBench v1 — эталонный фреймворк для проверки ИИ-агентов на задачах лямбда-исчисления. Проект размещён на GitHub по адресу github.com/VictorTaelin/LamBench, также доступен сайт victortaelin.github.io/lambench/.
Ключевые детали
- Метрики: тест оценивает три параметра:
:intelligence,:speedи:elegance. - Компоненты: набор
:problems(задач) и:matrix(матрица для оценки результатов). - Версия: v1 (первый релиз).
LamBench — часть более масштабной работы Тэлина по созданию строгих методов оценки ИИ-систем в символьных вычислениях. Для контекста: лямбда-исчисление — это формальная система в математической логике и информатике, часто используемая для проверки способности к рассуждению и функциональному программированию — поэтому данный бенчмарк особенно актуален для ИИ-агентов, работающих с символьными манипуляциями, рекурсией и функциями высшего порядка.
Для кого это
Для ИИ-исследователей и разработчиков, создающих или оценивающих агентов для написания кода, особенно тех, кто работает с функциональным программированием или задачами символьного рассуждения.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Реестр AbsolutelySkilled пополнился 156 готовыми к использованию навыками для Claude Code.
Разработчик создал AbsolutelySkilled — реестр из 156 структурированных модулей навыков для Claude Code, которые сохраняются между сессиями. Каждый навык включает условия запуска, справочные файлы, тестовые случаи и антипаттерны в файлах SKILL.md.

Результаты тестирования: система агентов Claude с памятью демонстрирует экономию токенов на 30-43%
Разработчик протестировал рой из 6 агентов Claude на задаче по кодированию из 40 пунктов с использованием пользовательской системы памяти Stompy и без неё. Результаты показали, что Sonnet 4.6 с памятью достиг идеального результата за $3,98 против $7,04 без памяти, в то время как Haiku 4.5 полностью провалился без памяти, но набрал 39/40 с её использованием.

Плагин SLOP добавляет агентам OpenClaw осведомленность о состоянии приложений в реальном времени.
Новый плагин OpenClaw интегрируется с SLOP (State Layer for Observable Programs), предоставляя ИИ-агентам структурированный доступ к состоянию приложений и контекстным действиям. Плагин автоматически обнаруживает приложения с поддержкой SLOP через каталог ~/.slop/providers/ и мост расширения Chrome.

Расширение RelayCode для VS Code направляет код Claude через суверенные RDU.
OpenGPU выпустила RelayCode — расширение для VS Code, которое работает как локальный прокси для маршрутизации запросов от Claude Code или Copilot через их децентрализованную сеть к открытым моделям, таким как DeepSeek-R1 и MiniMax M2.5, работающим на суверенных реконфигурируемых блоках потоковой обработки данных.