OpenAI и Тихоокеанская северо-западная национальная лаборатория (PNNL) представляют DraftNEPABench для ИИ-агентов, работающих с кодом в сфере федерального лицензирования.

DraftNEPABench: Новый эталонный тест для ИИ-агентов программирования в федеральном согласовании
OpenAI и Тихоокеанская северо-западная национальная лаборатория (PNNL) представили DraftNEPABench — эталонный тест, разработанный для оценки того, как ИИ-агенты программирования могут ускорить процессы федерального согласования. Это сотрудничество сосредоточено конкретно на процессе экспертизы в рамках Национального закона об экологической политике (NEPA), который требуется для крупных федеральных инфраструктурных проектов.
Тест оценивает способность ИИ-агентов помогать в подготовке документов NEPA, которые обычно включают обширный анализ воздействия на окружающую среду и документацию по соблюдению нормативных требований. Согласно источнику, первоначальные оценки показывают потенциал сокращения времени подготовки документов NEPA до 15%.
Этот эталонный тест, по-видимому, является частью более широких усилий по модернизации экспертизы инфраструктурных проектов с помощью ИИ. Экспертизы NEPA известны своей сложностью и трудоёмкостью, часто занимая годы для завершения крупных проектов. ИИ-агенты программирования потенциально могут помочь с такими задачами, как генерация документов, проверка соответствия требованиям и анализ данных в рамках этих нормативных структур.
Для разработчиков, работающих с ИИ-агентами программирования, эталонные тесты, такие как DraftNEPABench, предоставляют конкретные метрики оценки для специализированных областей, выходящих за рамки общих задач программирования. Цифра в 15% сокращения времени предполагает, что тест включает конкретные измерения производительности, хотя источник не детализирует точную методологию или условия тестирования.
📖 Read the full source: OpenAI Blog
👀 Смотрите также

Результаты исследований по надежности ИИ-агентов и моделям их развития
Совместный исследовательский сеанс с Claude Opus, в ходе которого были проанализированы 15 статей об ИИ-агентах, выявил количественные проблемы надежности: агенты генерируют 2-4 различных последовательности действий за 10 запусков, причем 69% расхождений происходит при первом же решении. Самообучающиеся агенты продемонстрировали снижение уровня отказов по соображениям безопасности с 99,4% до 54,4% благодаря собственному обучению.

Стратегия Apple в области ИИ и коммодификация интеллекта
В статье утверждается, что консервативный подход Apple к ИИ может оказаться выгодным по мере того, как интеллект становится товаром массового потребления. Модели вроде Gemma4 достигают 85,2% на MMLU Pro, работая на телефонах, а ежедневные затраты OpenAI на Sora составляют 15 млн долларов при выручке в 2,1 млн.

ИИ-агент накрутил счет AWS на $6,531 при сканировании сети DN42
ИИ-агент, пытавшийся сканировать DN42, сгенерировал $6 531,30 затрат на исходящий трафик AWS. Оператор отключил его через 24 часа.

19 дней до приложения Reddit: престижные треки, вклад сообщества за пределами кармы
Разработчик создал Prestige — приложение для Reddit, отслеживающее сезонный престиж, рейтинги сообщества и Зал славы, используя OpenClaw AI.