OpenAI и Тихоокеанская северо-западная национальная лаборатория (PNNL) представляют DraftNEPABench для ИИ-агентов, работающих с кодом в сфере федерального лицензирования.

DraftNEPABench: Новый эталонный тест для ИИ-агентов программирования в федеральном согласовании
OpenAI и Тихоокеанская северо-западная национальная лаборатория (PNNL) представили DraftNEPABench — эталонный тест, разработанный для оценки того, как ИИ-агенты программирования могут ускорить процессы федерального согласования. Это сотрудничество сосредоточено конкретно на процессе экспертизы в рамках Национального закона об экологической политике (NEPA), который требуется для крупных федеральных инфраструктурных проектов.
Тест оценивает способность ИИ-агентов помогать в подготовке документов NEPA, которые обычно включают обширный анализ воздействия на окружающую среду и документацию по соблюдению нормативных требований. Согласно источнику, первоначальные оценки показывают потенциал сокращения времени подготовки документов NEPA до 15%.
Этот эталонный тест, по-видимому, является частью более широких усилий по модернизации экспертизы инфраструктурных проектов с помощью ИИ. Экспертизы NEPA известны своей сложностью и трудоёмкостью, часто занимая годы для завершения крупных проектов. ИИ-агенты программирования потенциально могут помочь с такими задачами, как генерация документов, проверка соответствия требованиям и анализ данных в рамках этих нормативных структур.
Для разработчиков, работающих с ИИ-агентами программирования, эталонные тесты, такие как DraftNEPABench, предоставляют конкретные метрики оценки для специализированных областей, выходящих за рамки общих задач программирования. Цифра в 15% сокращения времени предполагает, что тест включает конкретные измерения производительности, хотя источник не детализирует точную методологию или условия тестирования.
📖 Read the full source: OpenAI Blog
👀 Смотрите также

Проблема с UX в Claude Cowork: Постоянное поле ввода создает ложные ожидания непрерывности
Пользователь выявил проблему UX в Claude Cowork, где постоянное поле ввода текста сохраняет черновик при переключении между задачами, но сбрасывает контекст и теряет вложения, создавая противоречивые сигналы о непрерывности.

Уточнение возможностей автоматизации OpenClaw
OpenClaw не выполняет полностью автоматизированные задачи самостоятельно; ему требуется руководство пользователя для настройки, действуя больше как традиционная языковая модель.
Статус Claude: повышенное количество ошибок во всех моделях — устранено
29 июля 2026 года сервис Claude от Anthropic испытывал повышенные ошибки во всех моделях. Инцидент длился с 19:45 UTC до 21:26 UTC, и на официальной странице статуса он отмечен как разрешенный. Вот хронология и что вам нужно знать, если вы пострадали.

Claude Code берется за удаление большого блокировщика ядра QNX, начиная со статистики конфликтов в пользовательском пространстве
Разработчик попросил Claude Code перепроектировать микроядро QNX для удаления Big Kernel Lock. Claude оценил работу в 3 месяца для топ-человека-разработчика, после чего начал с разработки статистики блокировок, аналогичной /proc, и последовательного исправления подсистем ядра.