Основатели Codestrap критикуют метрики ИИ-кодирования и предупреждают о проблемах с качеством.

Дориан Смайли и Коннор Дикс, основатели консалтинговой службы по ИИ Codestrap, утверждают, что корпоративные организации сталкиваются с трудностями при эффективном внедрении ИИ, поскольку не существует устоявшегося руководства по эталонным архитектурам или вариантам использования. Они считают, что многие компании лишь делают вид, что имеют стратегии по ИИ, при этом не имея надлежащих циклов обратной связи для измерения реального воздействия.
Проблемные метрики и ошибочные результаты
Смайли заявляет, что текущая оценка ИИ в программировании фокусируется на неверных метриках: «Строки кода, количество [пул-реквестов] — это обязательства. Это не меры инженерного совершенства». В качестве правильных инженерных метрик он называет частоту развертывания, время выполнения до выпуска в продакшн, процент неудачных изменений, среднее время восстановления и серьезность инцидентов.
Чтобы проиллюстрировать последствия плохого измерения, Смайли приводит пример недавней попытки переписать SQLite на Rust с помощью ИИ: «Он прошел все модульные тесты, структура кода выглядит правильно. Но это на 3,7 раза больше строк кода, который работает в 2000 раз хуже, чем оригинальный SQLite. В две тысячи раз хуже для базы данных — это нежизнеспособный продукт».
Фундаментальные ограничения больших языковых моделей
Дикс указывает на фундаментальные проблемы текущей технологии больших языковых моделей: «Их сложно обучать новым фактам. Сложно надежно извлекать факты. Прямой проход через нейронные сети недетерминирован, особенно когда у вас есть модели рассуждений, которые задействуют внутренний монолог для повышения эффективности предсказания следующего токена, а это значит, что вы будете получать разные ответы каждый раз».
Смайли добавляет: «И у них нет способностей к индуктивному мышлению. Модель не может проверить свою собственную работу. Она не знает, правильный ли ответ дала. Это фундаментальные проблемы, которые никто не решил в технологии больших языковых моделей».
Предлагаемый новый подход к измерению
Основатели выступают за разработку новых метрик, специально предназначенных для инженерии с помощью ИИ. Смайли предлагает одну возможную метрику: «измерение потраченных токенов для получения одобренного пул-реквеста — формально принятого изменения в программном обеспечении». Он подчеркивает, что организациям необходимо экспериментировать и итеративно улучшать в циклах обратной связи, потому что «ИИ все еще работает не очень хорошо» даже в контексте программирования.
Дикс ссылается на недавние сбои в Amazon и AWS как на индикаторы потенциальных будущих проблем, хотя Amazon заявил, что эти инциденты не связаны с ИИ.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Изменения в системном промпте Claude Opus 4.7: Переименование платформы, интеграция инструментов и обновления поведения
Anthropic обновила системный промпт Claude Opus с версии 4.6 (5 февраля 2026 года) до 4.7 (16 апреля 2026 года), переименовав 'платформу для разработчиков' в 'Claude Platform', добавив Claude в Powerpoint в список инструментов, расширив инструкции по безопасности детей и внедрив новые поведенческие рекомендации по использованию инструментов и краткости ответов.

GitHub Copilot обновляет политику использования данных для обучения моделей.
GitHub начнет использовать данные взаимодействия пользователей Copilot Free, Pro и Pro+ для обучения моделей искусственного интеллекта с 24 апреля 2026 года, если пользователи не откажутся от этого. Пользователи Copilot Business и Enterprise не затронуты этим изменением.

调查:Claude Code代理因压缩更改展示未经验证的MEMORY.md内容
Пользователь сообщает, что агенты Claude Code извлекают содержимое из MEMORY.md без повторной проверки в середине задачи, что связано с изменениями в уплотнении в версиях 2.1.139 и 2.1.141. Два усугубляющих фактора: агрессивное сохранение «инструкций пользователя» и ошибка в порогах автокомпактизации.

Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок
Claude Code v2.1.216 добавляет sandbox.filesystem.disabled для выборочной изоляции, исправляет квадратичное замедление нормализации сообщений в длительных сессиях и устраняет более 30 ошибок, включая проблемы с OAuth и изоляцией worktree.