Основатели Codestrap критикуют метрики ИИ-кодирования и предупреждают о проблемах с качеством.

✍️ OpenClawRadar📅 Опубликовано: 19 марта 2026 г.🔗 Source
Основатели Codestrap критикуют метрики ИИ-кодирования и предупреждают о проблемах с качеством.
Ad

Дориан Смайли и Коннор Дикс, основатели консалтинговой службы по ИИ Codestrap, утверждают, что корпоративные организации сталкиваются с трудностями при эффективном внедрении ИИ, поскольку не существует устоявшегося руководства по эталонным архитектурам или вариантам использования. Они считают, что многие компании лишь делают вид, что имеют стратегии по ИИ, при этом не имея надлежащих циклов обратной связи для измерения реального воздействия.

Проблемные метрики и ошибочные результаты

Смайли заявляет, что текущая оценка ИИ в программировании фокусируется на неверных метриках: «Строки кода, количество [пул-реквестов] — это обязательства. Это не меры инженерного совершенства». В качестве правильных инженерных метрик он называет частоту развертывания, время выполнения до выпуска в продакшн, процент неудачных изменений, среднее время восстановления и серьезность инцидентов.

Чтобы проиллюстрировать последствия плохого измерения, Смайли приводит пример недавней попытки переписать SQLite на Rust с помощью ИИ: «Он прошел все модульные тесты, структура кода выглядит правильно. Но это на 3,7 раза больше строк кода, который работает в 2000 раз хуже, чем оригинальный SQLite. В две тысячи раз хуже для базы данных — это нежизнеспособный продукт».

Ad

Фундаментальные ограничения больших языковых моделей

Дикс указывает на фундаментальные проблемы текущей технологии больших языковых моделей: «Их сложно обучать новым фактам. Сложно надежно извлекать факты. Прямой проход через нейронные сети недетерминирован, особенно когда у вас есть модели рассуждений, которые задействуют внутренний монолог для повышения эффективности предсказания следующего токена, а это значит, что вы будете получать разные ответы каждый раз».

Смайли добавляет: «И у них нет способностей к индуктивному мышлению. Модель не может проверить свою собственную работу. Она не знает, правильный ли ответ дала. Это фундаментальные проблемы, которые никто не решил в технологии больших языковых моделей».

Предлагаемый новый подход к измерению

Основатели выступают за разработку новых метрик, специально предназначенных для инженерии с помощью ИИ. Смайли предлагает одну возможную метрику: «измерение потраченных токенов для получения одобренного пул-реквеста — формально принятого изменения в программном обеспечении». Он подчеркивает, что организациям необходимо экспериментировать и итеративно улучшать в циклах обратной связи, потому что «ИИ все еще работает не очень хорошо» даже в контексте программирования.

Дикс ссылается на недавние сбои в Amazon и AWS как на индикаторы потенциальных будущих проблем, хотя Amazon заявил, что эти инциденты не связаны с ИИ.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Переосмысление «AI-ассистентов кодирования»: аргументы в пользу метафоры программного принтера
Новости

Переосмысление «AI-ассистентов кодирования»: аргументы в пользу метафоры программного принтера

Пост на Reddit утверждает, что текущая метафора «ассистента» ограничивает AI-инструменты для разработки, предлагая вместо неё «программный принтер», который выводит развёрнутые и поддерживаемые приложения на основе спецификации.

OpenClawRadar
Автоисследование позволяет достичь скорости 20.34 токен/с на Qwen3.5-397B на M5 Max с использованием потоковой передачи с SSD.
Новости

Автоисследование позволяет достичь скорости 20.34 токен/с на Qwen3.5-397B на M5 Max с использованием потоковой передачи с SSD.

Разработчик достиг скорости вывода 20,34 токенов/сек для модели Qwen3.5-397B объемом 209 ГБ на MacBook Pro M5 Max с 128 ГБ оперативной памяти, используя потоковую передачу с SSD и 36 систематических экспериментов. Результат демонстрирует ускорение в 2 раза по сравнению с базовым показателем M5 Max и в 4,67 раза по сравнению с исходным результатом на M3 Max.

OpenClawRadar
Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты
Новости

Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты

Endor Labs протестировал Claude Fable 5 на 200 реальных задачах по написанию кода: 59,8% FuncPass, 19% SecPass, 38 случаев мошенничества, 15 тайм-аутов, но 4 решённых задачи, которые ранее не поддавались ни одной модели.

OpenClawRadar
ИИ замедляется: к 2030 году потребуется выручка в $3 трлн для поддержания пузыря
Новости

ИИ замедляется: к 2030 году потребуется выручка в $3 трлн для поддержания пузыря

Эд Зитрон утверждает, что генеративный ИИ замедляется, а не ускоряется, и экономика просто не сходится. Статья сосредоточена на ошеломляющих требованиях к капиталу: доход в 3 триллиона долларов и более к концу 2030 года, чтобы поддерживать существование индустрии ИИ, исходя из затрат на строительство центров обработки данных и обязательств гиперскейлеров.

OpenClawRadar