Работники Amazon придумывают имитацию работы для выполнения квот по использованию ИИ

Новый отчет Fast Company показывает, что работники Amazon, вынужденные увеличивать использование ИИ-инструментов, изобретают лишние задачи, чтобы выполнить внутренние квоты. Статья, опубликованная на Hacker News, освещает системную проблему, когда метрики внедрения ИИ становятся целью для игр, а не реального повышения производительности.
Как сотрудники обходят систему
Согласно первоисточнику, сотрудники создают фиктивные или малозначимые задачи, чтобы удовлетворить инструменты отслеживания, которые контролируют взаимодействие с ИИ. Конкретные методы включают многократное выполнение одних и тех же запросов, генерацию ненужных документов и раздувание истории чатов с ИИ-помощниками. Давление исходит от руководства, требующего от команд демонстрировать растущее использование ИИ с течением времени без четких указаний, как интегрировать ИИ в существующие рабочие процессы.
Обсуждение на HN (180 комментариев) усиливает проблему: многие комментаторы отмечают, что такие метрики — это «цифры для галочки», если они не привязаны к реальному качеству вывода или сэкономленному времени. Один пользователь заметил: «Когда вы измеряете использование без контекста, вы получаете имитацию работы». Другой комментатор поделился, что аналогичная ситуация была на ранних этапах внедрения облачных технологий в других компаниях.
Более широкие последствия
Это проблема не только Amazon. Любая организация, внедряющая ИИ-агенты для кодирования или инструменты на основе LLM, сталкивается с той же ловушкой: если использование является KPI, сотрудники будут оптимизировать использование, а не результаты. Для разработчиков и технических руководителей вывод очевиден: разрабатывайте политики внедрения ИИ, которые оценивают результаты (например, сокращение времени цикла, уменьшение количества ошибок), а не количество взаимодействий. В противном случае вы получите панель управления, полную шума.
Статья служит примером несогласованных стимулов. Вместо реального внедрения давление «показать использование ИИ» приводит к манипуляции метриками и напрасной трате вычислительных ресурсов — прямо противоположному тому, что должны давать ИИ-инструменты.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

ИИ-агенты нанимают других ИИ-агентов: от одиночных работников к сетевым экономикам
Пост на Reddit утверждает, что AI-агенты эволюционируют из изолированных инструментов в сетевых работников, которые делегируют задачи, специализируются, строят репутацию и обмениваются ценностями — смещая сложную проблему с интеллекта на координацию.

Claude Opus 4.1 набирает 17.75% на приватном наборе данных SWE-Bench Pro, что подчеркивает разрыв между запоминанием и логическим мышлением.
Claude Opus 4.1 набрал 80% на SWE-Bench Verified, но упал до 17,75% на приватном наборе данных SWE-Bench Pro, состоящем из 276 задач из 18 проприетарных кодбейсов стартапов. Анализ Scale AI показал, что модели ориентировались по памяти, а не рассуждали на знакомых репозиториях.

Модель расходов агента OpenClaw и отсутствие лимитов на траты
Разработчик отслеживал расходы агента OpenClaw в течение двух месяцев и обнаружил, что большинство агентов в среднем тратят 40–80 долларов в месяц на API и сервисные сборы, если их не контролировать, причём пики приходятся на выходные и ночное время. Поведение по умолчанию неограниченное, встроенного лимита расходов нет.

Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.
Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя GLM 5, Qwen 3.5 397B и все модели Claude Sonnet. Модель, по-видимому, лучше справляется с долгосрочными задачами и следует собственным рекомендациям при планировании.