Аудит логов API показывает, что AI-агенты тратят токены впустую из-за раздувания контекстного окна

Разработчик на r/ClaudeAI проаудировал свои логи Anthropic API после того, как заметил взлетевший счет, и обнаружил ключевую неэффективность: ИИ-агенты не теряют рассудок — они задыхаются в собственном окне контекста. В посте описывается, как агенты в репозиториях размером более 10 000 строк тратят токены на слепое исследование, загрузку необработанных файлов и многословные выводы инструментов, что приводит к архитектурной лапше после 20+ шагов.
Ключевые выводы из аудита логов API
- Слепое исследование: Агенты рекурсивно выполняют
grepи читают ~40 файлов, чтобы найти одну функцию. Вместо поиска существующего UI-компонента они часто галлюцинируют дубликат с нуля. - Загрузка целиком: Агент может прочитать файл на 2000 строк, чтобы обновить интерфейс из 5 строк, тратя токены впустую.
- Поток shell и инструментов: Многословные логи тестов и раздутые определения MCP-инструментов потребляют ~30 000 токенов до того, как агент напишет хоть строчку кода.
- Память как у золотой рыбки: Каждая сессия заново читает те же файлы из-за отсутствия памяти о проекте — как в "Дне сурка".
Когда окно контекста заполняется этим шумом до ~80%, качество рассуждений агента заметно падает, и начинается архитектурная деградация. Стандартные RAG или сжатие вывода не устраняют коренную причину: у агента нет структурного понимания кодовой базы, пока он не сожжет токены на чтение сырого текста.
Практические последствия
Разработчики сталкиваются с парадоксом производительности: экономия часа на наборе текста оборачивается пятью часами исправления ИИ-спагетти-кода. В посте ставится вопрос о необходимости принципиально новой архитектуры агента, которая понимает код как граф до того, как тратить токены на сырой текст.
Для кого это
Инженеры, использующие ИИ-агентов для кодинга на больших кодовых базах, которые хотят понять скрытые потери токенов и повысить эффективность затрат.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Утечка данных раскрыла модель искусственного интеллекта Claude Mythos от Anthropic, которую описывают как «скачок» в возможностях.
Anthropic тестирует новую модель ИИ под названием Claude Mythos (также известную как Capybara), которая представляет собой «качественный скачок» в производительности. По сравнению с Claude Opus 4.6, она демонстрирует значительно более высокие результаты в тестах на написание программного кода, академическое мышление и кибербезопасность. Существование модели было раскрыто в результате утечки данных из незащищенного, общедоступного кэша, содержащего около 3000 неопубликованных материалов.

Локальный Qwen 3.6 против передовых моделей на задаче программирования: одиночный HTML-файл для анимации на Canvas
Пользователь Reddit сравнил локальные квантифицированные версии Qwen 3.6 с ведущими моделями (Claude, Gemini, GPT, Kimi) в задаче создания плотного однофайлового HTML-документа с анимацией вождения на canvas. Локальная модель Qwen 3.6-27B Q4_K_M показала более естественное движение и наслоение, чем некоторые ведущие модели.

ИИ-агенты нанимают других ИИ-агентов: от одиночных работников к сетевым экономикам
Пост на Reddit утверждает, что AI-агенты эволюционируют из изолированных инструментов в сетевых работников, которые делегируют задачи, специализируются, строят репутацию и обмениваются ценностями — смещая сложную проблему с интеллекта на координацию.

Команда MeshCore разделяется: товарный знак зарегистрирован втайне, спор о коде, сгенерированном ИИ
Команда разработчиков MeshCore публично разделилась после того, как участник Энди Кирби тайно подал заявку на товарный знак MeshCore и использовал Claude Code для генерации большей части своих кодовых вкладов без раскрытия этого факта.