Агенты ИИ для написания кода испытывают трудности с управлением контекстом в больших кодовых базах.

Проблема не в узком месте выполнения
Наблюдения за реальным использованием кодовых баз показывают, что ИИ-агенты для написания кода последовательно тратят значительное время на исследование, а не на выполнение. Каждый раз, когда агент приступает к новой задаче, он делает 15–20 вызовов инструментов для ознакомительных действий, включая:
- Поиск маршрутов через grep
- Чтение промежуточного ПО
- Проверку типов
К тому времени, когда агент начинает писать код, он уже потратил значительную часть своего контекстного окна на исследовательскую работу.
Доказательства упрощённых подходов
Vercel продемонстрировал эту проблему с противоположной стороны, убрав 80% инструментов у своего агента и предоставив ему доступ к bash. Этот подход привёл к 100% точности, что говорит о том, что возможности выполнения не являются ограничивающим фактором.
Аналогично, Pi (минималистичный агент для написания кода) доказывает ту же точку всего с 4 инструментами и системным промптом, содержащим менее 1000 токенов.
Реальная проблема: управление контекстом
Если выполнение эффективно решено, то реальной сложной проблемой становится управление контекстом. Несколько факторов способствуют этой проблеме:
- Большие кодовые базы не помещаются ни в одно текущее контекстное окно
- Длительные задачи накапливают выводы инструментов, которые вытесняют ранние рассуждения из окна внимания
- Динамические среды меняются между сессиями
- Исследование «Lost in the Middle» показывает, что модели лучше всего рассуждают в начале своего контекстного окна — именно тогда, когда агенты всё ещё ищут
Автор опубликовал более подробный анализ, исследующий эти проблемы и их последствия для разработки ИИ-агентов для написания кода.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Встреча OpenClaw в Пекине собрала полный зал технических специалистов.
На митапе OpenClaw в Пекине был аншлаг, разработчики задавали подробные вопросы о мультиагентной оркестровке, автономных циклах и приватных развертываниях. Особый интерес вызвала демонстрация, где агенты Планировщик, Разработчик и Верификатор автономно сотрудничали, чтобы обеспечить работу компании одного человека.

Искусственный интеллект не смог повысить продуктивность, согласно недавнему исследованию CEOs.
Несмотря на широкое внедрение ИИ, исследование 6000 руководителей сообщает о незначительных влияниях на производительность и занятость, что перекликается с парадоксом производительности, выявленным в эпоху ИТ 1980-х годов.

Необходимость реляционного управления в мультиагентных системах
Современные системы управления сосредоточены на идентификации, разрешениях и аварийных выключателях, но не решают проблему координации между агентами. Исследования показывают, что взаимодействие агента с агентом требует специальных решений, а не просто масштабирования диалогов между человеком и агентом.

AlphaEvolve: агент на базе Gemini от DeepMind оптимизирует алгоритмы в геномике, энергосетях и цепях TPC
AlphaEvolve, кодирующий агент на базе Gemini от Google DeepMind, снизил ошибки обнаружения вариантов DeepConsensus на 30%, повысил осуществимость AC Optimal Power Flow GNN с 14% до 88% и уменьшил ошибку квантовой схемы в 10 раз.