Агенты ИИ для написания кода испытывают трудности с управлением контекстом в больших кодовых базах.

Проблема не в узком месте выполнения
Наблюдения за реальным использованием кодовых баз показывают, что ИИ-агенты для написания кода последовательно тратят значительное время на исследование, а не на выполнение. Каждый раз, когда агент приступает к новой задаче, он делает 15–20 вызовов инструментов для ознакомительных действий, включая:
- Поиск маршрутов через grep
- Чтение промежуточного ПО
- Проверку типов
К тому времени, когда агент начинает писать код, он уже потратил значительную часть своего контекстного окна на исследовательскую работу.
Доказательства упрощённых подходов
Vercel продемонстрировал эту проблему с противоположной стороны, убрав 80% инструментов у своего агента и предоставив ему доступ к bash. Этот подход привёл к 100% точности, что говорит о том, что возможности выполнения не являются ограничивающим фактором.
Аналогично, Pi (минималистичный агент для написания кода) доказывает ту же точку всего с 4 инструментами и системным промптом, содержащим менее 1000 токенов.
Реальная проблема: управление контекстом
Если выполнение эффективно решено, то реальной сложной проблемой становится управление контекстом. Несколько факторов способствуют этой проблеме:
- Большие кодовые базы не помещаются ни в одно текущее контекстное окно
- Длительные задачи накапливают выводы инструментов, которые вытесняют ранние рассуждения из окна внимания
- Динамические среды меняются между сессиями
- Исследование «Lost in the Middle» показывает, что модели лучше всего рассуждают в начале своего контекстного окна — именно тогда, когда агенты всё ещё ищут
Автор опубликовал более подробный анализ, исследующий эти проблемы и их последствия для разработки ИИ-агентов для написания кода.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Мобильное приложение Cursor: управляйте своим код-агентом с телефона
Cursor запустил мобильное приложение для взаимодействия с код-агентами на ходу — часть перехода к мобильному AI-ассистированному кодингу.

Изучение архитектуры иframework социальной автономии Clawra.
Работа Дэвида Има над Clawra через OpenClaw представляет собой увлекательный подход с концепцией 'цифровой души', целью которого является обеспечение автономной работы ИИ-компаньонов в условиях 'параллельного мира'. Существенным аспектом этой архитектуры является акцент на автономии, управляемой памятью.

Xiaomi открыла исходный код MiMo-V2.5-Pro: приближается к Claude Opus 4.6 по бенчмаркам кодинга
Xiaomi выпустил MiMo-V2.5-Pro — модель с открытым исходным кодом, которая набрала 233/233 на университетском проекте компилятора, самостоятельно создала видеоредактор и занимает место в 1% от Claude Opus 4.6 по бенчмаркам SWE-Bench и Terminal-Bench.

Проект ИИ-агента Obsidian разработчика стал вирусным за одну ночь
Исследователь с докторской степенью создал команду ИИ-агентов для управления своим хранилищем Obsidian, опубликовал проект на GitHub и проснулся с более чем 700 звёздами менее чем за 13 часов. Внезапное внимание вызвало панику, из-за чего репозиторий временно стал приватным, прежде чем был вновь открыт с улучшениями.