Исследование ETH Zurich: Избыточный контекст снижает производительность ИИ-агентов для программирования

Недавнее исследование ETH Zurich предоставляет конкретные доказательства того, что больший контекст не обязательно означает лучшую производительность для ИИ-агентов, занимающихся кодированием. Исследование протестировало четырех кодирующих агентов на 138 реальных задачах GitHub с четкими количественными результатами.
Ключевые выводы
Исследование показало, что контекстные файлы, сгенерированные LLM, фактически снизили успешность выполнения задач на 2-3%, в то время как затраты на вывод увеличились на 20%. Даже контекстные файлы, написанные человеком, улучшили успешность лишь примерно на 4%, при этом все равно значительно увеличив затраты.
Основная проблема
Исследователи обнаружили, что агенты воспринимали каждую инструкцию в контекстных файлах как нечто, что должно быть выполнено. В одном эксперименте, когда они свели репозитории только к сгенерированному контекстному файлу, производительность снова улучшилась. Это указывает на то, что агентам трудно отличить важные инструкции от нерелевантной исторической информации.
Практические рекомендации
Исследование рекомендует включать только ту информацию, которую агент действительно не может обнаружить самостоятельно, сохраняя контекст минимальным. Это особенно актуально для данных коммуникации, таких как цепочки писем, которые могут выглядеть как контекст, но часто интерпретируются как инструкции, хотя на самом деле являются историческим шумом.
Решение Context API
Для решения этой проблемы исследователи разработали контекстный API (iGPT), который фокусируется на обработке электронной почты. API:
- Восстанавливает цепочки писем в графы разговоров до того, как контекст попадет в модель
- Удаляет дублирующийся цитируемый текст
- Определяет, кто что сказал и когда
- Возвращает структурированный JSON вместо необработанного текста
Такой подход гарантирует, что агенты получают отфильтрованный контекст вместо полных историй разговоров, улучшая их способность сосредотачиваться на релевантной информации.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

Пользователи OpenClaw сообщают о заменах моделей после запрета Anthropic.
Общественный опрос на Reddit, X, YouTube и GitHub показывает, что GPT-5.x стал самой популярной заменой Claude в рабочих процессах OpenClaw, при этом Kimi K2.5 лидирует по голосам сообщества, а гибридные настройки набирают популярность.

Выпущена модель MiniMax M2.7 с улучшенной производительностью в программировании.
MiniMax выпустила модель искусственного интеллекта M2.7, которая набирает 56% в тестах SWE-Pro по программированию и обладает возможностями самооптимизации. Модель сохраняет цену в размере $0,30 за миллион входных токенов.

Утечка исходного кода CLI Claude Code раскрывает скрытые функции и внутренние флаги.
Анализ утекшего исходного кода TypeScript для Claude Code CLI выявил 35 флагов функций, активируемых при сборке, включая AI-питомцев BUDDY, постоянную память KAIROS, удалённое планирование ULTRAPLAN и режим координатора. Также обнаружено более 120 недокументированных переменных окружения и 26 внутренних слеш-команд.

Claude Code v2.1.147: Закреплённые сессии, /code-review и десятки исправлений
Claude Code v2.1.147 представляет закрепленные фоновые сессии, переименовывает /simplify в /code-review с уровнями усилий и --comment, а также содержит исправления для PowerShell, MCP, Windows и других компонентов.