Исследование ETH Zurich: Избыточный контекст снижает производительность ИИ-агентов для программирования

Недавнее исследование ETH Zurich предоставляет конкретные доказательства того, что больший контекст не обязательно означает лучшую производительность для ИИ-агентов, занимающихся кодированием. Исследование протестировало четырех кодирующих агентов на 138 реальных задачах GitHub с четкими количественными результатами.
Ключевые выводы
Исследование показало, что контекстные файлы, сгенерированные LLM, фактически снизили успешность выполнения задач на 2-3%, в то время как затраты на вывод увеличились на 20%. Даже контекстные файлы, написанные человеком, улучшили успешность лишь примерно на 4%, при этом все равно значительно увеличив затраты.
Основная проблема
Исследователи обнаружили, что агенты воспринимали каждую инструкцию в контекстных файлах как нечто, что должно быть выполнено. В одном эксперименте, когда они свели репозитории только к сгенерированному контекстному файлу, производительность снова улучшилась. Это указывает на то, что агентам трудно отличить важные инструкции от нерелевантной исторической информации.
Практические рекомендации
Исследование рекомендует включать только ту информацию, которую агент действительно не может обнаружить самостоятельно, сохраняя контекст минимальным. Это особенно актуально для данных коммуникации, таких как цепочки писем, которые могут выглядеть как контекст, но часто интерпретируются как инструкции, хотя на самом деле являются историческим шумом.
Решение Context API
Для решения этой проблемы исследователи разработали контекстный API (iGPT), который фокусируется на обработке электронной почты. API:
- Восстанавливает цепочки писем в графы разговоров до того, как контекст попадет в модель
- Удаляет дублирующийся цитируемый текст
- Определяет, кто что сказал и когда
- Возвращает структурированный JSON вместо необработанного текста
Такой подход гарантирует, что агенты получают отфильтрованный контекст вместо полных историй разговоров, улучшая их способность сосредотачиваться на релевантной информации.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

AWS Bedrock тихо убивает квоту Claude Opus 4.7: Предупреждение для производственных AI-процессов
Пользователь HN сообщает, что AWS Bedrock установил квоту на Claude Opus 4.7 на уровне 0 без предупреждения. AWS поддержка подтвердила, что это было обновление системы, и не может гарантировать восстановление. Пользователям рекомендуется перейти на Opus 4.6 или сменить провайдера.

Тестирование показывает, что компактная 4B-модель превосходит более крупные языковые модели в приложениях для обмена сообщениями между телефоном и домашними устройствами.
Бенчмарк 8 локальных LLM для приложений чата с телефона на домашний компьютер показал, что Gemma3:4B победила с комплексным показателем пригодности 88.7, несмотря на то что это самая маленькая модель, превзойдя более крупные модели до 24B параметров благодаря более быстрому времени отклика и меньшей тепловой нагрузке.

Nemotron 3 4B уступает Qwen 3.5 4B в сложных тестах производительности.
Пользователь Reddit протестировал Nemotron 3 4B Q8 против Qwen 3.5 4B Q8 на сложных математических и программистских задачах, обнаружив, что Nemotron не смог предоставить корректные рассуждения и структурированный вывод, в то время как Qwen успешно прошел все тесты.

Ошибка тайм-аута входа через OAuth в Claude Code на Windows
В версии Claude Code 2.1.92 обнаружена ошибка, из-за которой пользователи Windows сталкиваются с неудачными попытками входа через OAuth с ошибкой таймаута в 15000 мс, полностью блокируя доступ к AI-ассистенту для программирования.