Ухудшение качества контекста в ИИ-агентах: Уровень галлюцинаций растет с увеличением количества токенов

✍️ OpenClawRadar📅 Опубликовано: 28 марта 2026 г.🔗 Source
Ухудшение качества контекста в ИИ-агентах: Уровень галлюцинаций растет с увеличением количества токенов
Ad

Результаты тестирования производительности контекстного окна

Разработчик протестировал ухудшение качества контекста при разных объёмах токенов в ИИ-агентах, выявив значительные проблемы с производительностью по мере увеличения размера контекста.

Ключевые выводы тестирования

В ходе тестирования были измерены несколько критически важных показателей:

  • Уровень галлюцинаций в зависимости от размера контекста:
    • 10 тыс. токенов: ~3%
    • 50 тыс. токенов: ~11%
    • 200 тыс. токенов: ~28%
    • 1 млн токенов: неясно, но тренд показывает нарастающую деградацию
  • Точность воспроизведения: Ни одна из протестированных моделей (включая GPT-4, Claude или локальные модели) не достигла 90% точности воспроизведения информации из первых 10 повторов, как только контекст превысил 50 тыс. токенов.
  • Эффективность использования токенов: При 200 тыс. токенов процент контекста, действительно релевантного текущему запросу, в большинстве задач агента падает ниже 12%, что означает, что примерно 188 тыс. токенов добавляют шум, который модель должна обходить при рассуждении.
Ad

Анализ проблемы

Проблема, по-видимому, заключается не в забывании, а в недостатке внимания. Ранний контекст конкурирует с недавним, причём недавний обычно выигрывает из-за более высокой позиционной релевантности. Это приводит к тому, что ограничения, установленные в начале сессий (например, «используй PostgreSQL, без ORM»), постепенно размываются по мере накопления большего объёма контекста.

К 89-му повтору при 200 тыс. токенов внимание модели настолько распределено по всему контексту, что ранние ограничения фактически исчезают.

Текущие решения и их ограничения

Многие разработчики добавляют векторные базы данных для извлечения «релевантных» воспоминаний, что несколько помогает. Однако этот подход извлекает семантически похожий контент, а не тот, который нужен агенту для правильного рассуждения. Например, «используй PostgreSQL» не является семантически похожим на «напиши мне конечную точку для входа в систему», хотя это должно быть в контексте для правильного выполнения.

Разработчик ищет обратную связь о том, соответствуют ли эти выводы производственному опыту и какие подходы действительно сработали у других.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Клод Код Сабагенты Не Загружают Навыки в Мультиагентных Системах
Новости

Клод Код Сабагенты Не Загружают Навыки в Мультиагентных Системах

Разработчик сообщает, что суб-агенты в Claude Code v2.1.91 не могут получить доступ к навыкам, определённым в директории .claude/skills/, несмотря на то, что навыки идеально работают в основной сессии. Несколько подходов, включая указание навыков во фронтмете агента, инструмент Skill, флаги CLI и команды агентов, не дают результата.

OpenClawRadar
Claude Code v2.1.154: Opus 4.8, динамические рабочие процессы и важные исправления
Новости

Claude Code v2.1.154: Opus 4.8, динамические рабочие процессы и важные исправления

Новый релиз добавляет Opus 4.8 с режимом повышенного усилия, динамические рабочие процессы для десятков и сотен агентов, быстрый режим с коэффициентом 2x для скорости 2.5x и множество исправлений.

OpenClawRadar
Anthropic удваивает лимиты скорости Claude Code, подписывает сделку по вычислениям с SpaceX
Новости

Anthropic удваивает лимиты скорости Claude Code, подписывает сделку по вычислениям с SpaceX

Лимиты Claude Code на пять часов удвоены для планов Pro/Max/Team/Enterprise, убрано снижение в часы пик, а для моделей Opus повышены лимиты API. SpaceX Colossus 1 добавляет более 300 МВт мощности (220 тыс. GPU NVIDIA) в течение месяца.

OpenClawRadar
Служба Cowork VM не запускается в Windows 11 из-за отсутствия записи в реестре DCOM
Новости

Служба Cowork VM не запускается в Windows 11 из-за отсутствия записи в реестре DCOM

Пользователь диагностировал ошибку Cowork, при которой служба виртуальной машины не запускается на Windows 11 Pro, обновлённой с версии Home. Отсутствующий DCOM APPID {15C20B67-12E7-4BB6-92BB-7AFF07997402} препятствует взаимодействию с Hyper-V, что требует исправления от Anthropic.

OpenClawRadar