Проблема смещения контекста в локальном конвейере LLM при многошаговой агентной работе

Практические результаты двух месяцев тестирования LLM-конвейеров
Разработчик недавно поделился результатами двухмесячного запуска многоэтапного конвейера автоматизации поиска работы. Конвейер включал исследование, составление резюме и генерацию сопроводительных писем. Тестирование проводилось с использованием Llama-3.3-70b-versatile как на бесплатном тарифе Groq, так и на локальном Ollama в течение нескольких недель в вечернее время.
Где локальные модели проиграли
Хотя локальные модели выигрывали в приватности, стоимости и отсутствии ограничений по квотам на сессию, они столкнулись со значительными проблемами в агентских рабочих процессах:
- Дрейф контекста в многоэтапных конвейерах: Локальные модели успешно выполняли шаг 2, но к моменту достижения шага 4 забывали то, что было установлено на шаге 1. Разработчик наблюдал это в конвейерах из 5-6 узлов, где поддержание согласованного контекста было критически важным.
- Сравнение с облачными моделями: Claude на бесплатном тарифе Groq не проявлял этой проблемы дрейфа контекста почти так же сильно, что указывает на лучшую производительность в поддержании контекста между последовательными задачами.
Скрытая ловушка бесплатного тарифа
Разработчик выделил ещё одну практическую проблему: модели бесплатного тарифа тихо выводятся из эксплуатации без предупреждения. Вы можете настроить конвейер с определённой моделью, уйти на несколько недель и вернуться, чтобы обнаружить, что половина вашей конфигурации сломана с неверными результатами.
Разработчик отметил, что это не был пост с бенчмарками, а реальный опыт, и он искренне открыт к тому, что может ошибаться насчёт части с дрейфом контекста, спрашивая, что на самом деле работает для многоэтапной агентской работы в настоящее время.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

34-дневный проект кода Клода от старшего разработчика: прочная инженерия, критические пробелы в видении
Технический руководитель с более чем 35-летним опытом использовал Claude Code для создания конвейера преобразования документов за 34 дня, сгенерировав более 300 коммитов, 272 теста и чистую архитектуру. Проект выявил критические пробелы в знаниях о существующих библиотеках и обратной связи пользователей.

Как использовать Claude AI в качестве партнера для размышлений, а не поисковой системы
Пользователь Reddit объясняет, что использование Claude как Google ограничивает его потенциал. Вместо этого пользователям следует вести диалог, предоставлять контекст о целях и попытках, а также использовать Claude для проверки собственных мыслей.

Агент Forge самостоятельно исправляет ошибку в GitHub с помощью искусственного интеллекта Claude.
Агент Forge разработчика обнаружил отчёт об ошибке на GitHub, запустил пайплайн, использовал Claude AI для анализа и исправления проблемы и открыл PR — всё без вмешательства человека, пока разработчик спал.

Перенос Doom на PS3 с использованием Claude AI без опыта программирования
Разработчик без опыта программирования на C использовал Claude AI в более чем 25 сессиях чата для портирования Chocolate Doom 3.1.0 на аппаратное обеспечение PS3, достигнув 35 кадров в секунду с использованием нативных вызовов API cellGcm и пользовательских систем аудио/ввода.