Проблема смещения контекста в локальном конвейере LLM при многошаговой агентной работе

Практические результаты двух месяцев тестирования LLM-конвейеров
Разработчик недавно поделился результатами двухмесячного запуска многоэтапного конвейера автоматизации поиска работы. Конвейер включал исследование, составление резюме и генерацию сопроводительных писем. Тестирование проводилось с использованием Llama-3.3-70b-versatile как на бесплатном тарифе Groq, так и на локальном Ollama в течение нескольких недель в вечернее время.
Где локальные модели проиграли
Хотя локальные модели выигрывали в приватности, стоимости и отсутствии ограничений по квотам на сессию, они столкнулись со значительными проблемами в агентских рабочих процессах:
- Дрейф контекста в многоэтапных конвейерах: Локальные модели успешно выполняли шаг 2, но к моменту достижения шага 4 забывали то, что было установлено на шаге 1. Разработчик наблюдал это в конвейерах из 5-6 узлов, где поддержание согласованного контекста было критически важным.
- Сравнение с облачными моделями: Claude на бесплатном тарифе Groq не проявлял этой проблемы дрейфа контекста почти так же сильно, что указывает на лучшую производительность в поддержании контекста между последовательными задачами.
Скрытая ловушка бесплатного тарифа
Разработчик выделил ещё одну практическую проблему: модели бесплатного тарифа тихо выводятся из эксплуатации без предупреждения. Вы можете настроить конвейер с определённой моделью, уйти на несколько недель и вернуться, чтобы обнаружить, что половина вашей конфигурации сломана с неверными результатами.
Разработчик отметил, что это не был пост с бенчмарками, а реальный опыт, и он искренне открыт к тому, что может ошибаться насчёт части с дрейфом контекста, спрашивая, что на самом деле работает для многоэтапной агентской работы в настоящее время.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

OpenClaw создаёт 90% видео с помощью ИИ-моделей за $69.5.
Пользователь Reddit создал видео, в котором OpenClaw обработал 90% процесса, включая выбор темы, генерацию персонажей, создание раскадровки и генерацию видеосегментов с использованием моделей GPT-5, VEO3.1 fast и Nano Banana Pro, с общей стоимостью ИИ в $69.5.

Рабочий процесс Claude MCP автоматизирует повторное вовлечение потенциальных клиентов в LinkedIn с адаптивными ограничениями.
Разработчик создал рабочий процесс с использованием Claude и MCP для автоматического повторного вовлечения старых контактов в LinkedIn, определяя потенциальных клиентов, генерируя контекстные сообщения и адаптивно справляясь с ограничениями платформы. Из 7 целевых потенциальных клиентов 5 сообщений были успешно отправлены, а 2 были пропущены из-за ограничений LinkedIn.

Массовое распараллеливание кода Claude: уроки создания приложения на 220 тысяч строк
Разработчик без формального образования в программировании создал полноценное мобильное приложение с помощью Claude Code, запуская 3-4 параллельных экземпляра для обработки 4 миллиардов токенов в более чем 500 файлах. Ключевые методы включают документы передачи контекста, файлы CLAUDE.md, пользовательские слэш-команды и систематические аудиты кодовой базы.

Не-разработчик создает три производственных приложения с помощью ИИ Claude.
Пользователь без опыта программирования создал три функциональных веб-приложения с помощью Claude AI, включая поисковик цен на топливо, принтер прокси-карт для MTG и инструмент для бюджетирования, развернутые через GitHub, Cloudflare Workers, Cloudflare D1 и Vercel.