Практический опыт замены стека автоматизации на MCP-серверы и локальные LLM.

Настройка и оборудование
Разработчик использует смесь моделей Qwen 2.5 32B (квантованная) и Llama 3.3 70B на системе с двумя видеокартами 3090. Каждая задача автоматизации получает свой MCP-сервер, который предоставляет инструменты, которые модель может вызывать, функционируя как API, потребляемый LLM, а не человеком.
Что работает хорошо
- Автоматизация ревью кода: Направление модели на git diff через инструменты MCP выявляет реальные проблемы, включая логические ошибки, отсутствие обработки ошибок и состояния гонки. Работает примерно на 70% так же хорошо, как ревью старшего разработчика.
- Анализ логов и оповещения: MCP-сервер подключается к стеку ELK, а модель отслеживает аномальные паттерны. Она обнаружила 3 производственные проблемы до срабатывания оповещений Grafana. Ключ в том, чтобы дать достаточно контекста о том, что выглядит "нормальным" для вашей системы.
- Генерация документации: Модель читает кодовую базу через инструменты MCP для работы с файлами и генерирует/обновляет API-документацию, экономя часы в неделю с действительно хорошим качеством вывода.
Что не работает (пока)
- Цепочки многошаговых рассуждений: Всё, что требует более 3-4 последовательных вызовов инструментов, начинает сбиваться с пути, так как модель теряет контекст исходной цели. Меньшие окна контекста усугубляют это. Подсказки в виде цепочки мыслей помогают, но не решают проблему.
- Принятие решений в реальном времени: Задержка в моделях на 70B означает, что их нельзя использовать для задач, чувствительных ко времени. Конвейер ревью кода занимает 2-3 минуты на PR, что делает его подходящим для асинхронных рабочих процессов, но бесполезным для приложений реального времени.
- Творческое решение проблем: Локальные модели испытывают трудности с задачами, требующими подходов, недостаточно представленных в обучающих данных. API-модели (Claude, GPT-4) здесь заметно лучше.
Ключевые архитектурные уроки
- Держите MCP-серверы без состояния. Пусть модель управляет состоянием через вызовы инструментов, а не через сессию на стороне сервера.
- Встраивайте логику повторных попыток в ваш MCP-клиент, а не в сервер. Модели будут делать некорректные вызовы инструментов примерно в 5% случаев.
- Логируйте каждый вызов инструмента и ответ для отладки, когда модель делает что-то неожиданное.
- Используйте структурированный вывод (режим JSON) для всего, что потребляется нижестоящими системами. Вывод в свободной текстовой форме — это кошмар для отладки.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Использование Claude в качестве структурного интеррогатора для творческих проектов
Разработчик использовал Claude в качестве интеррогатора для написания научно-фантастического романа объемом 63 000 слов и создания браузерной игры, заставляя ИИ выявлять пробелы в логике мира и мотивациях персонажей вместо непосредственной генерации контента.

Агент ИИ OpenClaw находит подходящую федеральную вакансию и создает ежедневную автоматизацию.
Пользователь поручил своему ИИ-агенту OpenClaw найти федеральную вакансию на usajobs.gov, соответствующую его требованиям к зарплате и сохраняющую специальные пенсионные льготы, что привело к точному соответствию описанию должности и автоматизации ежедневных уведомлений.

Создание AI-ресепшиониста для автомастерской: RAG-пайплайн и интеграция голосового управления
Разработчик создал пользовательского ИИ-ресепшиониста по имени Axle для люксовой автомастерской, используя RAG-пайплайн с MongoDB Atlas и эмбеддингами Voyage AI, а затем подключил его к реальной телефонной линии через Vapi с использованием FastAPI и Ngrok.

Сокращение избыточности контекста ИИ-агентов с помощью архитектуры единого рабочего пространства
Разработчик рассказывает, как сократил начальный контекст ИИ-ассистента с 27 000 до 4 000 токенов, внедрив подход с единым рабочим пространством вместо сложных роев агентов, используя инъекцию идентичности на уровне каналов и изолированные папки памяти.