Что ломается при запуске кодирующих агентов на маленьких локальных моделях

✍️ OpenClawRadar📅 Опубликовано: 30 апреля 2026 г.🔗 Source
Что ломается при запуске кодирующих агентов на маленьких локальных моделях
Ad

После нескольких недель запуска реальных многофайловых задач кодирования на маленьких локальных моделях (менее 7B) и маленьких облачных моделях на бесплатных тарифах, пользователь Reddit задокументировал стабильные точки отказа, выходящие за рамки типичного шума бенчмарков. Вот что на самом деле ломается.

Ограждения Markdown — самая частая проблема

Даже с "выводить только сырой код, без форматирования Markdown" в системном промпте, большинство моделей оборачивают ответы в тройные обратные кавычки. Qwen3.5:9b и Gemma4:e4b следуют инструкциям наиболее последовательно, но все равно иногда сбиваются. Исправление — не в улучшении промпта, а в удалении ограждений на этапе постобработки по умолчанию.

Структурированный вывод ненадежен ниже 7B

Когда агентам требуется JSON для списков задач или типов действий, маленькие модели ошибаются гораздо чаще, чем показывают бенчмарки. Бенчмарки тестируют валидный JSON; реальное использование добавляет сложные многошаговые инструкции с краевыми случаями. Gemma4:e4b — самая надежная среди локальных моделей; Qwen3.5:9B немного отстает. Codellama справляется хуже. В облаке Llama 3.3 70B на Groq абсолютно надежна. Практическое решение: проверять JSON, повторять попытку с явной инструкцией, затем переходить на снисходительный парсер, извлекающий JSON из текста.

Модели редактируют не тот файл

Дайте маленькой модели задачу переименовать validateToken в verifyToken с картой проекта, содержащей похожие имена, и она может переименовать validateUser или изменить вообще не тот файл. Модель воспринимает карту проекта как предложения, а не ограничения. Исправление на уровне оркестрации: проверять, что пути к файлам существуют, а имена функций есть в указанных файлах. Выдавать ошибки при несоответствии — маленькие модели уверенно врут.

Ad

Классификация вопроса и действия

Вопрос «сколько строк в utils.js» должен быть только для чтения. Но если у исполнителя есть только один режим редактирования, он отредактирует файл, вставив туда ответ. Исправление: планировщик должен классифицировать запросы по типам действий до выполнения. Запросы только для чтения направляются на отдельный путь, который никогда не затрагивает диск.

Что работает лучше ожидаемого

  • Контроль токенов в коде: подсчитывайте токены перед каждым вызовом; маленькие модели не имеют понятия о лимитах контекста и не будут краткими, если им доверять.
  • Изоляция по файлам: отправка одного файла за раз значительно надежнее, чем двух — модели путают исправления.
  • Синтезная память: храните одно предложение о том, что сделала модель, а не полный список задач. Работает для отмены и добавления запросов.

Еще предстоит выяснить

Возможна ли какая-либо локальная модель менее 7B для роли агента — автор не нашел такую, которая не ошибалась бы в структурированном выводе достаточно часто. Открытый тестовый фреймворк на github.com/razvannec для вкладов.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Как запускать агентов OpenClaw бесплатно с использованием облачных API или локальных моделей
Гайды

Как запускать агентов OpenClaw бесплатно с использованием облачных API или локальных моделей

Подробное руководство объясняет, как запускать агентов OpenClaw с нулевой стоимостью, используя бесплатные облачные тарифы от OpenRouter, Gemini и Groq, или запуская локальные модели через Ollama с конкретными советами по настройке, чтобы избежать распространённых ошибок.

OpenClawRadar
Практические советы по архитектуре многоагентных систем на основе опыта
Гайды

Практические советы по архитектуре многоагентных систем на основе опыта

Разработчик делится пятью конкретными паттернами для создания мультиагентных ИИ-систем на основе опыта работы с ежедневно функционирующей системой из 7 агентов: начать с одного агента, использовать паттерн оркестратора, внедрить общую память с JSON-файлами, маршрутизировать модели по задачам и добавить циклы подтверждения.

OpenClawRadar
Клод: Навыки кодирования vs. Пользовательские агенты: Ментальная модель, основанная на постоянстве задач
Гайды

Клод: Навыки кодирования vs. Пользовательские агенты: Ментальная модель, основанная на постоянстве задач

Пользователь Reddit объясняет разницу между навыками Claude Code и пользовательскими агентами: навыки выполняют одни и те же шаги каждый раз, в то время как пользовательские агенты требуют рассуждений и адаптации. В посте также рассматриваются параллельные подчинённые агенты, делегирование, хуки и строительные блоки.

OpenClawRadar
Создание полноценной BI-системы с Claude Code и Metabase менее чем за $50 в месяц
Гайды

Создание полноценной BI-системы с Claude Code и Metabase менее чем за $50 в месяц

Пользователь Reddit построил полноценную BI-систему с помощью Claude Code, BigQuery и самодельного Metabase, заменив консультации экспертов за $15 тыс. на 3 дня работы и $30 в месяц за облачные ресурсы.

OpenClawRadar