Qwen3.6-27B как локальный слой рассуждений: результаты двухнедельного тестирования мультиагентной системы

Разработчик заменил Claude на Qwen3.6-27B в мультиагентном оркестраторе на две недели, запущенном полностью на одной RTX 3090. Цель была простой: проверить, может ли локальная модель служить слоем рассуждений — циклом лидер/менеджер/подчиненный агент — в реальных рабочих процессах кодирования. Результаты дают конкретные цифры для тех, кто задумывается о сокращении облачных расходов.
Настройка и базовый уровень
- Оборудование: RTX 3090, 24 ГБ видеопамяти
- Модель: Qwen3.6-27B в квантовании Q6_K (~22 ГБ на GPU), эффективный контекст 32k
- Движок инференса: Ollama
- Оркестратор: Мультиагентная система со структурированными JSON-планами, модальным окном подтверждения плана, автоматической проверкой после завершения подчиненного агента
- Нагрузка: 47 многошаговых рабочих процессов в двух реальных репозиториях
Что сработало (слой рассуждений)
Генерация планов. Qwen3.6 генерировала многошаговые планы примерно так же хорошо, как Claude на этих задачах. Немного более консервативна — меньше несанкционированных предложений по рефакторингу — но связно и валидно по схеме ~95% времени после настройки промптов. Оставшиеся 5% исправлялись одним повторным промптом.
Извлечение памяти. Извлечение фактов в стиле Mem0 каждые 6 шагов работало хорошо. Qwen вытаскивала те же факты, что и Claude (например, "пользователь предпочитает без комментариев, если они не объясняют "почему"") и чисто сохраняла их в Qdrant.
Автопроверка вывода подчиненного агента. Второй экземпляр Qwen, проверяющий код первого, выявлял ~60% багов, которые обнаруживал Claude при проверке того же набора. Менее агрессивно, но всё ещё полезно и бесплатно.
Где возникли проблемы
Надежность вызова инструментов. Вывод инструментов в JSON у Qwen3.6 имел ~12% ошибок форматирования в 47 задачах. У Claude было ~0.5% на той же нагрузке. Ошибки были не в формате JSON — это были неправильные имена полей, неправильные типы, галлюцинированные сигнатуры инструментов. Использование Outlines или строгого режима вывода уменьшило ошибки, но не устранило их.
Дрейф длинного контекста. После ~14k токенов накопленного контекста сессии Qwen начинала неправильно запоминать решения (например, "вы сказали использовать Postgres", хотя было сказано обратное). Эффективный практический предел — около 12k токенов, после чего требуется агрессивное суммирование и сброс.
Обработка каскадных сбоев. Когда подчиненный агент терпел неудачу, планировщик Claude обычно замечал это и перепланировал. Qwen иногда генерировала последующие шаги в предположении, что подчиненный агент успешно завершил задачу. Три каскадных галлюцинации в 47 запусках — не катастрофично при шлюзовании планов, но было бы без него.
Практические выводы
Мнение разработчика: "Qwen3.6-27B — жизнеспособный слой рассуждений для локальных мультиагентных систем уже сегодня. Это НЕ жизнеспособный слой исполнения." Если вы создаете локальные агенты, вам нужно:
- Принудительное структурирование вывода на границе вызова инструментов (Outlines, lm-format-enforcer или режим грамматики вашего движка инференса)
- Шлюзование подтверждения плана, чтобы 12% ошибок форматирования никогда не доходили до реальной записи файлов
- Логика повторного планирования при сбое — самой модели нельзя доверять обработку каскадных сбоев
Разрыв в 12% ошибок вызова инструментов — вот метрика, за которой стоит следить. Когда Qwen3.6 или следующая локальная модель достигнет ~2% по этой метрике, необходимость облачных рассуждений в циклах агентов значительно ослабнет.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

ClawPort: Открытая система оркестрации рабочих процессов ИИ-агентов с самовосстанавливающимся планировщиком Cron
ClawPort — это слой оркестрации с открытым исходным кодом для рабочих процессов AI-агентов, который автоматически настраивает cron-конвейеры, самовосстанавливается при сбоях и позволяет тестировать агентов напрямую перед их запуском по расписанию.

Бенчмарк квантизации Qwen 3.6 27B: Q4_K_M превосходит Q8_0 по практическим компромиссам
Оценка Qwen 3.6 27B в квантованиях BF16, Q4_K_M и Q8_0 GGUF на задачах HumanEval, HellaSwag и BFCL. Q4_K_M обеспечивает точность, близкую к BF16, при 48% меньшем потреблении RAM, скорости в 1,45 раза выше и размере файла на 68,8% меньше.

Контекстно-инженерная система обучения для Claude Code, выполняющая роль постоянного репетитора
Разработчик создал систему обучения на основе Claude Code, которая отслеживает прогресс между сессиями, проверяет понимание, прорабатывает упражнения и адаптируется к стилям обучения. Система использует структурированные markdown-файлы для формирования поведения агента и включает инструменты для извлечения страниц учебников из PDF-файлов.

Перекрестная модель цикла проверки для AI-агентов программирования выявляет критические недостатки планирования.
Разработчик создал систему кросс-модельного ревью, в которой вторая модель ИИ проверяет планы от кодирующих агентов перед выполнением, выявляя критические недостатки, такие как сбои отката и уязвимости безопасности. Инструмент имеет лицензию MIT и включает TUI-панель управления.