Qwen3.6-27B как локальный слой рассуждений: результаты двухнедельного тестирования мультиагентной системы

✍️ OpenClawRadar📅 Опубликовано: 19 июня 2026 г.🔗 Source
Qwen3.6-27B как локальный слой рассуждений: результаты двухнедельного тестирования мультиагентной системы
Ad

Разработчик заменил Claude на Qwen3.6-27B в мультиагентном оркестраторе на две недели, запущенном полностью на одной RTX 3090. Цель была простой: проверить, может ли локальная модель служить слоем рассуждений — циклом лидер/менеджер/подчиненный агент — в реальных рабочих процессах кодирования. Результаты дают конкретные цифры для тех, кто задумывается о сокращении облачных расходов.

Настройка и базовый уровень

  • Оборудование: RTX 3090, 24 ГБ видеопамяти
  • Модель: Qwen3.6-27B в квантовании Q6_K (~22 ГБ на GPU), эффективный контекст 32k
  • Движок инференса: Ollama
  • Оркестратор: Мультиагентная система со структурированными JSON-планами, модальным окном подтверждения плана, автоматической проверкой после завершения подчиненного агента
  • Нагрузка: 47 многошаговых рабочих процессов в двух реальных репозиториях

Что сработало (слой рассуждений)

Генерация планов. Qwen3.6 генерировала многошаговые планы примерно так же хорошо, как Claude на этих задачах. Немного более консервативна — меньше несанкционированных предложений по рефакторингу — но связно и валидно по схеме ~95% времени после настройки промптов. Оставшиеся 5% исправлялись одним повторным промптом.

Извлечение памяти. Извлечение фактов в стиле Mem0 каждые 6 шагов работало хорошо. Qwen вытаскивала те же факты, что и Claude (например, "пользователь предпочитает без комментариев, если они не объясняют "почему"") и чисто сохраняла их в Qdrant.

Автопроверка вывода подчиненного агента. Второй экземпляр Qwen, проверяющий код первого, выявлял ~60% багов, которые обнаруживал Claude при проверке того же набора. Менее агрессивно, но всё ещё полезно и бесплатно.

Ad

Где возникли проблемы

Надежность вызова инструментов. Вывод инструментов в JSON у Qwen3.6 имел ~12% ошибок форматирования в 47 задачах. У Claude было ~0.5% на той же нагрузке. Ошибки были не в формате JSON — это были неправильные имена полей, неправильные типы, галлюцинированные сигнатуры инструментов. Использование Outlines или строгого режима вывода уменьшило ошибки, но не устранило их.

Дрейф длинного контекста. После ~14k токенов накопленного контекста сессии Qwen начинала неправильно запоминать решения (например, "вы сказали использовать Postgres", хотя было сказано обратное). Эффективный практический предел — около 12k токенов, после чего требуется агрессивное суммирование и сброс.

Обработка каскадных сбоев. Когда подчиненный агент терпел неудачу, планировщик Claude обычно замечал это и перепланировал. Qwen иногда генерировала последующие шаги в предположении, что подчиненный агент успешно завершил задачу. Три каскадных галлюцинации в 47 запусках — не катастрофично при шлюзовании планов, но было бы без него.

Практические выводы

Мнение разработчика: "Qwen3.6-27B — жизнеспособный слой рассуждений для локальных мультиагентных систем уже сегодня. Это НЕ жизнеспособный слой исполнения." Если вы создаете локальные агенты, вам нужно:

  1. Принудительное структурирование вывода на границе вызова инструментов (Outlines, lm-format-enforcer или режим грамматики вашего движка инференса)
  2. Шлюзование подтверждения плана, чтобы 12% ошибок форматирования никогда не доходили до реальной записи файлов
  3. Логика повторного планирования при сбое — самой модели нельзя доверять обработку каскадных сбоев

Разрыв в 12% ошибок вызова инструментов — вот метрика, за которой стоит следить. Когда Qwen3.6 или следующая локальная модель достигнет ~2% по этой метрике, необходимость облачных рассуждений в циклах агентов значительно ослабнет.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Режим автоматического кода Claude: более безопасная альтернатива обходу разрешений
Инструменты

Режим автоматического кода Claude: более безопасная альтернатива обходу разрешений

Claude Code теперь предлагает автоматический режим — режим разрешений, в котором Claude принимает решения о разрешениях с защитными механизмами, контролирующими действия перед выполнением. Он доступен в качестве исследовательского предпросмотра для пользователей плана Team, а выпуск для Enterprise и API скоро появится.

OpenClawRadar
Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU
Инструменты

Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU

Gemma Gem — это расширение для Chrome, которое запускает модель Gemma 4 от Google (2B или 4B) полностью на устройстве с использованием WebGPU, без API-ключей или облачных зависимостей. Оно предоставляет инструменты для чтения содержимого страницы, создания скриншотов, кликов по элементам, ввода текста, прокрутки и выполнения JavaScript через чат-интерфейс.

OpenClawRadar
Выпущен рейтинг моделей, выбранных сообществом, для OpenClaw.
Инструменты

Выпущен рейтинг моделей, выбранных сообществом, для OpenClaw.

Теперь доступен новый рейтинг, составленный на основе голосования сообщества, для моделей, совместимых с OpenClaw, в котором сейчас лидирует Opus 4.5.

OpenClawRadar
Режим контекста MCP-сервера сокращает использование кода Клода в контексте на 98%
Инструменты

Режим контекста MCP-сервера сокращает использование кода Клода в контексте на 98%

Context Mode — это сервер MCP, который сокращает потребление контекста Claude Code с 315 КБ до 5,4 КБ, изолируя выводы инструментов. Он поддерживает 10 языковых сред выполнения и включает базу знаний с полнотекстовым поиском.

OpenClawRadar