Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex

✍️ OpenClawRadar📅 Опубликовано: 4 мая 2026 г.🔗 Source
Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex
Ad

Разработчик на r/LocalLLaMA запускает локальную модель Qwen параллельно с OpenAI Codex в качестве валидатора и оппонента, и создал небольшой воспроизводимый набор тестов, чтобы определить, какие профили квантования GGUF лучше всего подходят для этой роли. Рабочий процесс: Codex занимается основной работой с репозиторием; локальный Qwen оспаривает план, проверяет на избыточность, пропущенные жёсткие указания, проблемы с UI/дизайном, ошибочные предположения и упущения длинного контекста. Автор проверяет каждое взаимодействие перед выполнением.

Настройка набора тестов

Набор тестирует профили Qwen 3.6 27B GGUF через llama.cpp, включая варианты Bartowski и Unsloth с разными размерами контекста и форматами кэша KV (q8, f16). Основное внимание уделяется реальным ошибкам: пропущенные указания, плохое поведение при оспаривании, избыточность, оценка UI и упущения длинного контекста.

Ключевые выводы

  • Лучшие по производительности профили в этом наборе: bartowski-128k-f16, bartowski-128k-q8 и unsloth-128k-q8. Все три показали одинаковую точность.
  • Кэш KV q8 не показал измеримой потери точности в этом конкретном наборе.
  • Размер контекста оказался важнее формата KV (f16 vs q8) для данного рабочего процесса. Профили с 65k не справлялись, когда требовалось более 65k токенов.
  • unsloth-128k-f16 загружался, но испытывал нехватку памяти/пропускной способности на задачах с длинным контекстом на RTX 5090.
Ad

Практические наблюдения

Автор сообщает, что Qwen чрезвычайно хорошо выявляет скрытые обходные пути, избыточность и сокращения пути реализации в Codex. Для задач, связанных с UI, Qwen берёт на себя инициативу в дизайне, пока Codex реализует. Роли меняются: Qwen оспаривает план, а человек проверяет перед каждым этапом.

Ресурсы

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Тестирование MiniMax M2.7 через API на трех реальных ML и кодинг-воркфлоу
Инструменты

Тестирование MiniMax M2.7 через API на трех реальных ML и кодинг-воркфлоу

Разработчик тестирует MiniMax M2.7 против Claude Opus 4.7 на трех реальных задачах: рефакторинг проекта PyTorch, создание заметок в Obsidian и генерация шаблона Kaggle. Ключевые выводы и настройка включены.

OpenClawRadar
MoltNow.app: Деплой OpenClaw в один клик
Инструменты

MoltNow.app: Деплой OpenClaw в один клик

Новый сервис обещает упростить развёртывание OpenClaw до одного клика с кастомным UI и браузерной автоматизацией.

MoltNow.app builder
Превратите свою базу знаний в вики-сервер + MCP для Claude
Инструменты

Превратите свою базу знаний в вики-сервер + MCP для Claude

Демонстрация того, как Akyn превращает базу знаний (URL, PDF, Notion) в вики и предоставляет ее в качестве MCP-сервера, позволяя Клоду запрашивать и записывать данные — с OAuth, контролем со стороны человека и автосинхронизацией.

OpenClawRadar
Запуск OpenClaw и Codex CLI нативно на Android через AnyClaw APK
Инструменты

Запуск OpenClaw и Codex CLI нативно на Android через AnyClaw APK

Разработчик упаковал OpenClaw и Codex CLI в APK-файл для Android под названием AnyClaw, что позволяет шлюзу и панели управления работать локально на устройствах ARM64 с Android 7.0+ без прав root. Для проекта потребовалось собрать зависимости из исходного кода и исправить несколько компонентов для работы с ограничениями Android.

OpenClawRadar