Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex

Разработчик на r/LocalLLaMA запускает локальную модель Qwen параллельно с OpenAI Codex в качестве валидатора и оппонента, и создал небольшой воспроизводимый набор тестов, чтобы определить, какие профили квантования GGUF лучше всего подходят для этой роли. Рабочий процесс: Codex занимается основной работой с репозиторием; локальный Qwen оспаривает план, проверяет на избыточность, пропущенные жёсткие указания, проблемы с UI/дизайном, ошибочные предположения и упущения длинного контекста. Автор проверяет каждое взаимодействие перед выполнением.
Настройка набора тестов
Набор тестирует профили Qwen 3.6 27B GGUF через llama.cpp, включая варианты Bartowski и Unsloth с разными размерами контекста и форматами кэша KV (q8, f16). Основное внимание уделяется реальным ошибкам: пропущенные указания, плохое поведение при оспаривании, избыточность, оценка UI и упущения длинного контекста.
Ключевые выводы
- Лучшие по производительности профили в этом наборе:
bartowski-128k-f16,bartowski-128k-q8иunsloth-128k-q8. Все три показали одинаковую точность. - Кэш KV q8 не показал измеримой потери точности в этом конкретном наборе.
- Размер контекста оказался важнее формата KV (f16 vs q8) для данного рабочего процесса. Профили с 65k не справлялись, когда требовалось более 65k токенов.
unsloth-128k-f16загружался, но испытывал нехватку памяти/пропускной способности на задачах с длинным контекстом на RTX 5090.
Практические наблюдения
Автор сообщает, что Qwen чрезвычайно хорошо выявляет скрытые обходные пути, избыточность и сокращения пути реализации в Codex. Для задач, связанных с UI, Qwen берёт на себя инициативу в дизайне, пока Codex реализует. Роли меняются: Qwen оспаривает план, а человек проверяет перед каждым этапом.
Ресурсы
- Страница проекта: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Репозиторий: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Тестирование MiniMax M2.7 через API на трех реальных ML и кодинг-воркфлоу
Разработчик тестирует MiniMax M2.7 против Claude Opus 4.7 на трех реальных задачах: рефакторинг проекта PyTorch, создание заметок в Obsidian и генерация шаблона Kaggle. Ключевые выводы и настройка включены.

MoltNow.app: Деплой OpenClaw в один клик
Новый сервис обещает упростить развёртывание OpenClaw до одного клика с кастомным UI и браузерной автоматизацией.

Превратите свою базу знаний в вики-сервер + MCP для Claude
Демонстрация того, как Akyn превращает базу знаний (URL, PDF, Notion) в вики и предоставляет ее в качестве MCP-сервера, позволяя Клоду запрашивать и записывать данные — с OAuth, контролем со стороны человека и автосинхронизацией.

Запуск OpenClaw и Codex CLI нативно на Android через AnyClaw APK
Разработчик упаковал OpenClaw и Codex CLI в APK-файл для Android под названием AnyClaw, что позволяет шлюзу и панели управления работать локально на устройствах ARM64 с Android 7.0+ без прав root. Для проекта потребовалось собрать зависимости из исходного кода и исправить несколько компонентов для работы с ограничениями Android.