Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex

Разработчик на r/LocalLLaMA запускает локальную модель Qwen параллельно с OpenAI Codex в качестве валидатора и оппонента, и создал небольшой воспроизводимый набор тестов, чтобы определить, какие профили квантования GGUF лучше всего подходят для этой роли. Рабочий процесс: Codex занимается основной работой с репозиторием; локальный Qwen оспаривает план, проверяет на избыточность, пропущенные жёсткие указания, проблемы с UI/дизайном, ошибочные предположения и упущения длинного контекста. Автор проверяет каждое взаимодействие перед выполнением.
Настройка набора тестов
Набор тестирует профили Qwen 3.6 27B GGUF через llama.cpp, включая варианты Bartowski и Unsloth с разными размерами контекста и форматами кэша KV (q8, f16). Основное внимание уделяется реальным ошибкам: пропущенные указания, плохое поведение при оспаривании, избыточность, оценка UI и упущения длинного контекста.
Ключевые выводы
- Лучшие по производительности профили в этом наборе:
bartowski-128k-f16,bartowski-128k-q8иunsloth-128k-q8. Все три показали одинаковую точность. - Кэш KV q8 не показал измеримой потери точности в этом конкретном наборе.
- Размер контекста оказался важнее формата KV (f16 vs q8) для данного рабочего процесса. Профили с 65k не справлялись, когда требовалось более 65k токенов.
unsloth-128k-f16загружался, но испытывал нехватку памяти/пропускной способности на задачах с длинным контекстом на RTX 5090.
Практические наблюдения
Автор сообщает, что Qwen чрезвычайно хорошо выявляет скрытые обходные пути, избыточность и сокращения пути реализации в Codex. Для задач, связанных с UI, Qwen берёт на себя инициативу в дизайне, пока Codex реализует. Роли меняются: Qwen оспаривает план, а человек проверяет перед каждым этапом.
Ресурсы
- Страница проекта: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Репозиторий: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Google выпускает Sashiko: агент для проверки кода с помощью ИИ для патчей ядра Linux.
Инженеры Google открыли исходный код Sashiko, агентной системы ИИ для проверки кода, разработанной для ядра Linux. Она обнаружила 53% ошибок в нефильтрованном наборе из 1000 недавних проблем в основном репозитории, которые были пропущены людьми.

DecisionNode: CLI и MCP-сервер для семантического хранения решений
DecisionNode — это локальный CLI и MCP-сервер, который хранит структурированные решения в формате JSON, преобразует их в векторные представления для семантического поиска и делает доступными для различных AI-инструментов через MCP. Распространяется под лицензией MIT и предназначен для работы с Claude Code, Cursor, Windsurf, Antigravity и другими MCP-клиентами.

SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов
SubQ — это полностью субквадратичная разреженная LLM, обеспечивающая окно контекста в 12 млн токенов при скорости 150 токенов/с, с показателями SWE-Bench Verified 81.8% и RULER @ 128K 95.0%. Она уменьшает вычислительные затраты на внимание примерно в 1000 раз по сравнению с трансформерами.

SIDJUA V1.0: Самостоятельная платформа управления для ИИ-агентов
SIDJUA V1.0 — это бесплатная, саморазмещаемая платформа управления для ИИ-агентов, работающая на Docker, включая Raspberry Pi. Она предоставляет обязательные контрольные точки для задач агентов, зашифрованное хранение учетных данных, изоляцию сети и детализированный контроль бюджета.