Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex

✍️ OpenClawRadar📅 Опубликовано: 4 мая 2026 г.🔗 Source
Тестирование локального Qwen 3.6 27B в качестве соагента-валидатора Codex
Ad

Разработчик на r/LocalLLaMA запускает локальную модель Qwen параллельно с OpenAI Codex в качестве валидатора и оппонента, и создал небольшой воспроизводимый набор тестов, чтобы определить, какие профили квантования GGUF лучше всего подходят для этой роли. Рабочий процесс: Codex занимается основной работой с репозиторием; локальный Qwen оспаривает план, проверяет на избыточность, пропущенные жёсткие указания, проблемы с UI/дизайном, ошибочные предположения и упущения длинного контекста. Автор проверяет каждое взаимодействие перед выполнением.

Настройка набора тестов

Набор тестирует профили Qwen 3.6 27B GGUF через llama.cpp, включая варианты Bartowski и Unsloth с разными размерами контекста и форматами кэша KV (q8, f16). Основное внимание уделяется реальным ошибкам: пропущенные указания, плохое поведение при оспаривании, избыточность, оценка UI и упущения длинного контекста.

Ключевые выводы

  • Лучшие по производительности профили в этом наборе: bartowski-128k-f16, bartowski-128k-q8 и unsloth-128k-q8. Все три показали одинаковую точность.
  • Кэш KV q8 не показал измеримой потери точности в этом конкретном наборе.
  • Размер контекста оказался важнее формата KV (f16 vs q8) для данного рабочего процесса. Профили с 65k не справлялись, когда требовалось более 65k токенов.
  • unsloth-128k-f16 загружался, но испытывал нехватку памяти/пропускной способности на задачах с длинным контекстом на RTX 5090.
Ad

Практические наблюдения

Автор сообщает, что Qwen чрезвычайно хорошо выявляет скрытые обходные пути, избыточность и сокращения пути реализации в Codex. Для задач, связанных с UI, Qwen берёт на себя инициативу в дизайне, пока Codex реализует. Роли меняются: Qwen оспаривает план, а человек проверяет перед каждым этапом.

Ресурсы

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Google выпускает Sashiko: агент для проверки кода с помощью ИИ для патчей ядра Linux.
Инструменты

Google выпускает Sashiko: агент для проверки кода с помощью ИИ для патчей ядра Linux.

Инженеры Google открыли исходный код Sashiko, агентной системы ИИ для проверки кода, разработанной для ядра Linux. Она обнаружила 53% ошибок в нефильтрованном наборе из 1000 недавних проблем в основном репозитории, которые были пропущены людьми.

OpenClawRadar
DecisionNode: CLI и MCP-сервер для семантического хранения решений
Инструменты

DecisionNode: CLI и MCP-сервер для семантического хранения решений

DecisionNode — это локальный CLI и MCP-сервер, который хранит структурированные решения в формате JSON, преобразует их в векторные представления для семантического поиска и делает доступными для различных AI-инструментов через MCP. Распространяется под лицензией MIT и предназначен для работы с Claude Code, Cursor, Windsurf, Antigravity и другими MCP-клиентами.

OpenClawRadar
SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов
Инструменты

SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов

SubQ — это полностью субквадратичная разреженная LLM, обеспечивающая окно контекста в 12 млн токенов при скорости 150 токенов/с, с показателями SWE-Bench Verified 81.8% и RULER @ 128K 95.0%. Она уменьшает вычислительные затраты на внимание примерно в 1000 раз по сравнению с трансформерами.

OpenClawRadar
SIDJUA V1.0: Самостоятельная платформа управления для ИИ-агентов
Инструменты

SIDJUA V1.0: Самостоятельная платформа управления для ИИ-агентов

SIDJUA V1.0 — это бесплатная, саморазмещаемая платформа управления для ИИ-агентов, работающая на Docker, включая Raspberry Pi. Она предоставляет обязательные контрольные точки для задач агентов, зашифрованное хранение учетных данных, изоляцию сети и детализированный контроль бюджета.

OpenClawRadar