С помощью тонкой настройки Qwen2.5-7B достигли 96% производительности Claude Haiku за $3 и без участия разметчиков

Разработчик дообучил Qwen2.5-7B, достигнув 96% совокупной производительности Claude Haiku в предметно-ориентированной задаче принятия решений — потратив всего ~$3 на API-запросы и не используя людей-разметчиков. Метод, названный DV-DPO (Decision-Validated Direct Preference Optimization), автономно генерирует обучающий сигнал, запуская многоголосый оппозиционный совет.
Как работает DV-DPO
Конвейер запускает совет из 3 голосов для каждого вопроса о решении, создавая синтез. Затем два проигравших голоса перекрестно допрашивают синтез. Если синтез изменяется под этим оппозиционным давлением, формируется DPO-пара: версия после изменения считается предпочтительным ответом, а версия до изменения — отвергнутым. Если синтез остается без изменений — пара не создается. Это гарантирует, что только настоящие ошибки в рассуждениях порождают обучающий сигнал, а не предпочтения по формату или случайность выборки.
Результаты
- 1 040 обучающих пар сгенерировано всего (~$3 по тарифам Haiku)
- Сравнение с Claude Haiku: Формат 100%, Обязательства 100%, Контекст 89%, Совокупный показатель 96%
- Задержка: 11 с на T4 GPU (4-битное квантование) против 3 с у Haiku
- Частота сбоев при оппозиции: 2% на 96 целевых вопросах
Автономный цикл улучшения
Теперь система выполняет автоматизированный цикл: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. Накапливаются пары версии 5. Дообученная модель доступна в виде файла GGUF, готового к использованию в Ollama.
Для кого это
Разработчики, создающие предметно-ориентированные агенты рассуждений, которые хотят перейти от API с оплатой за запрос к локальной дообученной модели без дорогостоящей человеческой разметки.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Qwen 3.6 27B при 52.8 tps TG на AMD MI50s: полная точность, без MTP, без квантизации
Пользователь Reddit проводит бенчмарк Qwen3.6-27B на восьми AMD MI50 (видеокарты 2018 года) с использованием форка vllm с ROCm 7.2.1, достигая 52.8 tps TG и 1569 tps PP с полной точностью и без MTP.

Результаты исследований по надежности ИИ-агентов и моделям их развития
Совместный исследовательский сеанс с Claude Opus, в ходе которого были проанализированы 15 статей об ИИ-агентах, выявил количественные проблемы надежности: агенты генерируют 2-4 различных последовательности действий за 10 запусков, причем 69% расхождений происходит при первом же решении. Самообучающиеся агенты продемонстрировали снижение уровня отказов по соображениям безопасности с 99,4% до 54,4% благодаря собственному обучению.

Разработчик предпочитает Qwen3.5-27B проприетарным моделям из-за её режима отказа.
Разработчик на r/LocalLLaMA сообщает, что предпочитает Qwen3.5-27B перед Gemini 3.1 Pro и GPT-5.3 Codex, потому что он отказывается от проблемных задач, вместо того чтобы генерировать потенциально опасный код, такой как неограниченные скрипты на Perl или NodeJS.

Anthropic выпускает Claude Code Remote Control для мобильной разработки
Anthropic запустила функцию Remote Control, которая позволяет пользователям Claude Code управлять локальными сессиями разработки с мобильных устройств. Изначально доступна подписчикам Claude Max, требует версии 2.1.52 и использует QR-код для синхронизации сессий.