С помощью тонкой настройки Qwen2.5-7B достигли 96% производительности Claude Haiku за $3 и без участия разметчиков

Разработчик дообучил Qwen2.5-7B, достигнув 96% совокупной производительности Claude Haiku в предметно-ориентированной задаче принятия решений — потратив всего ~$3 на API-запросы и не используя людей-разметчиков. Метод, названный DV-DPO (Decision-Validated Direct Preference Optimization), автономно генерирует обучающий сигнал, запуская многоголосый оппозиционный совет.
Как работает DV-DPO
Конвейер запускает совет из 3 голосов для каждого вопроса о решении, создавая синтез. Затем два проигравших голоса перекрестно допрашивают синтез. Если синтез изменяется под этим оппозиционным давлением, формируется DPO-пара: версия после изменения считается предпочтительным ответом, а версия до изменения — отвергнутым. Если синтез остается без изменений — пара не создается. Это гарантирует, что только настоящие ошибки в рассуждениях порождают обучающий сигнал, а не предпочтения по формату или случайность выборки.
Результаты
- 1 040 обучающих пар сгенерировано всего (~$3 по тарифам Haiku)
- Сравнение с Claude Haiku: Формат 100%, Обязательства 100%, Контекст 89%, Совокупный показатель 96%
- Задержка: 11 с на T4 GPU (4-битное квантование) против 3 с у Haiku
- Частота сбоев при оппозиции: 2% на 96 целевых вопросах
Автономный цикл улучшения
Теперь система выполняет автоматизированный цикл: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. Накапливаются пары версии 5. Дообученная модель доступна в виде файла GGUF, готового к использованию в Ollama.
Для кого это
Разработчики, создающие предметно-ориентированные агенты рассуждений, которые хотят перейти от API с оплатой за запрос к локальной дообученной модели без дорогостоящей человеческой разметки.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.
Claude Code v2.1.273 добавляет заголовки-подсказки шлюза, оповещения о переподключении MCP и форкинг сессий удалённого управления
Claude Code v2.1.273 добавляет опциональные заголовки запросов LLM-шлюза, уведомление об отключении MCP, форкинг сессий Remote Control, а также исправляет ошибки авто-компакта контекстного счётчика.

Claude-Code v2.1.72: улучшения SSH, сокращение запросов разрешений и исправления ошибок
Claude-Code v2.1.72 добавляет удобную запись файлов по SSH с помощью ключа /copy w, сокращает запросы разрешений bash, добавляя общие инструменты в белый список автоматического одобрения, и исправляет более 20 ошибок, включая проблемы с голосовым режимом и установкой плагинов.
Claude Code v2.1.208: Режим экранного чтения, переназначения Vim, исправления утечек памяти и другое
Claude Code v2.1.208 добавляет опциональный режим экранного диктора с обычным текстом, переназначение последовательностей в режиме вставки vim, обёртку процессов для корпоративных лаунчеров и исправляет десятки ошибок, включая утечки памяти в длительных сеансах.