С помощью тонкой настройки Qwen2.5-7B достигли 96% производительности Claude Haiku за $3 и без участия разметчиков

✍️ OpenClawRadar📅 Опубликовано: 11 июня 2026 г.🔗 Source
С помощью тонкой настройки Qwen2.5-7B достигли 96% производительности Claude Haiku за $3 и без участия разметчиков
Ad

Разработчик дообучил Qwen2.5-7B, достигнув 96% совокупной производительности Claude Haiku в предметно-ориентированной задаче принятия решений — потратив всего ~$3 на API-запросы и не используя людей-разметчиков. Метод, названный DV-DPO (Decision-Validated Direct Preference Optimization), автономно генерирует обучающий сигнал, запуская многоголосый оппозиционный совет.

Как работает DV-DPO

Конвейер запускает совет из 3 голосов для каждого вопроса о решении, создавая синтез. Затем два проигравших голоса перекрестно допрашивают синтез. Если синтез изменяется под этим оппозиционным давлением, формируется DPO-пара: версия после изменения считается предпочтительным ответом, а версия до изменения — отвергнутым. Если синтез остается без изменений — пара не создается. Это гарантирует, что только настоящие ошибки в рассуждениях порождают обучающий сигнал, а не предпочтения по формату или случайность выборки.

Ad

Результаты

  • 1 040 обучающих пар сгенерировано всего (~$3 по тарифам Haiku)
  • Сравнение с Claude Haiku: Формат 100%, Обязательства 100%, Контекст 89%, Совокупный показатель 96%
  • Задержка: 11 с на T4 GPU (4-битное квантование) против 3 с у Haiku
  • Частота сбоев при оппозиции: 2% на 96 целевых вопросах

Автономный цикл улучшения

Теперь система выполняет автоматизированный цикл: failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. Накапливаются пары версии 5. Дообученная модель доступна в виде файла GGUF, готового к использованию в Ollama.

Для кого это

Разработчики, создающие предметно-ориентированные агенты рассуждений, которые хотят перейти от API с оплатой за запрос к локальной дообученной модели без дорогостоящей человеческой разметки.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Новости

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире

Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.

OpenClawRadar
🦀
Новости

Claude Code v2.1.273 добавляет заголовки-подсказки шлюза, оповещения о переподключении MCP и форкинг сессий удалённого управления

Claude Code v2.1.273 добавляет опциональные заголовки запросов LLM-шлюза, уведомление об отключении MCP, форкинг сессий Remote Control, а также исправляет ошибки авто-компакта контекстного счётчика.

OpenClawRadar
Claude-Code v2.1.72: улучшения SSH, сокращение запросов разрешений и исправления ошибок
Новости

Claude-Code v2.1.72: улучшения SSH, сокращение запросов разрешений и исправления ошибок

Claude-Code v2.1.72 добавляет удобную запись файлов по SSH с помощью ключа /copy w, сокращает запросы разрешений bash, добавляя общие инструменты в белый список автоматического одобрения, и исправляет более 20 ошибок, включая проблемы с голосовым режимом и установкой плагинов.

OpenClawRadar
🦀
Новости

Claude Code v2.1.208: Режим экранного чтения, переназначения Vim, исправления утечек памяти и другое

Claude Code v2.1.208 добавляет опциональный режим экранного диктора с обычным текстом, переназначение последовательностей в режиме вставки vim, обёртку процессов для корпоративных лаунчеров и исправляет десятки ошибок, включая утечки памяти в длительных сеансах.

OpenClawRadar