Affinage de Qwen2.5-7B à 96% de Claude Haiku avec 3$ et zéro annotateurs humains

Un développeur a affiné Qwen2.5-7B pour atteindre 96% des performances composites de Claude Haiku sur une tâche de raisonnement décisionnel spécifique au domaine — en dépensant seulement ~3$ en appels API et en utilisant zéro étiqueteur humain. La méthode, appelée DV-DPO (Decision-Validated Direct Preference Optimization), génère de manière autonome un signal d'apprentissage en exécutant un conseil contradictoire multi-voix.
Comment fonctionne DV-DPO
Le pipeline exécute un conseil à 3 voix sur chaque question décisionnelle, produisant une synthèse. Ensuite, les deux voix perdantes contre-interrogent la synthèse. Si la synthèse est révisée sous cette pression contradictoire, une paire DPO est formée : la version post-révision est la réponse choisie, et la version pré-révision est la réponse rejetée. Si la synthèse tient — aucune paire n'est créée. Cela garantit que seules les erreurs de raisonnement réelles produisent un signal d'apprentissage, et non les préférences de format ou la variance d'échantillonnage.
Résultats
- 1 040 paires d'entraînement générées au total (~3$ aux tarifs Haiku)
- Face-à-face avec Claude Haiku : Format 100%, Commits 100%, Contexte 89%, Composite 96%
- Latence : 11s sur GPU T4 (quantifié en 4 bits) contre 3s pour Haiku
- Taux d'échec contradictoire : 2% sur 96 questions ciblées
Boucle d'amélioration autonome
Le système exécute désormais un cycle automatisé : détecteur_d_échec → auto_red_team → paires DPO → réentraînement → redéploiement → évaluation. Les paires de version 5 s'accumulent. Le modèle affiné est disponible sous forme de fichier GGUF prêt pour Ollama.
À qui cela s'adresse
Les développeurs créant des agents de raisonnement spécifiques au domaine qui souhaitent passer des API payantes à l'utilisation à un modèle local affiné sans annotation humaine coûteuse.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Les autoencodeurs en langage naturel d'Anthropic transforment les activations de Claude en anglais lisible — Voici comment
Anthropic publie les Autoencodeurs en Langage Naturel (NLAs) qui convertissent les activations internes de Claude en explications en texte clair, révélant le raisonnement du modèle sur les rimes, la conscience des tests de sécurité et la détection de triche.

Titre de l'article : Homme des cavernes vs consigne « soyez bref » : évaluation comparative des prompts de compression pour Claude
Un benchmark de 24 prompts sur 5 bras constate que le prompt en deux mots 'soyez bref.' correspond à la compression caveman tant sur le nombre de tokens que sur la qualité de sortie, bien que caveman offre une cohérence structurelle et des fonctions d'échappement de sécurité.

Microsoft's BitNet permet l'inférence de LLM à 100 milliards de paramètres sur un seul CPU
Le projet open-source BitNet de Microsoft atteint une inférence de LLM à 100B paramètres à 5-7 tokens/seconde sur un seul CPU, avec le modèle à 2B paramètres utilisant 0,4 Go de mémoire et une latence de 29 ms tout en égalant les modèles en pleine précision sur les benchmarks.

Claude Code v2.1.201 abandonne le rôle système en milieu de conversation pour les sessions Sonnet 5
Claude Code v2.1.201 supprime le rôle système en milieu de conversation pour les rappels de harnais dans les sessions Claude Sonnet 5, simplifiant ainsi le contexte de chat.