Auto-ajustement supervisé sur ses propres erreurs booste les petits modèles à 80% sur HumanEval

Un développeur sur r/LocalLLaMA a mis en œuvre une boucle d'entraînement auto-supervisée où un petit modèle de langage génère ses propres problèmes de codage, tente des solutions, et s'affine sur les paires où l'interpréteur confirme l'exactitude. L'idée clé de l'article DeepSeek-R1 — que les modèles peuvent s'améliorer grâce à des récompenses vérifiables — a été appliquée sans données étiquetées par l'homme.
Méthode
Le modèle de base (commençant avec Qwen 2.5 7B) a été invité à inventer un problème de codage et quelques petits tests. Il a ensuite résolu le même problème plusieurs fois. L'interpréteur Python a agi comme seul juge : les paires (tentative erronée, tentative correcte) ont été sauvegardées. L'affinage a été effectué sur ces corrections auto-extraites. Aucun code écrit par un humain n'a été utilisé dans l'entraînement.
Résultats
- Qwen 2.5 7B base : 25 → 112 sur HumanEval (+87 problèmes) après avoir corrigé un bogue du correcteur qui tronquait les sorties de fonctions.
- Qwen 2.5 14B : A extrait 100 paires, entraîné en 95 minutes sur un H100 (3,50 $ de crédits). A obtenu un score à 4 points de la version RLHF de la même entreprise.
- Llama 3.2 3B : 32 paires → 39 → 43 sur HumanEval. Confirme la transposition entre architectures.
- Qwen 2.5 Coder 7B : Déjà spécialisé en code, mais s'est encore amélioré : HumanEval 83 → 87, MBPP 122 → 124.
- Qwen 3 4B : HumanEval 79 → 106 (+27), MBPP 135 → 148.
Expérience de contrôle
Pour vérifier que le signal ne provenait pas d'un entraînement générique, l'auteur a construit de fausses paires avec du code aléatoire et défectueux qui ne réussissait aucun test. L'entraînement sur celles-ci n'a produit aucune amélioration (25/164, identique à la base). L'amélioration provient spécifiquement de l'apprentissage sur les erreurs et corrections auto-générées.
Détails pratiques
La première tentative a échoué car le correcteur s'arrêtait tôt, coupant les sorties du modèle en deux. La correction du correcteur a été cruciale. L'ensemble de la configuration a fonctionné sur un MacBook 24 Go et un compte RunPod. Le code et les scripts d'entraînement sont probablement partagés dans le post Reddit.
À qui s'adresse cette méthode
Développeurs et chercheurs travaillant avec de petits modèles de langage qui souhaitent amorcer le raisonnement en code sans annotations humaines.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Anthropic double les limites d'utilisation de Claude Code, signe un accord de calcul avec SpaceX
Anthropic a doublé les fenêtres d'utilisation de cinq heures pour les abonnés Claude Code Pro et Max, supprimé les réductions aux heures de pointe, et augmenté les limites de l'API Opus, citant un nouvel accord avec SpaceX pour plus de 300 MW de capacité de calcul depuis le superordinateur Colossus 1 (plus de 220 000 GPU NVIDIA).

Incident de Service Claude : Augmentation des Erreurs sur Toutes les Plateformes
Claude a connu des erreurs élevées sur les plateformes claude.ai, console et Claude Code le 2 mars 2026, avec des problèmes affectant les chemins de connexion/déconnexion et certaines méthodes API. L'incident a été résolu après environ 4 heures.

Analyse des problèmes de benchmarking TB2 dans la tâche de récupération db-wal-recovery
Une analyse de Reddit révèle des problèmes avec la tâche de récupération db-wal de Terminal Bench 2.0, où les agents peuvent accidentellement détruire des preuves en ouvrant des bases de données SQLite, et montre comment l'injection de prompt affecte les résultats du classement.

Apple utilise l'accès à Google Gemini pour la distillation de modèles d'IA sur l'appareil
Apple a un accès complet au modèle Gemini de Google pour la distillation, créant ainsi des modèles d'IA plus petits et embarqués pour Siri et d'autres fonctionnalités dans iOS 27 sans nécessiter de connexion internet.