Auto-ajustement supervisé sur ses propres erreurs booste les petits modèles à 80% sur HumanEval

✍️ OpenClawRadar📅 Publié: May 15, 2026🔗 Source
Auto-ajustement supervisé sur ses propres erreurs booste les petits modèles à 80% sur HumanEval
Ad

Un développeur sur r/LocalLLaMA a mis en œuvre une boucle d'entraînement auto-supervisée où un petit modèle de langage génère ses propres problèmes de codage, tente des solutions, et s'affine sur les paires où l'interpréteur confirme l'exactitude. L'idée clé de l'article DeepSeek-R1 — que les modèles peuvent s'améliorer grâce à des récompenses vérifiables — a été appliquée sans données étiquetées par l'homme.

Méthode

Le modèle de base (commençant avec Qwen 2.5 7B) a été invité à inventer un problème de codage et quelques petits tests. Il a ensuite résolu le même problème plusieurs fois. L'interpréteur Python a agi comme seul juge : les paires (tentative erronée, tentative correcte) ont été sauvegardées. L'affinage a été effectué sur ces corrections auto-extraites. Aucun code écrit par un humain n'a été utilisé dans l'entraînement.

Résultats

  • Qwen 2.5 7B base : 25 → 112 sur HumanEval (+87 problèmes) après avoir corrigé un bogue du correcteur qui tronquait les sorties de fonctions.
  • Qwen 2.5 14B : A extrait 100 paires, entraîné en 95 minutes sur un H100 (3,50 $ de crédits). A obtenu un score à 4 points de la version RLHF de la même entreprise.
  • Llama 3.2 3B : 32 paires → 39 → 43 sur HumanEval. Confirme la transposition entre architectures.
  • Qwen 2.5 Coder 7B : Déjà spécialisé en code, mais s'est encore amélioré : HumanEval 83 → 87, MBPP 122 → 124.
  • Qwen 3 4B : HumanEval 79 → 106 (+27), MBPP 135 → 148.
Ad

Expérience de contrôle

Pour vérifier que le signal ne provenait pas d'un entraînement générique, l'auteur a construit de fausses paires avec du code aléatoire et défectueux qui ne réussissait aucun test. L'entraînement sur celles-ci n'a produit aucune amélioration (25/164, identique à la base). L'amélioration provient spécifiquement de l'apprentissage sur les erreurs et corrections auto-générées.

Détails pratiques

La première tentative a échoué car le correcteur s'arrêtait tôt, coupant les sorties du modèle en deux. La correction du correcteur a été cruciale. L'ensemble de la configuration a fonctionné sur un MacBook 24 Go et un compte RunPod. Le code et les scripts d'entraînement sont probablement partagés dans le post Reddit.

À qui s'adresse cette méthode

Développeurs et chercheurs travaillant avec de petits modèles de langage qui souhaitent amorcer le raisonnement en code sans annotations humaines.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

L'analyse de Goldman Sachs montre un impact minimal de l'IA sur la croissance du PIB américain en 2025.
News

L'analyse de Goldman Sachs montre un impact minimal de l'IA sur la croissance du PIB américain en 2025.

Les économistes de Goldman Sachs rapportent que l'investissement en IA a contribué 'pratiquement zéro' à la croissance du PIB américain en 2025, citant le matériel importé et les impacts de productivité non mesurés comme facteurs clés.

OpenClawRadar
Apple offre son service Private Cloud Compute gratuit aux développeurs indépendants de moins de 2 millions de téléchargements
News

Apple offre son service Private Cloud Compute gratuit aux développeurs indépendants de moins de 2 millions de téléchargements

Apple a annoncé à la WWDC 2026 que les développeurs avec moins de 2 millions de premiers téléchargements sur l'App Store peuvent utiliser ses Foundation Models dans Private Cloud Compute sans coût d'API cloud. Le framework gagne également l'entrée d'image et le support des modèles serveur.

OpenClawRadar
Système Claude Code Prompts v2.1.51/52 : Nouveaux Prompts, Mises à Jour du SDK et Fonctionnalités en Disponibilité Générale
News

Système Claude Code Prompts v2.1.51/52 : Nouveaux Prompts, Mises à Jour du SDK et Fonctionnalités en Disponibilité Générale

Les invites système Claude Code v2.1.51 et v2.1.52 ajoutent six nouvelles invites, mettent à jour les références SDK/API dans sept langages, et promeuvent l'exécution de code et la mémoire en disponibilité générale. Le SDK Agent Python a été retravaillé avec des changements asynchrones et de nouvelles interfaces.

OpenClawRadar
Anthropic's Claude Fable 5 : Les tests montrent des gains importants, mais les tarifs et les limites de débit inquiètent les développeurs
News

Anthropic's Claude Fable 5 : Les tests montrent des gains importants, mais les tarifs et les limites de débit inquiètent les développeurs

Claude Fable 5 arrive avec des benchmarks solides en codage et tâches agentiques, mais les développeurs s'inquiètent des tarifs API et des limites de débit.

OpenClawRadar