Le modèle Qwen3-0.6B affiné surpasse l'enseignant de 120B sur l'appel de fonction structuré.

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
Le modèle Qwen3-0.6B affiné surpasse l'enseignant de 120B sur l'appel de fonction structuré.
Ad

Ce que c'est

Distil Labs a publié un pipeline complet qui affine un petit modèle Qwen3 de 0,6 milliard de paramètres pour surpasser un modèle enseignant de 120 milliards de paramètres sur des tâches d'appel de fonctions structurées. Le pipeline extrait des traces de production, génère des données d'entraînement synthétiques et entraîne un modèle spécialisé 200 fois plus petit que l'enseignant.

Résultats de performance

  • Enseignant (GPT-OSS-120B) : 50,0 % d'équivalence d'appel d'outil
  • Qwen3-0.6B de base (sans affinage) : 10,3 % d'équivalence d'appel d'outil
  • Qwen3-0.6B affiné : 79,5 % d'équivalence d'appel d'outil

La tâche est l'appel de fonctions pour la domotique IoT : router des commandes en langage naturel comme "allume les lumières de la cuisine" ou "prépare-moi un café à 7h" vers la fonction correcte avec les bons paramètres. Le score est basé sur une correspondance structurée exacte, pas sur un score approximatif.

Pourquoi le petit modèle gagne

L'enseignant de 120B est un modèle polyvalent qui n'a jamais vu ces schémas de fonctions spécifiques ou ces modèles de formulation utilisateur. Il produit souvent des réponses verbeuses ou légèrement mal formatées. L'étudiant de 0,6B est un spécialiste entraîné exclusivement sur cette tâche, donc il maîtrise constamment le format de sortie exact.

Ad

Architecture du pipeline

Le pipeline en trois étapes :

  1. Extraction de données : dlt extrait des traces de production depuis des bases de données, des API, du stockage cloud ou des agrégateurs de logs et les écrit sur Hugging Face sous forme de jeux de données Parquet propres
  2. Curatation automatique : Un juge LLM note et filtre les traces pour sélectionner des exemples de départ de haute qualité (aucune annotation manuelle requise)
  3. Génération de données synthétiques et entraînement : Distil Labs utilise les traces comme contexte de domaine, génère environ 10 000 exemples d'entraînement synthétiques avec un grand enseignant, les valide et les filtre, puis affine le modèle étudiant

L'idée clé : au lieu d'entraîner directement sur des traces brutes, elles sont utilisées comme contexte pour que le générateur de données synthétiques produise des exemples correspondant au vocabulaire réel, aux schémas de fonctions et aux modèles de formulation des utilisateurs réels.

Jeu de données et détails pratiques

  • Utilisation du jeu de données Amazon MASSIVE (16k+ énoncés, 60 intentions) comme substitut du trafic de production
  • Filtré pour le scénario IoT avec 9 fonctions de domotique
  • Environ 75 exemples de départ étiquetés étaient suffisants (curatation automatique, zéro annotation manuelle)
  • Entraînement terminé en moins de 12 heures
  • Inférence du modèle : moins de 50 ms localement contre 400-700 ms pour les appels d'API cloud
  • Modèle disponible aux formats safetensors et GGUF sur Hugging Face

Considérations pour la production

Le modèle obtient 79,5 % de correspondance exacte, ce qui signifie qu'environ 1 requête sur 5 peut nécessiter une solution de repli. Pour une utilisation en production, vous voudriez un seuil de confiance routant les prédictions à faible confiance vers un modèle plus grand.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Examen des performances d'Omnicoder-9B : Vitesse contre problèmes d'appel d'outils
Tools

Examen des performances d'Omnicoder-9B : Vitesse contre problèmes d'appel d'outils

Omnicoder-9B, un modèle axé sur le codage affiné sur Qwen3.5 9B avec des sorties d'Opus 4.6, GPT 5.4, GPT 5.3 Codex et Gemini 3.1 Pro, montre de solides performances sur du matériel de milieu de gamme mais présente des problèmes d'appel d'outils dans les IDE.

OpenClawRadar
OpenMontage : Système de Production Vidéo Agentique Open-Source pour Assistants de Codage IA
Tools

OpenMontage : Système de Production Vidéo Agentique Open-Source pour Assistants de Codage IA

OpenMontage est un système de production vidéo open-source qui transforme les assistants de codage IA comme Claude Code en studios de production complets. Il gère la recherche, la planification des scènes, l'écriture du scénario, la narration vocale, la sélection musicale, la génération de sous-titres et la validation via des pipelines automatisés.

OpenClawRadar
Création d'un cycle de rêve auto-améliorant avec les tâches Cron et Claude
Tools

Création d'un cycle de rêve auto-améliorant avec les tâches Cron et Claude

Un développeur a créé un cycle de rêve autonome en utilisant deux tâches cron : l'une à 22h30 pour la recherche et la réflexion, et l'autre à 23h00 pour la revue et la planification. Le système scanne arXiv, GitHub trending et Reddit, identifie les faiblesses et propose des améliorations concrètes.

OpenClawRadar
Fiche de Code Claude Imprimable avec Mises à Jour Automatiques Hebdomadaires
Tools

Fiche de Code Claude Imprimable avec Mises à Jour Automatiques Hebdomadaires

Un développeur a créé une feuille de triche imprimable pour Claude Code qui se met à jour automatiquement chaque semaine. La feuille a été générée en utilisant Claude lui-même après avoir étudié les fonctionnalités de la documentation et de GitHub.

OpenClawRadar