Le modèle Qwen3-0.6B affiné surpasse l'enseignant de 120B sur l'appel de fonction structuré.

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
Le modèle Qwen3-0.6B affiné surpasse l'enseignant de 120B sur l'appel de fonction structuré.
Ad

Ce que c'est

Distil Labs a publié un pipeline complet qui affine un petit modèle Qwen3 de 0,6 milliard de paramètres pour surpasser un modèle enseignant de 120 milliards de paramètres sur des tâches d'appel de fonctions structurées. Le pipeline extrait des traces de production, génère des données d'entraînement synthétiques et entraîne un modèle spécialisé 200 fois plus petit que l'enseignant.

Résultats de performance

  • Enseignant (GPT-OSS-120B) : 50,0 % d'équivalence d'appel d'outil
  • Qwen3-0.6B de base (sans affinage) : 10,3 % d'équivalence d'appel d'outil
  • Qwen3-0.6B affiné : 79,5 % d'équivalence d'appel d'outil

La tâche est l'appel de fonctions pour la domotique IoT : router des commandes en langage naturel comme "allume les lumières de la cuisine" ou "prépare-moi un café à 7h" vers la fonction correcte avec les bons paramètres. Le score est basé sur une correspondance structurée exacte, pas sur un score approximatif.

Pourquoi le petit modèle gagne

L'enseignant de 120B est un modèle polyvalent qui n'a jamais vu ces schémas de fonctions spécifiques ou ces modèles de formulation utilisateur. Il produit souvent des réponses verbeuses ou légèrement mal formatées. L'étudiant de 0,6B est un spécialiste entraîné exclusivement sur cette tâche, donc il maîtrise constamment le format de sortie exact.

Ad

Architecture du pipeline

Le pipeline en trois étapes :

  1. Extraction de données : dlt extrait des traces de production depuis des bases de données, des API, du stockage cloud ou des agrégateurs de logs et les écrit sur Hugging Face sous forme de jeux de données Parquet propres
  2. Curatation automatique : Un juge LLM note et filtre les traces pour sélectionner des exemples de départ de haute qualité (aucune annotation manuelle requise)
  3. Génération de données synthétiques et entraînement : Distil Labs utilise les traces comme contexte de domaine, génère environ 10 000 exemples d'entraînement synthétiques avec un grand enseignant, les valide et les filtre, puis affine le modèle étudiant

L'idée clé : au lieu d'entraîner directement sur des traces brutes, elles sont utilisées comme contexte pour que le générateur de données synthétiques produise des exemples correspondant au vocabulaire réel, aux schémas de fonctions et aux modèles de formulation des utilisateurs réels.

Jeu de données et détails pratiques

  • Utilisation du jeu de données Amazon MASSIVE (16k+ énoncés, 60 intentions) comme substitut du trafic de production
  • Filtré pour le scénario IoT avec 9 fonctions de domotique
  • Environ 75 exemples de départ étiquetés étaient suffisants (curatation automatique, zéro annotation manuelle)
  • Entraînement terminé en moins de 12 heures
  • Inférence du modèle : moins de 50 ms localement contre 400-700 ms pour les appels d'API cloud
  • Modèle disponible aux formats safetensors et GGUF sur Hugging Face

Considérations pour la production

Le modèle obtient 79,5 % de correspondance exacte, ce qui signifie qu'environ 1 requête sur 5 peut nécessiter une solution de repli. Pour une utilisation en production, vous voudriez un seuil de confiance routant les prédictions à faible confiance vers un modèle plus grand.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Pizza Bot : Boîte de réception auto-hébergée pour agents IA de longue durée, Apache 2.0

Pizza Bot est une application de bureau auto-hébergée pour Mac, Windows et Linux qui exécute des agents IA en arrière-plan derrière une interface de type e-mail. Le travail terminé arrive dans Non lus, les approbations font la queue dans Action.

OpenClawRadar
engram v3.4.0 ajoute un plugin Anthropic pour maintenir le fonctionnement de Claude Code sous les nouvelles limites de débit
Tools

engram v3.4.0 ajoute un plugin Anthropic pour maintenir le fonctionnement de Claude Code sous les nouvelles limites de débit

engram v3.4.0 introduit un plugin dédié à Anthropic pour Claude Code, ajoutant trois compétences pour gérer les coûts, interroger le contexte et faire remonter les erreurs. Installez avec `/plugin install engram` ou `npm install -g engramx@latest`.

OpenClawRadar
Lumyr : Génération de Tableaux de Bord via Claude avec Automatisation Python et Streamlit
Tools

Lumyr : Génération de Tableaux de Bord via Claude avec Automatisation Python et Streamlit

Lumyr est un outil qui génère des tableaux de bord en direct et partageables à partir de descriptions en anglais simple, utilisant Claude pour la génération des tableaux de bord et automatisant la couche Python et Streamlit. Les utilisateurs n'ont pas besoin d'écrire du Python, d'ouvrir Streamlit, de déployer, de configurer l'hébergement ou de gérer l'infrastructure.

OpenClawRadar
Support officiel de Kotlin pour VS Code désormais en alpha — Propulsé par le serveur de langage d'IntelliJ
Tools

Support officiel de Kotlin pour VS Code désormais en alpha — Propulsé par le serveur de langage d'IntelliJ

JetBrains a publié l'extension officielle Kotlin pour VS Code en version Alpha, basée sur le serveur de langage Kotlin construit sur l'infrastructure d'analyse de code d'IntelliJ IDEA. Elle inclut la complétion de code, les diagnostics, la navigation, les correctifs rapides, le formatage et l'import de projet.

OpenClawRadar