Les tests comparatifs montrent que les modèles distillés égalent les LLM de pointe sur les tâches structurées, pour un coût 10 fois inférieur.

Résultats de référence : Modèles distillés vs modèles de pointe
Les chercheurs ont mené une comparaison exhaustive des petits modèles distillés face aux LLM de pointe sur 9 ensembles de données couvrant des tâches de classification, d'appel de fonction, de Q/R et de Q/R en livre ouvert. Tous les modèles distillés proviennent de la famille Qwen3 (0,6B à 8B), entraînés avec seulement 50 exemples en utilisant des modèles enseignants à poids ouverts, sans recours aux sorties d'API de pointe pour l'entraînement.
Principaux résultats de performance
- Les modèles distillés égalent ou surpassent le meilleur modèle de pointe de niveau intermédiaire (<1 $/MTok d'entrée) sur 6 tâches sur 9, et sont pratiquement à égalité sur une 7e
- Text2SQL : Qwen3-4B distillé atteint 98,0 % contre 98,7 % pour Claude Haiku, 96,0 % pour GPT-5 nano, à 3 $/M de requêtes contre respectivement 378 $ et 24 $
- Maison intelligente (appel de fonction) : Qwen3-0,6B obtient 98,7 % contre 92,0 % pour Gemini Flash
- HotpotQA : Les modèles distillés obtiennent 92,0 % contre 98,0 % pour Haiku – le raisonnement ouvert avec connaissance du monde reste le territoire des modèles de pointe
- Tâches de classification (Banking77, E-commerce, TREC) : Les modèles distillés sont à 0-1,5 point de pourcentage du meilleur modèle de pointe
Performance d'inférence
Les modèles ont été servis via vLLM sur un seul H100 avec les performances suivantes pour le modèle Text2SQL 4B :
- 222 RPS soutenus
- p50 : 390 ms, p95 : 640 ms, p99 : 870 ms
- 7,6 GiB de VRAM (BF16, sans quantification)
- FP8 a donné +15 % de débit, -44 % de mémoire, sans perte de précision dans des expériences brèves
Méthodologie
- Mêmes ensembles de test, mêmes prompts, mêmes critères d'évaluation pour tous les modèles
- Modèles de pointe exécutés 3 fois par ensemble de données (moyenne ± écart-type rapportée), modèles distillés à temp=0
- Évaluation : correspondance exacte pour la classification, équivalence d'appel d'outil (comparaison JSON avec normalisation des paramètres par défaut) pour l'appel de fonction, Claude Sonnet 4.6 comme LLM-en-tant-que-juge pour la génération
- Coût : pointe = utilisation mesurée de tokens d'API × tarification publiée (fév. 2026). Distillé = H100 à 2,40 $/h ÷ RPS soutenu mesuré
Recommandations pratiques
- Distiller : tâches structurées, schémas bien définis, volume élevé, exigences de souveraineté des données
- API de pointe : connaissance générale du monde, génération libre, faible volume
- Meilleure configuration : router entre les deux
Ressources disponibles
Tout le code, les modèles, les données et les scripts d'évaluation sont open source sur https://github.com/distil-labs/inference-efficiency-benchmarks/
Article de blog complet avec graphiques et analyses par ensemble de données : https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Explorer n8n comme alternative aux compétences OpenClaw pour l'automatisation
La communauté OpenClaw sur Reddit débat des avantages et inconvénients de l'utilisation de n8n par rapport aux compétences OpenClaw pour les tâches d'automatisation. Les points clés de discussion incluent la facilité d'utilisation, la flexibilité et des exemples d'applications concrètes.

Pourquoi le pilotage d'activation d'Anthropic a du mal à générer du JSON valide
Le pilotage d'activation, une technique utilisée pour la sécurité de l'IA, échoue à générer du JSON valide, n'atteignant que 24,4 % de validité contre 86,8 % pour le modèle de base non entraîné.

Anthropic lance 10 agents IA financiers pour les pitchbooks, KYC et clôture mensuelle
Anthropic a lancé 10 agents IA prêts à l'emploi pour les services financiers et l'assurance, couvrant la création de pitchbooks, le filtrage KYC et la clôture mensuelle, livrés via Claude Cowork, Claude Code et Managed Agents.

MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6
MiMo-V2.5-Pro rivalise avec Kimi K2.6 dans les parties autonomes de Blood on the Clocktower, avec un taux de victoire déséquilibré de 88 % pour le camp du Bien contre 48 % pour le camp du Mal, coûte 0,99 $ par partie pour 183 000 jetons de sortie, et est pratique avec des matchs de 2 à 3 heures.