Les tests comparatifs montrent que les modèles distillés égalent les LLM de pointe sur les tâches structurées, pour un coût 10 fois inférieur.

✍️ OpenClawRadar📅 Publié: March 7, 2026🔗 Source
Les tests comparatifs montrent que les modèles distillés égalent les LLM de pointe sur les tâches structurées, pour un coût 10 fois inférieur.
Ad

Résultats de référence : Modèles distillés vs modèles de pointe

Les chercheurs ont mené une comparaison exhaustive des petits modèles distillés face aux LLM de pointe sur 9 ensembles de données couvrant des tâches de classification, d'appel de fonction, de Q/R et de Q/R en livre ouvert. Tous les modèles distillés proviennent de la famille Qwen3 (0,6B à 8B), entraînés avec seulement 50 exemples en utilisant des modèles enseignants à poids ouverts, sans recours aux sorties d'API de pointe pour l'entraînement.

Principaux résultats de performance

  • Les modèles distillés égalent ou surpassent le meilleur modèle de pointe de niveau intermédiaire (<1 $/MTok d'entrée) sur 6 tâches sur 9, et sont pratiquement à égalité sur une 7e
  • Text2SQL : Qwen3-4B distillé atteint 98,0 % contre 98,7 % pour Claude Haiku, 96,0 % pour GPT-5 nano, à 3 $/M de requêtes contre respectivement 378 $ et 24 $
  • Maison intelligente (appel de fonction) : Qwen3-0,6B obtient 98,7 % contre 92,0 % pour Gemini Flash
  • HotpotQA : Les modèles distillés obtiennent 92,0 % contre 98,0 % pour Haiku – le raisonnement ouvert avec connaissance du monde reste le territoire des modèles de pointe
  • Tâches de classification (Banking77, E-commerce, TREC) : Les modèles distillés sont à 0-1,5 point de pourcentage du meilleur modèle de pointe

Performance d'inférence

Les modèles ont été servis via vLLM sur un seul H100 avec les performances suivantes pour le modèle Text2SQL 4B :

  • 222 RPS soutenus
  • p50 : 390 ms, p95 : 640 ms, p99 : 870 ms
  • 7,6 GiB de VRAM (BF16, sans quantification)
  • FP8 a donné +15 % de débit, -44 % de mémoire, sans perte de précision dans des expériences brèves
Ad

Méthodologie

  • Mêmes ensembles de test, mêmes prompts, mêmes critères d'évaluation pour tous les modèles
  • Modèles de pointe exécutés 3 fois par ensemble de données (moyenne ± écart-type rapportée), modèles distillés à temp=0
  • Évaluation : correspondance exacte pour la classification, équivalence d'appel d'outil (comparaison JSON avec normalisation des paramètres par défaut) pour l'appel de fonction, Claude Sonnet 4.6 comme LLM-en-tant-que-juge pour la génération
  • Coût : pointe = utilisation mesurée de tokens d'API × tarification publiée (fév. 2026). Distillé = H100 à 2,40 $/h ÷ RPS soutenu mesuré

Recommandations pratiques

  • Distiller : tâches structurées, schémas bien définis, volume élevé, exigences de souveraineté des données
  • API de pointe : connaissance générale du monde, génération libre, faible volume
  • Meilleure configuration : router entre les deux

Ressources disponibles

Tout le code, les modèles, les données et les scripts d'évaluation sont open source sur https://github.com/distil-labs/inference-efficiency-benchmarks/

Article de blog complet avec graphiques et analyses par ensemble de données : https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

La demande d'électricité aux États-Unis atteindra des sommets record en 2026-2027, portée par l'IA et les centres de données
News

La demande d'électricité aux États-Unis atteindra des sommets record en 2026-2027, portée par l'IA et les centres de données

L'Administration américaine d'information sur l'énergie (EIA) prévoit une consommation d'électricité record en 2026-2027, principalement en raison de la montée en puissance des charges de travail liées à l'IA et de l'expansion des centres de données.

OpenClawRadar
Claude Opus 4.7 sorti avec raisonnement hybride et fenêtre contextuelle de 1 million de tokens
News

Claude Opus 4.7 sorti avec raisonnement hybride et fenêtre contextuelle de 1 million de tokens

Anthropic a lancé Claude Opus 4.7, un modèle de raisonnement hybride avec une fenêtre de contexte de 1 million de tokens qui offre des performances renforcées en codage, vision et tâches complexes multi-étapes. Le tarif commence à 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie.

OpenClawRadar
Google AI Overview qualifie à tort un violoneux canadien de délinquant sexuel, une plainte déposée
News

Google AI Overview qualifie à tort un violoneux canadien de délinquant sexuel, une plainte déposée

Ashley MacIsaac poursuit Google pour 1,5 million de dollars après qu'un résumé généré par IA a publié de fausses affirmations selon lesquelles il était un délinquant sexuel condamné, entraînant l'annulation d'un concert.

OpenClawRadar
Méthode de Simple Auto-Distillation Améliore la Génération de Code par LLM
News

Méthode de Simple Auto-Distillation Améliore la Génération de Code par LLM

Les chercheurs montrent que le fine-tuning des LLM sur leurs propres sorties échantillonnées (simple auto-distillation) améliore les performances de génération de code, faisant passer Qwen3-30B-Instruct de 42,4 % à 55,3 % de réussite pass@1 sur LiveCodeBench v6.

OpenClawRadar