Les modèles Qwen3 Small affinés surpassent les LLMs de pointe sur des tâches spécifiques à moindre coût.

Une comparaison systématique des petits modèles Qwen3 distillés avec les modèles API de pointe montre que les petits modèles de langage affinés peuvent surpasser des modèles plus grands et plus coûteux sur des tâches structurées spécifiques.
Résultats de référence
L'étude a comparé les modèles Qwen3 (0,6B à 8B paramètres) avec des API de pointe incluant GPT-5 nano/mini/5.2, Gemini 2.5 Flash Lite/Flash, Claude Haiku 4.5/Sonnet 4.6/Opus 4.6, et Grok 4.1 Fast/Grok 4 sur 9 ensembles de données. Tous les modèles distillés ont été entraînés uniquement avec des enseignants à poids ouvert, avec aussi peu que 50 exemples. L'inférence a été exécutée sur vLLM sur un seul H100.
Principales conclusions de performance
- Appel de fonctions pour maison intelligente : Qwen3-0.6B a atteint 98,7 % de précision contre 92,0 % pour Gemini Flash
- Text2SQL : Qwen3-4B distillé a obtenu 98,0 % contre 98,7 % pour Claude Haiku et 96,0 % pour GPT-5 nano
- Comparaison des coûts : Coût par million de requêtes pour Text2SQL : Qwen3-4B ~3 $ contre 378 $ pour Claude Haiku et 24 $ pour GPT-5 nano
- Tâches de classification : Les modèles distillés ont performé à 0–1,5 point de pourcentage près de la meilleure option de pointe sur les ensembles de données Banking77, E-commerce et TREC
- Avantage des modèles de pointe : HotpotQA (raisonnement ouvert + connaissances générales) — 92,0 % contre 98,0 % pour Haiku
Métriques de performance
Pour Text2SQL avec Qwen3-4B sur H100 :
- 222 RPS soutenus
- p50 : 390 ms | p95 : 640 ms | p99 : 870 ms
- 7,6 GiB de VRAM (BF16, sans quantification)
- FP8 a donné +15 % de débit, −44 % de VRAM, aucune perte de précision mesurable dans des expériences brèves
Méthodologie
- Mêmes ensembles de test, prompts et critères d'évaluation pour tous les modèles
- Modèles de pointe exécutés 3× par ensemble de données (moyenne ± écart-type rapportée), modèles distillés à température=0
- Évaluation : correspondance exacte pour la classification, équivalence d'appel d'outil (comparaison JSON avec normalisation de paramètres par défaut) pour l'appel de fonctions, Claude Sonnet 4.6 comme juge LLM pour les tâches de génération
- Calcul des coûts : modèles de pointe = utilisation de tokens mesurée × tarifs publiés (fév. 2026) ; modèles distillés = H100 à 2,40 $/h ÷ RPS soutenus
Recommandations pratiques
- Utilisez les modèles distillés quand : Vous avez des tâches structurées, des schémas bien définis, un volume élevé, ou des besoins de souveraineté des données
- Utilisez les API de pointe quand : Vous avez besoin de connaissances générales étendues, de génération libre, ou que le volume est suffisamment faible pour que le coût n'ait pas d'importance
- Approche hybride : Aiguillez entre les deux en fonction des exigences de la tâche
Disponibilité
Tout le code, les modèles, les données et les scripts d'évaluation sont open source sur GitHub : https://github.com/distil-labs/inference-efficiency-benchmarks/
Analyse complète avec graphiques disponible sur le blog : https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Mise à jour de la politique d'Anthropic : interdiction des outils tiers pour les utilisateurs de Claude Pro/Max
Anthropic a mis à jour sa politique en février 2026 pour interdire explicitement toute utilisation de script, wrapper ou outil tiers avec les plans Claude Pro ou Max, entraînant des bannissements à vie pour les utilisateurs qui enfreignent cette politique. Les utilisateurs des plans Max haut de gamme engagés dans des sessions de codage intensives sont ciblés lors d'une vague d'application en mars 2026.

Génération de code déterministe vs probabiliste : pourquoi la conversion en Rust de Bun via Vibe-Coding soulève des drapeaux rouges
Noah Hall soutient que les modifications de dépôt à un million de lignes effectuées par vibe coding (comme la conversion Zig vers Rust de Bun) sont dangereuses. Il oppose les transpileurs déterministes à la sortie probabiliste des LLM. Les tests ne suffisent pas.

Claude AI récupère un portefeuille Bitcoin de 11 ans d'une valeur de 400 000 $ en trouvant une sauvegarde et en corrigeant un bug de force brute
Un utilisateur a récupéré un portefeuille de 5 BTC (d'une valeur d'environ 400 000 $) après 11 ans en fournissant l'intégralité des fichiers de son ordinateur universitaire à Claude. L'IA a trouvé une sauvegarde plus ancienne du portefeuille et identifié un bug dans la logique de combinaison des mots de passe de btcrecover, permettant un déchiffrement réussi.
Le SDK Agent Claude obtient des crédits mensuels dédiés pour une utilisation programmatique à partir du 15 juin
À partir du 15 juin, les formules payantes de Claude bénéficient d'un crédit mensuel distinct pour l'utilisation programmatique (Agent SDK, claude-p, Claude Code GitHub Actions, outils tiers). Pro obtient 20$, Max 5x 100$, etc. L'utilisation est suspendue si le crédit est épuisé et que les crédits d'utilisation supplémentaires sont désactivés.