La course à l'IA de pointe est terminée : les réseaux de petits modèles surpassent l'IA centralisée en coût et en capacité

Andrew Trask soutient que les entreprises d'IA centralisées — Fable, Mythos, GPT, Opus — ont définitivement perdu la frontière des capacités. En utilisant des ensembles routés/pondérés de modèles moins chers, n'importe qui peut désormais dépasser la précision de n'importe quel modèle de pointe unique, à moindre coût et plus rapidement.
Principales conclusions de l'article
- Capacité : Une combinaison différentiellement privée de modèles de pointe sur Humanity's Last Exam a atteint le bas des 50 — plus élevé que n'importe quel modèle unique. L'article montre un graphique où un ensemble de GPT et Opus surpasse Fable/Mythos à moitié prix.
- Vitesse : Les classements de vitesse indépendants d'OpenRouter montrent que les modèles open-source sont plus rapides car les hébergeurs concurrents sur la latence.
- Coût : Le moyen le moins cher d'obtenir des performances de niveau Fable/Mythos n'est plus ces modèles — c'est un ensemble de GPT-5.5 + Opus + Kimi K2.7, qui est sorti aujourd'hui et bat Fable sur les benchmarks.
Le plan d'action
- Prenez n'importe quel modèle d'IA de pointe (par exemple, Fable).
- Trouvez le meilleur modèle de pointe moins cher suivant (par exemple, Opus ou GPT-5.5).
- Assemblez-le avec un modèle open-source leader (par exemple, Kimi K2.7) et un routeur.
- Résultat : un système moins cher et plus performant — qui peut être récursé indéfiniment.
Pourquoi l'IA centralisée ne peut pas répondre : l'effet Hydre
Trask compare l'IA centralisée aux mainframes des années 1960. Une fois qu'Internet a relié les mainframes entre eux, le réseau était toujours plus fort. De même, une fois que vous pouvez assembler n'importe quelle combinaison de modèles, aucun modèle unique ne pourra jamais rattraper son retard — chaque amélioration d'un modèle unique ne fait qu'alimenter l'ensemble.
L'article déclare explicitement : « Aucun système d'IA de pointe unique n'atteindra plus jamais la frontière des capacités en raison de la façon dont les lois d'échelle/ensembles fonctionnent. » Il prédit que l'avenir est celui de « l'IA source-réseau » — des réseaux de réseaux de neurones, analogues à l'ère du PC+Internet.
📖 Lire la source complète : HN AI Agents
👀 See Also

Cerebras lance les modèles Step-3.5-Flash-REAP avec une réduction de 40 % de la mémoire.
Cerebras a publié les modèles Step-3.5-Flash-REAP qui utilisent REAP (Router-weighted Expert Activation Pruning) pour compresser des modèles de 196B paramètres à 121B tout en maintenant des performances quasi identiques. Les modèles fonctionnent avec vLLM standard et sont optimisés pour les environnements aux ressources limitées.

Une boutique low-code de 50 développeurs vaporisée en 12 mois : le piège de la dépendance aux agents de codage IA
Une agence low-code de 50 personnes a perdu tous ses clients en 12 mois car « low-code + IA » bat le low-code pur et le full-stack. Pendant ce temps, un développeur solo dépendant de Claude Max fait face à des limites de sessions et à des coûts croissants. Les deux illustrent le même dilemme : s'adapter ou dépendre.

Alibaba va interdire Claude Code sur le lieu de travail en raison de risques présumés de porte dérobée
Selon une source, Alibaba interdirait Claude Code sur son lieu de travail en raison de risques présumés de porte dérobée. Cette décision met en lumière les préoccupations croissantes en matière de sécurité concernant les agents de codage IA dans les environnements professionnels.

Claude-Code v2.1.78 : État des Plugins, Réponses en Flux et Corrections Critiques
Claude-Code v2.1.78 ajoute un état persistant des plugins avec ${CLAUDE_PLUGIN_DATA}, un streaming de réponse ligne par ligne, et corrige les boucles d'erreurs API, les problèmes de contournement des permissions et les avertissements de sécurité du bac à sable.