Benchmark Open Source contre Modèles de Frontière : Scène de Voiture sur Toile en Fichier Unique

Un développeur a soumis la même requête Canvas à un seul fichier à 12 modèles pour comparer les capacités des modèles open-source et des modèles de pointe sur une scène réaliste de conduite de voiture vue de côté. La tâche : un fichier HTML autonome, sans bibliothèques, sans ressources externes, avec un décor en parallaxe, des roues qui tournent, un mouvement subtil du corps, un éclairage cinématographique et une boucle fluide. Le banc d'essai est OpenCodeOrchestra, et les résultats sont disponibles en direct sur oco-canvas-car-scene-compare.
Modèles testés
Chaque modèle a été exécuté dans un Orchestrator isolé avec le réglage de réflexion/effort le plus élevé disponible. La liste comprend GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (effort maximal), Claude Opus 4.6 (effort maximal), Claude Sonnet 4.6 (effort élevé), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus et Grok 4.3. Les Tok/s et le temps de génération n'ont pas été mesurés.
Résultats clés
- Certains modèles ont utilisé des modèles auditeurs en interne ; d'autres non.
- Des gagnants clairs et des résultats ambigus sont visibles dans la galerie.
- MiMo V2.5 Pro a été exclu en raison de problèmes de facturation avec l'abonnement OpenCode Go.
La page de la galerie permet une comparaison côte à côte de la sortie de chaque modèle. Le code source est sur GitHub à AidenGeunGeun/oco-canvas-car-scene-compare.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

L'analyse de Goldman Sachs montre un impact minimal de l'IA sur la croissance du PIB américain en 2025.
Les économistes de Goldman Sachs rapportent que l'investissement en IA a contribué 'pratiquement zéro' à la croissance du PIB américain en 2025, citant le matériel importé et les impacts de productivité non mesurés comme facteurs clés.

Infomaniak transfère la majorité des droits de vote à une fondation pour verrouiller l'indépendance du cloud suisse
Infomaniak a sécurisé son indépendance à long terme en transférant la majorité des droits de vote à une fondation suisse d'intérêt public. Aucune reprise n'est possible sans l'approbation de la fondation.

Nvidia Nemotron 3 Super : un modèle de 120 milliards de paramètres avec une inférence active de 12 milliards
Le Nemotron 3 Super de Nvidia compte 120 milliards de paramètres au total, mais n'en active que 12 milliards lors de l'inférence, offrant ainsi les connaissances d'un modèle de 120 milliards pour un coût de calcul d'environ 12 milliards, grâce à un routage efficace plutôt qu'à la compression.
Définir la « psychose de l'IA prolifique » : quand une production élevée d'IA détruit la valeur
Le psychiatre Jeff Clark, MD, définit la « psychose IA prolifique » — générer une production massive d'IA (des milliers de lignes de code par jour) sans augmentation réelle de la valeur, parce qu'on ne peut pas évaluer son propre travail.