Benchmark Open Source contre Modèles de Frontière : Scène de Voiture sur Toile en Fichier Unique

Un développeur a soumis la même requête Canvas à un seul fichier à 12 modèles pour comparer les capacités des modèles open-source et des modèles de pointe sur une scène réaliste de conduite de voiture vue de côté. La tâche : un fichier HTML autonome, sans bibliothèques, sans ressources externes, avec un décor en parallaxe, des roues qui tournent, un mouvement subtil du corps, un éclairage cinématographique et une boucle fluide. Le banc d'essai est OpenCodeOrchestra, et les résultats sont disponibles en direct sur oco-canvas-car-scene-compare.
Modèles testés
Chaque modèle a été exécuté dans un Orchestrator isolé avec le réglage de réflexion/effort le plus élevé disponible. La liste comprend GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (effort maximal), Claude Opus 4.6 (effort maximal), Claude Sonnet 4.6 (effort élevé), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus et Grok 4.3. Les Tok/s et le temps de génération n'ont pas été mesurés.
Résultats clés
- Certains modèles ont utilisé des modèles auditeurs en interne ; d'autres non.
- Des gagnants clairs et des résultats ambigus sont visibles dans la galerie.
- MiMo V2.5 Pro a été exclu en raison de problèmes de facturation avec l'abonnement OpenCode Go.
La page de la galerie permet une comparaison côte à côte de la sortie de chaque modèle. Le code source est sur GitHub à AidenGeunGeun/oco-canvas-car-scene-compare.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude Code v2.1.205 : Blocage de la falsification de transcription, corrections du schéma JSON et améliorations du mode automatique
Claude Code v2.1.205 ajoute une règle en mode automatique qui bloque la falsification des transcriptions de session, corrige les problèmes de schéma JSON volumineux, améliore la gestion des agents en arrière-plan et rationalise les mises à jour binaires.

La discussion sur Reddit met en lumière le passage des chatbots aux agents autonomes avec exécution locale.
Un post Reddit distingue les chatbots des agents autonomes en utilisant des exemples concrets et note la tendance vers l'exécution locale avec des modèles comme LLaMA fonctionnant sur des postes de travail privés.

Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD
Un développeur a atteint une vitesse d'inférence de 20,34 tokens/seconde pour le modèle Qwen3.5-397B de 209 Go sur un MacBook Pro M5 Max avec 128 Go de RAM en utilisant le streaming SSD et 36 expériences systématiques. Ce résultat représente une accélération de 2x par rapport au point de référence du M5 Max et de 4,67x par rapport au résultat original du M3 Max.

Claude Code ajoute la saisie vocale avec fonctionnalité de pousser-pour-parler.
Claude Code déploie le mode vocal à environ 5 % des utilisateurs initialement, avec une activation push-to-talk en maintenant la barre d'espace. Les jetons de transcription vocale ne comptent pas dans les limites de taux et la fonctionnalité est incluse sans frais supplémentaires.