Grok 4.5 vs Claude Code : Les changements acceptés par dollar, le vrai indicateur

✍️ OpenClawRadar📅 Publié: July 23, 2026🔗 Source
Ad

Le lancement de Grok 4.5 par xAI (53 % sur DeepSWE 1.1 contre 59 % pour Opus 4.8, 29,0 % pass@1 sur SWE Marathon contre 26,0 %, 80 tokens/s à 2 $/M en entrée, 6 $/M en sortie) mérite d'être traité comme une comparaison pratique avec Claude Code, et non comme un simple classement. La métrique pertinente pour les développeurs utilisant des agents de codage IA est le nombre de modifications acceptées par dollar avec le même dépôt, prompt, permissions d'outil, commande de test, délai d'attente et niveau d'exigence de relecture.

Ad

Détails clés

Grok 4.5 est disponible dans Grok Build, Cursor et via API. Il prend en charge les modes de raisonnement faible, moyen et élevé. Cependant, un test tiers daté du 20 juillet (via The New Stack) a exécuté Grok et Opus en mode Cursor Agent sur trois tâches Rust identiques :

  • Correction de bug : Les deux ont réussi les tests initiaux.
  • Refactorisation multi-fichier : Les deux ont terminé, mais Opus a touché un fichier de plus.
  • Développement de fonctionnalité (le test le plus pratique) : Les deux ont fonctionné, mais Opus a ajouté plus de couverture de test et rédigé l'entrée de la page de manuel.

Les touches supplémentaires d'Opus comptent pour les modifications acceptées par dollar : un modèle moins cher qui nécessite une boucle de reprise supplémentaire peut ne pas être plus économique. La communauté recommande de journaliser : réussite des tests initiaux, nombre de reprises, tokens de sortie, temps réel et corrections du relecteur.

À qui cela s'adresse

Toute personne utilisant Claude Code, Cursor ou Grok Build pour le codage agentique et souhaitant évaluer le coût total des modifications livrées.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Claude Code v2.1.203 : Version majeure de correction de bugs avec récupération de session en arrière-plan et améliorations des performances
News

Claude Code v2.1.203 : Version majeure de correction de bugs avec récupération de session en arrière-plan et améliorations des performances

Claude Code v2.1.203 corrige les blocages des sessions d'arrière-plan sur macOS, la récupération après expiration des jetons, les problèmes d'héritage PATH et réduit la taille du binaire de 7 Mo avec des économies de mémoire au démarrage.

OpenClawRadar
Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique
News

Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique

Les tests montrent que Claude Opus 4.6 avec la réflexion étendue échoue systématiquement aux problèmes de physique impliquant l'interprétation de diagrammes visuels, tandis que Gemini 3.1 Pro réussit. Désactiver la réflexion étendue permet à Opus 4.6 de résoudre correctement et plus rapidement les mêmes problèmes.

OpenClawRadar
Snowflake licencie son personnel chargé de la documentation après avoir formé un remplacement par IA
News

Snowflake licencie son personnel chargé de la documentation après avoir formé un remplacement par IA

Snowflake a confirmé des 'réductions ciblées de personnel' dans les équipes de rédaction technique et de documentation, des sources rapportant qu'environ 400 personnes sont concernées. L'entreprise enregistrait en vidéo les sessions de documentation depuis 8 mois pour constituer des jeux de données d'entraînement à partir des flux de travail des rédacteurs seniors.

OpenClawRadar
La communauté NVIDIA DGX Spark lance Spark Arena pour des benchmarks LLM reproductibles
News

La communauté NVIDIA DGX Spark lance Spark Arena pour des benchmarks LLM reproductibles

La communauté NVIDIA DGX Spark a lancé Spark Arena, un classement reproductible pour les performances des LLM à poids ouvert utilisant des outils et une méthodologie standardisés, avec les meilleurs résultats actuels incluant gpt-oss-120b et Qwen3-Coder-Next.

OpenClawRadar