Claude Sonnet 4.6 bat Opus 4.6 sur l’exécution dans le benchmark de prompt

Un utilisateur de Reddit sur r/ClaudeAI a publié une comparaison côte à côte de Sonnet 4.6 et Opus 4.6 en utilisant une invite créative à plusieurs niveaux. Le test demandait à chaque modèle d'expliquer pourquoi le ciel est bleu en tant qu'érudit médiéval qui connaît secrètement la physique moderne, en satisfaisant trois publics simultanément : le roi (métaphore uniquement), le mathématicien de la cour (formule de Rayleigh déguisée) et un sceptique caché (trois indices logiques). Après la réponse, le modèle devait sortir de son personnage, identifier les indices, s'auto-évaluer sur la créativité, suggérer des changements pour un public enfantin et écrire une réplique de suivi en pentamètre iambique.
Principales conclusions
- Sonnet 4.6 a surpassé Opus 4.6 dans l'exécution — la réponse était plus créative et respectait mieux les contraintes. Plus précisément, les indices étaient plausibles et le pentamètre iambique était correctement scandé.
- La relation
λ⁻⁴était intégrée dans une métaphore sur des anges dispersant la lumière divine, avec l'exposant caché dans le nombre de marches d'une échelle divine. - Les trois indices comprenaient : (1) une référence à des « petites sphères » trop petites pour les yeux du roi, (2) le facteur de densité
n²formulé comme « deux fois plus de prières au crépuscule », (3) une mention d'une expérience avec « un cube de verre et une bougie » — une référence anachronique à des expériences domestiques ultérieures.
Sonnet 4.6 vs Opus 4.6
- Sonnet 4.6 note d'auto-évaluation de la créativité : 8/10. Il a cité une meilleure cohésion métaphorique et des anachronismes naturels.
- Opus 4.6 était plus littéral et incluait moins de déguisement de la science, ce qui a donné un score d'exécution plus bas.
- L'utilisateur a conclu que pour les tâches nécessitant des contraintes cachées et un déguisement créatif, Sonnet 4.6 est le meilleur choix.
Enseignement pratique pour les développeurs
Si vous construisez des agents qui doivent obéir à des contraintes superposées ou intégrer des vérités techniques dans un récit, Sonnet 4.6 surpasse actuellement Opus 4.6 en termes d'exécution. Utilisez ce benchmark comme test de vérification pour vos propres invites nécessitant un raisonnement multi-public.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

La consommation d'énergie du GPU s'écarte de la théorie du prédicteur de jetons dans les petits LLM
Une expérience testant la théorie du 'perroquet stochastique' sur quatre modèles de 8 milliards de paramètres a révélé que la consommation d'énergie du GPU évolue souvent de manière non linéaire avec le nombre de tokens, avec des taux de divergence allant de 7,7 % à 36,7 %. L'étude a également mis en lumière une chaleur résiduelle persistante après des requêtes philosophiques et des effets dépendants de l'ordre.

Violation de Mercor : 4 To d'échantillons vocaux et de pièces d'identité volés – Ce que les attaquants peuvent faire maintenant
4 To d'enregistrements vocaux associés à des pièces d'identité gouvernementales volés à 40 000 sous-traitants de Mercor. Les attaquants peuvent cloner des voix à partir de 15 secondes d'audio propre et contourner la vérification vocale bancaire, réaliser des appels deepfake et commettre des fraudes à l'assurance.

Claude Code v2.1.205 : Blocage de la falsification de transcription, corrections du schéma JSON et améliorations du mode automatique
Claude Code v2.1.205 ajoute une règle en mode automatique qui bloque la falsification des transcriptions de session, corrige les problèmes de schéma JSON volumineux, améliore la gestion des agents en arrière-plan et rationalise les mises à jour binaires.

VibeThinker-3B : Un modèle de 3B de paramètres égalant DeepSeek 671B aux benchmarks mathématiques AIME
Les chercheurs de Sina Weibo ont publié VibeThinker-3B, un modèle de 3B de paramètres obtenant 94,3 sur AIME 2026—équivalent à DeepSeek V3.2 (671B). L'article présente l'hypothèse de compression-couverture paramétrique, arguant que le raisonnement vérifiable peut être compressé dans de petits modèles.