Claude Sonnet 4.6 supera Opus 4.6 em execução no benchmark de prompt

Um usuário do Reddit no r/ClaudeAI publicou uma comparação lado a lado do Sonnet 4.6 e do Opus 4.6 usando um prompt criativo de múltiplas camadas. O teste exigia que cada modelo explicasse por que o céu é azul como um estudioso medieval que secretamente conhece a física moderna, satisfazendo três públicos simultaneamente: o rei (apenas metáforas), o matemático da corte (fórmula de espalhamento Rayleigh disfarçada) e um cético oculto (três migalhas de pão lógicas). Após a resposta, o modelo tinha que sair do personagem, identificar as migalhas, autoavaliar a criatividade, sugerir mudanças para um público infantil e escrever uma linha de continuação em pentâmetro iâmbico.
Principais Descobertas
- Sonnet 4.6 superou Opus 4.6 na execução — a resposta foi mais criativa e satisfez melhor as restrições. Especificamente, as migalhas eram plausíveis e a linha em pentâmetro iâmbico tinha a métrica correta.
- A relação
λ⁻⁴foi embutida em uma metáfora sobre anjos espalhando luz divina, com o expoente oculto no número de degraus de uma escada divina. - As três migalhas incluíam: (1) uma referência a "pequenas esferas" pequenas demais para os olhos do rei, (2) o fator de densidade
n²expresso como "o dobro de orações ao entardecer", (3) uma menção a um experimento com um "cubo de vidro e uma vela" — uma referência anacrônica a experimentos caseiros posteriores.
Sonnet 4.6 vs Opus 4.6
- Sonnet 4.6 autoavaliação de criatividade: 8/10. Citou maior coesão metafórica e anacronismos naturais.
- Opus 4.6 foi mais literal e incluiu menos disfarce da ciência, resultando em uma pontuação de execução inferior.
- O usuário concluiu que, para tarefas que exigem restrições ocultas e disfarce criativo, o Sonnet 4.6 é a melhor escolha.
Dica Prática para Desenvolvedores
Se você está construindo agentes que precisam obedecer a restrições em camadas ou incorporar verdades técnicas em narrativas, o Sonnet 4.6 atualmente supera o Opus 4.6 na execução. Use este benchmark como uma verificação de sanidade para seus próprios prompts que exigem raciocínio para múltiplos públicos.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Acordo da CBP com a Clearview AI: Reconhecimento Facial para Direcionamento Tático
A Alfândega e Proteção de Fronteiras dos EUA contratou a Clearview AI para direcionamento tático, usando tecnologia de reconhecimento facial em bilhões de imagens extraídas da internet.

Trump retira ordem executiva sobre IA por medo de desacelerar tecnologia dos EUA
O presidente Trump revogou uma ordem executiva de IA da era Biden, argumentando que ela poderia prejudicar a liderança tecnológica dos EUA. A medida elimina as exigências federais de relatórios de segurança.

Claude-Code v2.1.47 Lançamento: Principais Correções e Melhorias
O lançamento do Claude-Code v2.1.47 traz correções cruciais para renderização de terminal Windows, manipulação de arquivos e saída de ferramentas bash, juntamente com melhorias de memória e desempenho.

Atualização da Política da Anthropic Proíbe Ferramentas de Terceiros para Usuários do Claude Pro/Max
A Anthropic atualizou sua política em fevereiro de 2026 para proibir explicitamente o uso de qualquer script, wrapper ou ferramenta de terceiros com os planos Claude Pro ou Max, resultando em banimentos vitalícios para usuários que violarem esta política. Usuários do plano Max de alto nível que realizam sessões intensas de programação estão sendo alvos de uma onda de aplicação em março de 2026.