Claude Sonnet 4.6 supera a Opus 4.6 en rendimiento en el benchmark de prompts

✍️ OpenClawRadar📅 Publicado: 17 de mayo de 2026🔗 Source
Claude Sonnet 4.6 supera a Opus 4.6 en rendimiento en el benchmark de prompts
Ad

Un usuario de Reddit en r/ClaudeAI publicó una comparación lado a lado de Sonnet 4.6 y Opus 4.6 usando un prompt creativo de múltiples capas. La prueba requería que cada modelo explicara por qué el cielo es azul como un erudito medieval que secretamente conoce la física moderna, satisfaciendo a tres audiencias simultáneamente: el rey (solo metáforas), el matemático de la corte (fórmula de dispersión de Rayleigh disfrazada) y un escéptico oculto (tres pistas lógicas). Después de la respuesta, el modelo debía romper el personaje, identificar las pistas, autoevaluar su creatividad, sugerir cambios para una audiencia infantil y escribir una línea de seguimiento en pentámetro yámbico.

Hallazgos Clave

  • Sonnet 4.6 superó a Opus 4.6 en ejecución: la respuesta fue más creativa y cumplió mejor con las restricciones. Específicamente, las pistas eran plausibles y la línea en pentámetro yámbico escaneaba correctamente.
  • La relación λ⁻⁴ se incrustó en una metáfora sobre ángeles dispersando luz divina, con el exponente oculto en el número de peldaños de una escalera divina.
  • Las tres pillas incluían: (1) una referencia a "esferas diminutas" demasiado pequeñas para los ojos del rey, (2) el factor de densidad n² expresado como "el doble de oraciones al atardecer", (3) una mención de un experimento con "un cubo de vidrio y una vela", una referencia anacrónica a experimentos caseros posteriores.
Ad

Sonnet 4.6 vs Opus 4.6

  • Sonnet 4.6 autoevaluación de creatividad: 8/10. Citó una mayor cohesión de metáforas y anacronismos naturales.
  • Opus 4.6 fue más literal e incluyó menos ocultamiento de la ciencia, resultando en una puntuación de ejecución más baja.
  • El usuario concluyó que para tareas que requieren restricciones ocultas y disfraz creativo, Sonnet 4.6 es la mejor opción.

Conclusión Práctica para Desarrolladores

Si estás construyendo agentes que necesitan obedecer restricciones en capas o incrustar verdades técnicas en narrativas, Sonnet 4.6 actualmente supera a Opus 4.6 en ejecución. Usa este benchmark como prueba de cordura para tus propios prompts que requieren razonamiento multi-audiencia.

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

El Ejército de EE. UU. presiona a Anthropic para que elimine las salvaguardas de Claude para uso militar
Noticias

El Ejército de EE. UU. presiona a Anthropic para que elimine las salvaguardas de Claude para uso militar

Altos mandos militares estadounidenses, incluido el secretario de Defensa Pete Hegseth, se reunieron con ejecutivos de Anthropic para exigir la eliminación de las salvaguardias de Claude contra aplicaciones militares como la vigilancia masiva y las armas autónomas. El Pentágono ha dado a Anthropic hasta el viernes para que cumpla o se enfrente a sanciones, incluida la cancelación de contratos.

OpenClawRadar
India y EAU se asocian en soberanía de IA con supercomputadoras Cerebras
Noticias

India y EAU se asocian en soberanía de IA con supercomputadoras Cerebras

India y los EAU se han asociado para desplegar una supercomputadora de IA impulsada por Cerebras en suelo indio, evitando a los gigantes estadounidenses de la nube. El acuerdo con G42 le da a India la propiedad de las máquinas y el control de la gobernanza de datos.

OpenClawRadar
Competencia de Proteómica de Bohrium AI 2026 con Premio de $13K y Soporte de Computación
Noticias

Competencia de Proteómica de Bohrium AI 2026 con Premio de $13K y Soporte de Computación

Bohrium está organizando una competencia de proteómica con IA en 2026 con un premio de $13,000, oportunidades de pasantías y soporte de cómputo. La competencia fue discutida en Hacker News con 17 puntos y 5 comentarios.

OpenClawRadar
Cuando los comentaristas en línea 'detectan' mi arte como IA: la frustración de David Revoy
Noticias

Cuando los comentaristas en línea 'detectan' mi arte como IA: la frustración de David Revoy

El artista David Revoy comparte capturas de pantalla de comentaristas en línea que acusan falsamente a su arte dibujado a mano de ser generado por IA, a pesar de compartir lapsos de tiempo. Explora el problema en su cómic 'Problema de autenticidad'.

OpenClawRadar