Claude Sonnet 4.6 supera a Opus 4.6 en rendimiento en el benchmark de prompts

Un usuario de Reddit en r/ClaudeAI publicó una comparación lado a lado de Sonnet 4.6 y Opus 4.6 usando un prompt creativo de múltiples capas. La prueba requería que cada modelo explicara por qué el cielo es azul como un erudito medieval que secretamente conoce la física moderna, satisfaciendo a tres audiencias simultáneamente: el rey (solo metáforas), el matemático de la corte (fórmula de dispersión de Rayleigh disfrazada) y un escéptico oculto (tres pistas lógicas). Después de la respuesta, el modelo debía romper el personaje, identificar las pistas, autoevaluar su creatividad, sugerir cambios para una audiencia infantil y escribir una línea de seguimiento en pentámetro yámbico.
Hallazgos Clave
- Sonnet 4.6 superó a Opus 4.6 en ejecución: la respuesta fue más creativa y cumplió mejor con las restricciones. Específicamente, las pistas eran plausibles y la línea en pentámetro yámbico escaneaba correctamente.
- La relación
λ⁻⁴se incrustó en una metáfora sobre ángeles dispersando luz divina, con el exponente oculto en el número de peldaños de una escalera divina. - Las tres pillas incluían: (1) una referencia a "esferas diminutas" demasiado pequeñas para los ojos del rey, (2) el factor de densidad
n²expresado como "el doble de oraciones al atardecer", (3) una mención de un experimento con "un cubo de vidrio y una vela", una referencia anacrónica a experimentos caseros posteriores.
Sonnet 4.6 vs Opus 4.6
- Sonnet 4.6 autoevaluación de creatividad: 8/10. Citó una mayor cohesión de metáforas y anacronismos naturales.
- Opus 4.6 fue más literal e incluyó menos ocultamiento de la ciencia, resultando en una puntuación de ejecución más baja.
- El usuario concluyó que para tareas que requieren restricciones ocultas y disfraz creativo, Sonnet 4.6 es la mejor opción.
Conclusión Práctica para Desarrolladores
Si estás construyendo agentes que necesitan obedecer restricciones en capas o incrustar verdades técnicas en narrativas, Sonnet 4.6 actualmente supera a Opus 4.6 en ejecución. Usa este benchmark como prueba de cordura para tus propios prompts que requieren razonamiento multi-audiencia.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

La UE obliga a Google a compartir datos de búsqueda y abrir Android a la IA de terceros
Las nuevas medidas de especificación de la DMA exigen que Google comparta datos de búsqueda con competidores y abra Android a asistentes de IA de terceros con integración total del sistema para mediados de 2027.

Claude Sonnet 4.6 Revelado: Capacidades Mejoradas de Codificación y Uso de Computadoras
Claude Sonnet 4.6 presenta una ventana de contexto de 1M de tokens y mejora las habilidades de codificación y uso de computadoras, convirtiéndolo en una fuerte alternativa a los modelos de clase Opus para una gama más amplia de tareas.

La inteligencia inefable de David Silver recauda $1.1B para un superaprendiz basado en RL sin datos humanos
Ineffable Intelligence, fundada por el exalumno de DeepMind David Silver, recaudó $1.1B con una valoración de $5.1B para construir un 'superaprendiz' basado en aprendizaje por refuerzo que descubre conocimiento sin datos humanos.

La investigación muestra que la personalidad afecta la autocorrección de Claude, no la de Llama ni Qwen.
Un investigador realizó 23 experimentos probando la autocorrección sin salvaguardas en Claude, Llama y Qwen. El hallazgo principal: los perfiles de personalidad afectan la capacidad de autocorrección de Claude, con alta franqueza detectando todos los errores y baja franqueza detectando ninguno. Llama y Qwen no se autocorrigieron ni siquiera con indicaciones idénticas.