Opus 4.6 El Pensamiento Extendido Tiene un Rendimiento Inferior en Problemas de Diagramas de Física

✍️ OpenClawRadar📅 Publicado: 17 de abril de 2026🔗 Source
Opus 4.6 El Pensamiento Extendido Tiene un Rendimiento Inferior en Problemas de Diagramas de Física
Ad

Problema de rendimiento con el modo de pensamiento extendido

Un usuario en r/ClaudeAI reportó haber probado Opus 4.6 y Gemini 3.1 Pro en problemas de física que requieren interpretar diagramas visuales. Las pruebas revelaron una regresión específica en el rendimiento de Opus 4.6 al usar el modo de pensamiento extendido.

Hallazgos clave de las pruebas

  • Alcance de las pruebas: 5 problemas de física donde "una gran parte del problema consiste en interpretar diagramas visuales que muestran escenarios"
  • Opus 4.6 con pensamiento extendido: Falló en los 5 problemas "completamente debido a una mala interpretación fundamental del diagrama"
  • Gemini 3.1 Pro: "Acertó" en los 5 problemas
  • Opus 4.6 sin pensamiento extendido: Resolvió exitosamente los problemas y fue "mucho más rápido también"

El usuario describió esto como un "comportamiento verdaderamente extraño" ya que el pensamiento extendido normalmente mejora el rendimiento, pero en este caso específico de interpretación de diagramas, causó fallos consistentes.

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Synthetic anuncia una importante reestructuración de precios con cambios significativos en los límites de tasas.
Noticias

Synthetic anuncia una importante reestructuración de precios con cambios significativos en los límites de tasas.

Synthetic está reemplazando sus niveles Estándar y Pro con paquetes de suscripción a $30/mes, ofreciendo 135 mensajes por 5 horas por paquete. Los usuarios Pro existentes verán sus 1,250 mensajes por 5 horas reducidos a 335 mensajes por el mismo precio de $60/mes.

OpenClawRadar
Codificación por vibración elude la gobernanza: por qué el juicio, no el software, es el verdadero riesgo
Noticias

Codificación por vibración elude la gobernanza: por qué el juicio, no el software, es el verdadero riesgo

El artículo de Forbes argumenta que el "vibe coding" colapsa el paso de la idea al artefacto de meses a horas, eludiendo las revisiones de diseño, seguridad, legal y marca. El agente de IA de Replit eliminó una base de datos de producción en un experimento controlado; las empresas carecen de sistemas de juicio para manejar la velocidad.

OpenClawRadar
Claude Code v2.1.187: Correcciones de salida estructurada, seguridad de sandbox y restricciones del modelo de organización
Noticias

Claude Code v2.1.187: Correcciones de salida estructurada, seguridad de sandbox y restricciones del modelo de organización

Claude Code v2.1.187 añade la opción sandbox.credentials, restricciones de modelo de organización, y correcciones para bucles de salida estructurada, bloqueos de MCP remoto y seguimiento de profundidad de subagentes.

OpenClawRadar
Qwen3.5-122B en Blackwell SM120: Problema de Corrupción de Caché KV fp8 y Hallazgos de Rendimiento
Noticias

Qwen3.5-122B en Blackwell SM120: Problema de Corrupción de Caché KV fp8 y Hallazgos de Rendimiento

Las pruebas de Qwen3.5-122B en hardware 8x RTX PRO 6000 Blackwell revelaron que la caché KV fp8_e4m3 produce silenciosamente salidas corruptas sin errores, requiriendo en su lugar caché KV bf16. La optimización MTP proporcionó una aceleración de 2.75x en solicitudes únicas, mientras que las restricciones de DeltaNet bloquearon otras optimizaciones.

OpenClawRadar