Referencia de Opus 4.7 sobre el esfuerzo de razonamiento: el nivel medio supera al alto y al máximo en tareas reales
El usuario de Reddit ktane probó Claude Opus 4.7 en Claude Code a lo largo de cinco configuraciones de esfuerzo de razonamiento (bajo, medio, alto, muy alto, máximo) en 29 tareas reales del repositorio de código abierto GraphQL-go-tools. El resultado: el esfuerzo de razonamiento medio superó consistentemente a las configuraciones más altas en tasa de aprobación de pruebas, equivalencia semántica con parches creados por humanos, tasa de aprobación de revisión de código y puntuaciones agregadas de habilidad/disciplina.
Resultados clave
- Tasa de aprobación general: Medio 28/29, Máximo 27/29, Alto 26/29, Muy alto 25/29, Bajo 23/29
- Parches equivalentes: Medio 14/29, Máximo 13/29, Alto 12/29, Muy alto 11/29, Bajo 10/29
- Tasa de aprobación de revisión de código: Medio 10/29, Alto 7/29, Máximo 8/29, Muy alto 4/29, Bajo 5/29
- Media de rúbrica de revisión de código: Medio 2.716, Alto 2.509, Muy alto 2.482, Máximo 2.431, Bajo 2.426
- Riesgo de huella (menor es mejor): Bajo 0.155, Medio 0.189, Alto 0.206, Máximo 0.227, Muy alto 0.238
- Costo por tarea: Bajo $2.50, Medio $3.15, Alto $5.01, Muy alto $6.51, Máximo $8.84
- Duración por tarea: Bajo 383.8s, Medio 450.7s, Alto 716.4s, Muy alto 803.8s, Máximo 996.9s
- Aprobaciones equivalentes por dólar: Bajo 4.0, Medio 4.4, Alto 2.4, Muy alto 1.7, Máximo 1.5
El autor señala que Opus 4.7 utiliza pensamiento adaptativo — ya asigna un presupuesto de razonamiento por tarea. Por lo tanto, el control de esfuerzo sesga una política ya adaptativa en lugar de añadir inteligencia bruta. Notablemente, en un PR (#1260), las configuraciones alta y muy alta desperdiciaron razonamiento extra investigando hashes de commits de PRs anteriores y concluyeron 'no se necesita trabajo', mientras que la media y máxima leyeron correctamente el flujo de control y produjeron una corrección.
Esto contrasta con GPT-5.5 en Codex, que mostró la curva monotónica intuitiva donde más razonamiento mejoraba la calidad. El informe interactivo completo con desgloses por tarea está disponible en stet.sh.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

Navegando lo Esencial: Nuevos Usuarios Buscan Orientación sobre OpenClaw
Los principiantes de OpenClaw están pidiendo ayuda en Reddit mientras exploran las complejidades de los agentes de codificación de IA. La comunidad tecnológica interviene con consejos y recursos.

Qwen3.5-122B-A10B-MINT-MLX se ejecuta sin problemas en M5 Pro con 64 GB de RAM.
Un usuario informa sobre la implementación local exitosa del modelo Qwen3.5-122B-A10B-MINT-MLX en un M5 Pro con 64 GB de RAM, logrando una velocidad de generación de 39.58 tokens/segundo con comandos específicos de asignación de VRAM.

Reseña de OpenClaw: Problemas de Fiabilidad en su Estado Actual, Valor como Herramienta de Aprendizaje
Un desarrollador con amplia experiencia en plataformas de IA informa que OpenClaw tiene dificultades con la confiabilidad en tareas básicas de múltiples pasos, lo que hace cuestionables las aplicaciones empresariales autónomas, pero encuentra valor en aprender la estructura y orquestación de agentes.

Nuevo tutor de IA logra un tamaño del efecto de 0.71-1.30 DE en un curso de Dartmouth
Un nuevo tutor de IA para un curso introductorio de informática en Dartmouth mostró ganancias de aprendizaje de 0.71 a 1.30 desviaciones estándar en comparación con un grupo de control.