Opus 4.6 destaca en investigación, Gemini 3.1 Pro tiene mejor juicio en tareas de pronóstico

✍️ OpenClawRadar📅 Publicado: 7 de mayo de 2026🔗 Source
Opus 4.6 destaca en investigación, Gemini 3.1 Pro tiene mejor juicio en tareas de pronóstico
Ad

Un usuario de Reddit publicó los resultados de un benchmark que compara cuatro modelos frontera — Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro y Grok 4.20 — en 1,417 preguntas de predicción binaria de octubre a diciembre de 2025. La innovación clave es descomponer el rendimiento en dos condiciones de evaluación: agéntica (cada modelo realiza su propia investigación web usando herramientas) y evidencia fija (todos los modelos reciben el mismo dossier de investigación de ~12,000 caracteres compilado mediante la metodología de estandarización de Bosse et al. 2026).

Hallazgos clave

  • Opus 4.6 funciona dramáticamente mejor en la condición agéntica: es mejor para descubrir qué buscar, decidir qué páginas leer y extraer detalles relevantes. Sin embargo, cuando se elimina la investigación, su ventaja desaparece.
  • Gemini 3.1 Pro ofrece un juicio más preciso sobre evidencia fija — pondera la información con mayor exactitud en tareas de predicción. Su calibración en realidad mejora cuando recibe el dossier estandarizado, mientras que la calibración de Opus cae bruscamente.
  • GPT-5.4 y Grok 4.20 apenas cambiaron entre condiciones, lo que sugiere que su rendimiento depende menos de la estrategia de búsqueda.
  • El orden de clasificación se invirtió entre Opus y Gemini según las condiciones, lo que, según el autor, indica que la evaluación no está rota ni sesgada (una evaluación sesgada probablemente movería todos los modelos en la misma dirección).
Ad

Interpretación

La asimetría en la calibración — la calibración de Opus cae cuando se elimina la búsqueda, mientras que la de Gemini mejora — sugiere que Opus puede estar usando su rastro de búsqueda como andamiaje para la asignación de probabilidades. En otras palabras, el acto de realizar el bucle de búsqueda en sí mismo hace parte del trabajo epistémico, separado de la información que descubre. Este es un hallazgo novedoso que podría tener implicaciones para cómo evaluamos y diseñamos agentes de investigación de IA.

Limitaciones y recursos

Los dossiers de evidencia fija son generados por LM, por lo que la prueba puede medir qué tan bien interpreta cada modelo una versión estandarizada particular de la evidencia, en lugar de un juicio abstracto. El autor señala esto como una limitación, pero argumenta que el comportamiento divergente entre modelos reduce la preocupación.

Las puntuaciones completas de calibración, refinamiento y el análisis por condición están disponibles en: futuresearch.ai/opus-research-gemini-judgment. El benchmark y el leaderboard están en: evals.futuresearch.ai.

Según el autor, esta es la primera evaluación directa de modelos frontera que descompone el rendimiento en etapas de investigación y juicio. Invita a la replicación en otros dominios.

📖 Lee la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Liberación de Claude-Code v2.1.25: Corrección de Error de Validación
Noticias

Liberación de Claude-Code v2.1.25: Corrección de Error de Validación

Claude-Code v2.1.25 aborda un problema de validación de encabezados beta que afecta a los usuarios de gateway en Bedrock y Vertex, con una solución alternativa a través de una variable de entorno específica.

OpenClawRadar
Resultados de Referencia de Razonamiento Visual para 15 Modelos de IA Multimodales
Noticias

Resultados de Referencia de Razonamiento Visual para 15 Modelos de IA Multimodales

AIMultiple evaluó 15 modelos líderes de IA multimodal con 200 preguntas de razonamiento visual en dos categorías: comprensión de gráficos y lógica visual. Gemini-3.1-pro-preview y Gemini-3-pro-preview lideran los resultados generales, seguidos por GPT-5.2, Kimi-K2.5 y GPT-5.2-pro.

OpenClawRadar
Análisis de la 'Clausura': Patrones de Ansiedad del Usuario en Modelos de Suscripción de IA
Noticias

Análisis de la 'Clausura': Patrones de Ansiedad del Usuario en Modelos de Suscripción de IA

Un análisis de usuarios identifica la 'Clausura' o 'El Síndrome de Claude'—patrones de comportamiento donde los suscriptores premium de IA experimentan ansiedad crónica por el uso, conductas de evitación y monitoreo compulsivo de recursos. La fuente detalla síntomas específicos como evitación anticipatoria, hipervigilancia del uso y subutilización paradójica de servicios pagados.

OpenClawRadar
VS Code 1.117.0 añade automáticamente a Copilot como coautor en commits — Esto es lo que lo activa
Noticias

VS Code 1.117.0 añade automáticamente a Copilot como coautor en commits — Esto es lo que lo activa

VS Code 1.117.0 añade 'Co-authored-by: Copilot <[email protected]>' a los commits cuando se usan sugerencias en línea, incluso para una sola coma. La función es de exclusión voluntaria y no se comunicó claramente.

OpenClawRadar