El benchmark IDP Leaderboard muestra que Claude Sonnet 4.6 iguala a Opus 4.6 en tareas de IA para documentos.

El IDP Leaderboard, un punto de referencia abierto para la IA de documentos, ha publicado resultados comparando los modelos Claude en tareas de procesamiento de documentos. El punto de referencia evaluó 16 modelos en múltiples categorías utilizando más de 9,000 documentos reales.
Resultados del Punto de Referencia
Las puntuaciones de los modelos Claude del IDP Leaderboard:
- Claude Sonnet 4.6: 80.8 general
- Claude Opus 4.6: 80.3 general
- Claude Haiku 4.5: 69.6 general
Sonnet y Opus tuvieron un rendimiento esencialmente equivalente en tareas de extracción que incluyen texto, tablas, fórmulas y análisis de diseño. Los gráficos de radar para ambos modelos se ven idénticos según los resultados del punto de referencia.
Comparación de Costos
La fuente señala diferencias significativas de costo:
- Sonnet cuesta $24 por 1,000 páginas
- Opus cuesta $40 por 1,000 páginas
Para cargas de trabajo de procesamiento de documentos, el punto de referencia sugiere que no hay razón para usar Opus dado el rendimiento equivalente a un costo menor.
Advertencia Importante
Un hallazgo notable: los modelos Claude tenían una moderación de contenido más estricta que afectó el rendimiento en ciertos tipos de documentos. Escaneos de periódicos antiguos, páginas de libros de texto y documentos históricos a veces activaron filtros de contenido. Este problema solo apareció en los puntos de referencia OlmOCR y OmniDoc.
Todas las predicciones del punto de referencia son visibles en el Explorador de Resultados en idp-leaderboard.org, donde puedes ver exactamente lo que cada modelo Claude produjo en cada documento.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Eligiendo el Mejor Proveedor de Tokens para las Necesidades de Tu API
Explora los factores clave a considerar al seleccionar un proveedor de tokens y APIs en la codificación y automatización de IA, basado en las ideas de la comunidad de OpenClaw.

Investigación sobre la Consistencia de Agentes de IA: Hallazgos Clave y Conclusiones Prácticas
Un estudio de 3.000 experimentos en Claude, GPT-4o y Llama revela que los agentes consistentes logran una precisión del 80-92%, mientras que los inconsistentes caen al 25-60%, con un 69% de divergencia ocurriendo en la primera llamada a herramienta.

Los Autoencoders de Lenguaje Natural de Anthropic convierten las activaciones de Claude en inglés legible — Así es como
Anthropic presenta los Autoencoders de Lenguaje Natural (NLAs) que convierten las activaciones internas de Claude en explicaciones en texto plano, revelando el razonamiento del modelo sobre rimas, conciencia de pruebas de seguridad y detección de trampas.

Anthropic lanza 10 agentes de IA financiera para presentaciones, KYC y cierre de fin de mes
Anthropic lanzó 10 agentes de IA listos para usar para servicios financieros y seguros, que cubren la creación de pitchbooks, verificación KYC y cierre de fin de mes, entregados a través de Claude Cowork, Claude Code y Managed Agents.