El benchmark IDP Leaderboard muestra que Claude Sonnet 4.6 iguala a Opus 4.6 en tareas de IA para documentos.

El IDP Leaderboard, un punto de referencia abierto para la IA de documentos, ha publicado resultados comparando los modelos Claude en tareas de procesamiento de documentos. El punto de referencia evaluó 16 modelos en múltiples categorías utilizando más de 9,000 documentos reales.
Resultados del Punto de Referencia
Las puntuaciones de los modelos Claude del IDP Leaderboard:
- Claude Sonnet 4.6: 80.8 general
- Claude Opus 4.6: 80.3 general
- Claude Haiku 4.5: 69.6 general
Sonnet y Opus tuvieron un rendimiento esencialmente equivalente en tareas de extracción que incluyen texto, tablas, fórmulas y análisis de diseño. Los gráficos de radar para ambos modelos se ven idénticos según los resultados del punto de referencia.
Comparación de Costos
La fuente señala diferencias significativas de costo:
- Sonnet cuesta $24 por 1,000 páginas
- Opus cuesta $40 por 1,000 páginas
Para cargas de trabajo de procesamiento de documentos, el punto de referencia sugiere que no hay razón para usar Opus dado el rendimiento equivalente a un costo menor.
Advertencia Importante
Un hallazgo notable: los modelos Claude tenían una moderación de contenido más estricta que afectó el rendimiento en ciertos tipos de documentos. Escaneos de periódicos antiguos, páginas de libros de texto y documentos históricos a veces activaron filtros de contenido. Este problema solo apareció en los puntos de referencia OlmOCR y OmniDoc.
Todas las predicciones del punto de referencia son visibles en el Explorador de Resultados en idp-leaderboard.org, donde puedes ver exactamente lo que cada modelo Claude produjo en cada documento.
📖 Read the full source: r/ClaudeAI
👀 Ver también

sseanliu/VisionClaw trae asistencia de IA en tiempo real a las gafas inteligentes Meta Ray-Ban.
La VisiónClaw de sseanliu ofrece un asistente de IA revolucionario para las gafas inteligentes Meta Ray-Ban, combinando voz, visión y acciones autónomas impulsadas por Gemini Live y OpenClaw.

Los Términos del Contrato del Pentágono con OpenAI Permiten 'Cualquier Uso Legal', Incluyendo Posible Vigilancia
OpenAI negoció nuevos términos con el Pentágono que incluyen la frase 'cualquier uso legal', lo que según fuentes permite al ejército utilizar la tecnología de OpenAI para programas de vigilancia masiva si son técnicamente legales. Anthropic fue incluida en la lista negra por negarse a ceder en dos líneas rojas: no a la vigilancia masiva de estadounidenses y no a las armas autónomas letales.

Claude AI Muestra Error de Repetición con el Término 'Sketcher' en el Flujo de Trabajo de QGIS
Un usuario reportó que Claude AI repetidamente generaba la palabra 'sketcher' al proporcionar orientación sobre QGIS para alinear archivos DXF, sugiriendo un posible error del modelo con términos específicos. La fuente incluye detalles prácticos del flujo de trabajo de QGIS para la alineación de sistemas de coordenadas.
Por Favor, Dejen de Inundar los Proyectos de Código Abierto con Basura de IA
Un mantenedor denuncia las PRs y reportes de seguridad generados por IA que inundan los proyectos de código abierto, cerrando PRs de corrección de erratas sin comentarios y instando a los contribuidores a preocuparse por los proyectos, no solo por las insignias de GitHub.