IDP 리더보드 벤치마크에 따르면 Claude Sonnet 4.6이 문서 AI 작업에서 Opus 4.6과 동등한 성능을 보여줍니다.

✍️ OpenClawRadar📅 게시일: March 11, 2026🔗 Source
IDP 리더보드 벤치마크에 따르면 Claude Sonnet 4.6이 문서 AI 작업에서 Opus 4.6과 동등한 성능을 보여줍니다.
Ad

문서 AI를 위한 공개 벤치마크인 IDP 리더보드가 문서 처리 작업에서 Claude 모델들을 비교한 결과를 발표했습니다. 이 벤치마크는 9,000개 이상의 실제 문서를 사용해 여러 범주에서 16개 모델을 테스트했습니다.

벤치마크 결과

IDP 리더보드의 Claude 모델 점수:

  • Claude Sonnet 4.6: 전체 80.8점
  • Claude Opus 4.6: 전체 80.3점
  • Claude Haiku 4.5: 전체 69.6점

Sonnet과 Opus는 텍스트, 표, 수식, 레이아웃 분석을 포함한 추출 작업에서 본질적으로 동등한 성능을 보였습니다. 벤치마크 결과에 따르면 두 모델의 레이더 차트는 동일하게 나타납니다.

비용 비교

출처는 상당한 비용 차이를 언급합니다:

  • Sonnet: 1,000페이지당 $24
  • Opus: 1,000페이지당 $40

문서 처리 작업량에 대해 벤치마크는 더 낮은 비용으로 동등한 성능을 보이는 Opus를 사용할 이유가 없다고 제안합니다.

중요한 주의사항

주목할 만한 발견: Claude 모델들은 특정 문서 유형의 성능에 영향을 미치는 엄격한 콘텐츠 조정 기능을 가지고 있었습니다. 오래된 신문 스캔, 교과서 페이지, 역사적 문서는 때때로 콘텐츠 필터를 트리거했습니다. 이 문제는 OlmOCR 및 OmniDoc 벤치마크에서만 나타났습니다.

벤치마크의 모든 예측은 idp-leaderboard.org의 Results Explorer에서 확인할 수 있으며, 각 Claude 모델이 모든 문서에서 정확히 어떤 결과를 출력했는지 볼 수 있습니다.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Glomz Octagon: 다중 에이전트 코드 리뷰 – 179개 에이전트, 1,333개 리뷰, 네트워크 효과
News

Glomz Octagon: 다중 에이전트 코드 리뷰 – 179개 에이전트, 1,333개 리뷰, 네트워크 효과

Glomz.com에서 179개의 AI 에이전트가 등록하여 433개의 코드 제출물을 제출하고 'Octagon' 경기장에서 1,333개의 리뷰를 생성하는 실험을 진행했습니다. '리뷰 캐스케이드' 네트워크 효과는 실제로 나타났으며, 초기 리뷰가 3-5개인 제출물이 더 많은 에이전트를 끌어모았고, 가장 많은 리뷰를 받은 제출물은 21개의 리뷰를 받았습니다.

OpenClawRadar
OpenClaw, 첫 AMA 개최: AI 코딩 에이전트에 대한 통찰
News

OpenClaw, 첫 AMA 개최: AI 코딩 에이전트에 대한 통찰

AI 코딩 에이전트 분야의 주요 인물인 OpenClaw가 레딧에서 첫 AMA를 개최했습니다. 이 논의는 그 영향력, 향후 계획 및 과제에 대한 빛을 비추었습니다.

OpenClawRadar
미니맥스는 정말 구식일까? 현재 논쟁을 살펴보다
News

미니맥스는 정말 구식일까? 현재 논쟁을 살펴보다

AI와 기술 자동화의 세계에서, 레딧 토론이 미니맥스 알고리즘의 관련성에 대한 의문을 제기합니다. 정말 시대에 뒤떨어진 것일까요, 아니면 현대 AI 응용 프로그램에서 여전히 가치를 지니고 있을까요?

OpenClawRadar
🦀
News

AI在几分钟内解决CTF挑战——这对网络安全培训意味着什么

BSidesSF 2026에서 자율 에이전트가 52개의 CTF 챌린지를 단 몇 분 만에 모두 해결하며 1위를 차지했습니다. 이는 사이버 보안 기술을 측정하고 훈련하는 방식에 대한 재고를 강요합니다.

OpenClawRadar