클로드 오푸스 5.5: 오푸스 5보다 40% 저렴, 터미널-벤치 4.0에서 66.4%

✍️ OpenClawRadar📅 게시일: September 23, 2026🔗 Source
Ad

Anthropic이 새로운 Claude 5.5 패밀리의 첫 모델인 Claude Opus 5.5를 출시했습니다. 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서도 Opus 5보다 실행 비용이 40% 저렴합니다. 입력 및 출력 토큰 가격은 백만 개당 각각 $4와 $20로 Opus 5보다 20% 저렴하며, Anthropic에 따르면 에이전트 및 코딩 작업 비용의 대부분을 차지하는 캐시 읽기는 백만 개당 $0.20로 60% 인하되었습니다. 출력 생성 속도는 Opus 5보다 30% 이상 빠릅니다.

벤치마크

Opus 5.5는 에이전트 코딩, 컴퓨터 사용, 지식 작업 전반에서 선두를 달립니다:

  • Terminal-Bench 4.0: 66.4% (Fable 5.1 55.8%, Opus 5 52.3%, GPT-6 Astra 57.9%, GPT-5.6 Sol 37.3% 대비)
  • FrontierCode v1.1 (Main): 54.4% (Fable 5.1: 50.3%, Opus 5: 48.0%)
  • CursorBench 4.0: 57.8% (Fable 5.1: 51.8%, Opus 5: 46.6%)
  • GDPval-AA v2.1: 1846 (Fable 5.1: 1735, Opus 5: 1708)
  • AutomationBench: 40.0% (Fable 5.1: 31.4%, Opus 5: 26.9%)
  • Humanity's Last Exam: 도구 사용 시 67.7% (Fable 5.1: 65.6%, Opus 5: 63.6%)
  • Terminal-Bench-Science 0.1: 58.7% (Fable 5.1: 52.6%, Opus 5: 29.0%, GPT-6 Astra: 64.6%)

Anthropic은 이 수준에서 벤치마크 격차가 실제 차이를 판단하는 데 덜 신뢰할 만한 지표가 되었으며, Opus 5.5와 Fable 5.1의 차이는 점수가 시사하는 것보다 실제로 더 좁다고 언급했습니다.

Ad

보고된 워크로드

한 테스터는 68만 줄 규모의 코드 마이그레이션을 하루 만에 완료했습니다. 웹 앱의 모든 페이지에서 로드 시간을 줄이기 위한 내부 테스트에서 Opus 5.5는 40번 중 39번 성공했습니다 — Opus 5는 더 작은 개선을 이루었지만 앱 동작도 변경했습니다. 또 다른 테스터는 여러 Claude 모델에 단일 프롬프트로 게임을 만들게 했는데, Opus 5.5가 그래픽과 완성도에서 가장 높은 점수를 받았습니다.

안전성 및 검증

Opus 5.5는 수천 개의 시뮬레이션 시나리오에서 Claude를 테스트하는 Anthropic의 자동화된 행동 감사에서 지금까지 최고 점수를 기록했습니다. 최근 모델들보다 되돌리기 어려운 행동을 하거나 주어진 경계를 벗어날 가능성이 낮고, Opus 5보다 프롬프트 인젝션에 더 강합니다. 테스트는 이제 더 긴 작업, 불가능한 작업, 실제 사건을 모델링한 시나리오까지 포함합니다. 생물학 및 사이버보안에서 Claude Mythos 5.1과 비슷하기 때문에 Anthropic은 Claude Fable 5.1과 유사한 안전장치와 함께 배포하고 있습니다.

검증된 조직은 생물학 연구 사용을 위해 Life Sciences Verification Program에 신청할 수 있으며, Cyber Verification Program은 향후 몇 주 내에 검증된 실무자들을 위해 확대됩니다.

제한 및 이용 가능성

Pro, Max, Team 및 좌석 기반 Enterprise 플랜의 5시간 사용 제한이 늘어납니다. 구독 사용자는 원할 때 저장하고 사용할 수 있는 속도 제한 재설정을 받습니다. Claude Sonnet 5.5와 Claude Haiku 5.5는 성능, 효율성, 안전성에서 유사한 개선을 갖추고 향후 몇 주 내에 출시됩니다.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also