클로드 오푸스 4.8 출시: 더 빠르고 저렴한 패스트 모드, 동적 워크플로우, 정직성 개선

Anthropic이 오늘 Claude Opus 4.8을 출시하며, 코드 작성, 에이전트 능력, 추론 및 지식 작업 전반에 걸친 벤치마크 개선 사항으로 Opus 4.7을 업그레이드했습니다. 새 버전은 이전 모델과 동일한 가격으로 제공됩니다.
주요 기능
- 노력 제어 (claude.ai) — 사용자는 이제 Claude가 작업에 투입하는 노력 수준을 설정할 수 있습니다.
- 동적 워크플로 (Claude Code) — 모델이 매우 대규모 문제를 처리할 수 있도록 합니다.
- 고속 모드는 2.5배 빠른 속도로 실행되며, 이전 모델의 고속 모드보다 3배 저렴합니다.
벤치마크 하이라이트
발표에 따르면, Claude Opus 4.8은 Anthropic의 Super-Agent 벤치마크에서 모든 케이스를 엔드투엔드로 완료한 유일한 모델이며, 비용 동등성에서 이전 Opus 모델과 GPT-5.5를 능가합니다. Online-Mind2Web(컴퓨터 사용 및 브라우저 에이전트 작업)에서 84%를 기록하여 Opus 4.7과 GPT-5.5 모두를 크게 앞질렀습니다. CursorBench에서는 모든 노력 수준에서 이전 Opus 모델을 초과합니다.
Legal Agent Benchmark에서 Opus 4.8은 올패스 기준으로 전체 10%를 돌파한 최초의 모델입니다. 초기 테스터들은 도구 호출 효율성(동일한 지능에 더 적은 단계), 인용 정확성, 검색 워크플로의 토큰 효율성 개선도 보고했습니다.
정직성 훈련
Opus 4.8은 명시적인 정직성 개선을 도입했습니다. 모델은 뒷받침되지 않는 주장을 피하고 입력/출력 문제를 사전에 알리도록 훈련되었습니다. 이는 테스터 평가에서 더 높은 품질의 분석과 더 나은 신호 대 잡음비로 이어졌습니다.
가격
Opus 4.8은 Opus 4.7과 동일한 가격으로 제공됩니다. 고속 모드 가격은 이전 고속 모드 가격보다 3배 저렴합니다. 멀티모달 토큰 비용은 Genie(Databricks의 AI 에이전트) 기준 Opus 4.7보다 61% 저렴합니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

2,181개 원격 MCP 서버 엔드포인트 분석 결과 신뢰성 문제 발견
2,181개의 원격 MCP 서버 엔드포인트에 대한 자동화된 헬스 체크 결과, 9%만이 정상 작동하는 것으로 확인되었으며, 52%는 완전히 작동하지 않고 37%는 인증이 필요한 것으로 나타났습니다. 이 데이터에는 카테고리별 분석, 지연 시간 측정, 가동 시간 통계가 포함되어 있습니다.

Claude Code v2.1.83은 관리형 설정 조각, 대화 기록 검색 및 보안 개선 사항을 추가합니다.
Claude Code v2.1.83는 팀 정책 조각을 위한 managed-settings.d/ 디렉터리, / 및 n/N 탐색 기능이 있는 대화 기록 검색, 하위 프로세스 환경에서 자격 증명을 제거하는 CLAUDE_CODE_SUBPROCESS_ENV_SCRUB=1 기능을 도입했습니다. 이번 릴리스에는 CwdChanged/FileChanged 훅, sandbox.failIfUnavailable 설정, macOS 종료 시 멈춤 현상, UI 정지, 메모리 누수 수정도 포함되어 있습니다.

TranslateGemma-12b: 인간 검토, 자동 평가가 놓친 오류의 71% 발견
인간 MQM 검토에서 자동 메트릭이 깨끗하다고 평가한 번역 세그먼트의 71%에서 문제가 발견되었으며, 25개의 정확성 오류 모두 메트릭이 감지하지 못한 사분면에 있었습니다.

Qwen3.5-27B 8비트 대 16비트 성능 비교
레딧 사용자가 vLLM을 사용해 Qwen3.5-27B의 bf16 가중치와 16비트 KV 캐시를 Qwen의 fp8 양자화와 8비트 KV 캐시와 비교 테스트한 결과, RTX 6000 Pro에서 Aider 벤치마크를 실행했을 때 실질적으로 동일한 결과를 얻었다고 보고했습니다.