클로드 오푸스 4.8 출시: 더 빠르고 저렴한 패스트 모드, 동적 워크플로우, 정직성 개선

✍️ OpenClawRadar📅 게시일: May 29, 2026🔗 Source
클로드 오푸스 4.8 출시: 더 빠르고 저렴한 패스트 모드, 동적 워크플로우, 정직성 개선
Ad

Anthropic이 오늘 Claude Opus 4.8을 출시하며, 코드 작성, 에이전트 능력, 추론 및 지식 작업 전반에 걸친 벤치마크 개선 사항으로 Opus 4.7을 업그레이드했습니다. 새 버전은 이전 모델과 동일한 가격으로 제공됩니다.

주요 기능

  • 노력 제어 (claude.ai) — 사용자는 이제 Claude가 작업에 투입하는 노력 수준을 설정할 수 있습니다.
  • 동적 워크플로 (Claude Code) — 모델이 매우 대규모 문제를 처리할 수 있도록 합니다.
  • 고속 모드는 2.5배 빠른 속도로 실행되며, 이전 모델의 고속 모드보다 3배 저렴합니다.

벤치마크 하이라이트

발표에 따르면, Claude Opus 4.8은 Anthropic의 Super-Agent 벤치마크에서 모든 케이스를 엔드투엔드로 완료한 유일한 모델이며, 비용 동등성에서 이전 Opus 모델과 GPT-5.5를 능가합니다. Online-Mind2Web(컴퓨터 사용 및 브라우저 에이전트 작업)에서 84%를 기록하여 Opus 4.7과 GPT-5.5 모두를 크게 앞질렀습니다. CursorBench에서는 모든 노력 수준에서 이전 Opus 모델을 초과합니다.

Legal Agent Benchmark에서 Opus 4.8은 올패스 기준으로 전체 10%를 돌파한 최초의 모델입니다. 초기 테스터들은 도구 호출 효율성(동일한 지능에 더 적은 단계), 인용 정확성, 검색 워크플로의 토큰 효율성 개선도 보고했습니다.

정직성 훈련

Opus 4.8은 명시적인 정직성 개선을 도입했습니다. 모델은 뒷받침되지 않는 주장을 피하고 입력/출력 문제를 사전에 알리도록 훈련되었습니다. 이는 테스터 평가에서 더 높은 품질의 분석과 더 나은 신호 대 잡음비로 이어졌습니다.

가격

Opus 4.8은 Opus 4.7과 동일한 가격으로 제공됩니다. 고속 모드 가격은 이전 고속 모드 가격보다 3배 저렴합니다. 멀티모달 토큰 비용은 Genie(Databricks의 AI 에이전트) 기준 Opus 4.7보다 61% 저렴합니다.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also

2,181개 원격 MCP 서버 엔드포인트 분석 결과 신뢰성 문제 발견
News

2,181개 원격 MCP 서버 엔드포인트 분석 결과 신뢰성 문제 발견

2,181개의 원격 MCP 서버 엔드포인트에 대한 자동화된 헬스 체크 결과, 9%만이 정상 작동하는 것으로 확인되었으며, 52%는 완전히 작동하지 않고 37%는 인증이 필요한 것으로 나타났습니다. 이 데이터에는 카테고리별 분석, 지연 시간 측정, 가동 시간 통계가 포함되어 있습니다.

OpenClawRadar
Claude Code v2.1.83은 관리형 설정 조각, 대화 기록 검색 및 보안 개선 사항을 추가합니다.
News

Claude Code v2.1.83은 관리형 설정 조각, 대화 기록 검색 및 보안 개선 사항을 추가합니다.

Claude Code v2.1.83는 팀 정책 조각을 위한 managed-settings.d/ 디렉터리, / 및 n/N 탐색 기능이 있는 대화 기록 검색, 하위 프로세스 환경에서 자격 증명을 제거하는 CLAUDE_CODE_SUBPROCESS_ENV_SCRUB=1 기능을 도입했습니다. 이번 릴리스에는 CwdChanged/FileChanged 훅, sandbox.failIfUnavailable 설정, macOS 종료 시 멈춤 현상, UI 정지, 메모리 누수 수정도 포함되어 있습니다.

OpenClawRadar
TranslateGemma-12b: 인간 검토, 자동 평가가 놓친 오류의 71% 발견
News

TranslateGemma-12b: 인간 검토, 자동 평가가 놓친 오류의 71% 발견

인간 MQM 검토에서 자동 메트릭이 깨끗하다고 평가한 번역 세그먼트의 71%에서 문제가 발견되었으며, 25개의 정확성 오류 모두 메트릭이 감지하지 못한 사분면에 있었습니다.

OpenClawRadar
Qwen3.5-27B 8비트 대 16비트 성능 비교
News

Qwen3.5-27B 8비트 대 16비트 성능 비교

레딧 사용자가 vLLM을 사용해 Qwen3.5-27B의 bf16 가중치와 16비트 KV 캐시를 Qwen의 fp8 양자화와 8비트 KV 캐시와 비교 테스트한 결과, RTX 6000 Pro에서 Aider 벤치마크를 실행했을 때 실질적으로 동일한 결과를 얻었다고 보고했습니다.

OpenClawRadar