샤오미, MiMo-V2.5-Pro 오픈소스 공개: 코딩 벤치마크에서 클로드 오퍼스 4.6에 근접

샤오미가 MiMo-V2.5 오픈소스 모델군을 공개했으며, Pro 버전은 Claude Opus 4.6 및 GPT-5.4와 견줄 만한 벤치마크 성능을 보여줍니다.
실제 테스트
V2.5-Pro는 베이징 대학의 컴파일러 프로젝트(Rust로 작성된 SysY 컴파일러)를 4.3시간 만에 완료하여 만점인 233/233을 기록했습니다. 이는 몇 주를 소비하는 대부분의 학생보다 높은 점수입니다. '비디오 편집기 만들어 줘'와 같은 모호한 프롬프트에 대해 자율적으로 8,192줄의 데스크탑 애플리케이션을 생성했습니다. 이 앱은 멀티 트랙 타임라인, 클립 트리밍, 크로스페이드, 오디오 믹싱 및 내보내기 파이프라인을 갖추고 있으며, 11.5시간과 1,868회의 도구 호출이 소요되었습니다. 대학원 수준의 아날로그 회로 설계 작업(TSMC 180nm 공정의 Flipped-Voltage-Follower LDO)에서는 ngspice 시뮬레이션을 통해 반복적으로 개선하여 초기 시도 대비 라인 레귤레이션을 22배, 부하 레귤레이션을 17배 향상시켰습니다.
Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, DeepSeek V4 Pro 대비 벤치마크
- SWE-Bench Pro: 57.2 (vs. 57.3 Claude, 57.7 GPT, 54.2 Gemini, 55.4 DeepSeek)
- SWE-Bench Verified: 78.9 (vs. 80.8 Claude, n/a GPT, 76.2 Gemini, 80.6 DeepSeek)
- Terminal-Bench 2.0: 68.4 (vs. 65.4 Claude, 75.1 GPT, 68.5 Gemini, 67.9 DeepSeek) — Claude와 Gemini를 능가
- Claw-Eval Pass@3: 63.8 (vs. 70.4 Claude, 60.3 GPT, 57.8 Gemini, 59.8 DeepSeek) — GPT와 Gemini를 능가
- HLE with tools: 48.0 (vs. 53.0 Claude, 58.7 GPT, 51.4 Gemini, 48.2 DeepSeek) — 일반 추론에서는 뒤쳐짐
- GDPVal-AA: 1581 (vs. 1606 Claude, 1674 GPT, 1317 Gemini, 1554 DeepSeek) — GPT와 Claude에 뒤쳐짐
Claw-Eval에서 샤오미의 토큰 효율성 차트는 V2.5-Pro(63.8)가 Claude Sonnet 4.6을 능가한다고 주장합니다. V2.5-Pro는 1,000회 이상의 도구 호출에 걸친 지속적인 작업 실행을 지원하며 자체 수정이 가능합니다. 512번째 턴에서 회귀 리팩토링 패스가 자율적으로 발견되어 수정되었습니다.
가중치는 이제 오픈소스로 제공되어 다운로드 및 자체 호스팅이 가능합니다.
📖 전체 출처: HN AI Agents
👀 See Also
Claude Code v2.1.210: 작업 트리 격리, Ultracode 옵트인 및 수십 개의 버그 수정
주요 내용은 서브에이전트 작업트리 격리 수정, ultracode 키워드 옵트인 수정, 새로운 경과 시간 카운터, 권한 규칙 폐기 등입니다.

Claude Code v2.1.212: /fork가 백그라운드 세션 복사로 전환 + 실행 루프 보호
Claude Code v2.1.212에서는 /fork가 대화를 새로운 백그라운드 세션으로 복사하고, WebSearch 및 하위 에이전트 생성에 세션당 제한(기본 200)을 추가하며, MCP 호출을 2분 후 자동으로 백그라운드로 전환합니다.

구글의 나노 바나나 2 AI 이미지 모델: 기능과 이용 가능성
Google DeepMind가 나노 바나나 2를 출시했습니다. 이 이미지 생성 모델은 나노 바나나 프로의 고급 기능과 제미니 플래시의 속도를 결합했습니다. 최대 5명의 캐릭터에 대한 주체 일관성을 제공하며, 512px부터 4K까지의 해상도를 지원하고, Google 제품군 전반에 걸쳐 출시되고 있습니다.

Anthropic의 새로운 Claude 구독 크레딧: 에이전트 SDK와 claude -p가 6월 15일부터 별도의 한도 풀을 얻습니다
6월 15일부터 Claude 구독자는 Agent SDK와 claude -p 사용을 위한 별도의 월별 크레딧을 받게 됩니다: Max 20x 요금제는 월 $200, Max 5x는 $100, Pro는 $20입니다. 크레딧이 소진되면 추가 결제에 동의하지 않는 한 사용이 중단됩니다. 대화형 Claude Code와 채팅은 기존 구독 풀에서 사용됩니다.