최신 AI 모델 벤치마킹: 극단적 모델의 부상

최근 40개의 새로운 AI 모델에 대한 벤치마킹 결과, 가격 대비 성능 지형에서 중요한 변화가 드러났습니다. Kimi k2.5와 Claude Opus 4.6에 주목한 분석은 '갓 모드'와 '플래시 모드'라는 두 극단으로 나뉘어 중간급 모델들을 무용지물로 만드는 것을 보여줍니다.
주요 세부사항
- Kimi k2.5 상황: Kimi k2.5 벤치마킹 시도는 지속적인 '콘텐츠 없음' 오류로 인해 실패했으며, 이는 과부하 때문일 가능성이 높습니다. 그러나 Kimi-k2-Thinking은 복잡한 추론 작업에서 ~15 TPS로 적절한 성능을 보였습니다.
- 속도 우위: 지연 시간에 민감한 애플리케이션의 경우, Liquid LFM 2.5가 ~359 토큰/초로 가장 빠른 모델로 부상했으며, Ministral 3B가 ~293 토큰/초로 그 뒤를 이었습니다.
- 비용 효율성: Ministral 3B는 100만 입력 토큰당 $0.10로 가장 비용 효율적인 솔루션으로 두드러집니다. GPT-5.2 Codex보다 약 17배 저렴하고 약 40% 빠르며, 고가 옵션에 대한 강력한 가치 대안입니다.
경쟁력 있는 성능을 제공하지 못하는 $0.50 - $1.00 사이의 중간급 모델들은 피하는 것이 좋습니다. 필요에 따라 Opus/GPT-5와 같은 고가 모델을 지능적인 성능을 위해 선택하거나, Liquid/Mistral로 비용 효율적인 속도를 선택하세요.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Chromebook에서 OpenClaw 실행 가능성 탐구
Chromebook에서 OpenClaw를 실행하는 것은 생각보다 쉬울 수 있습니다. OpenClawRadar의 최신 탐구는 사용자 경험과 요구 사항을 분석하여 Chromebook이 이 AI 코딩 에이전트를 처리할 수 있는지 알아봅니다.

클로드 4.6 적응형 사고: 레딧 사용자가 토큰 낭비를 보고하고 비활성화 명령어를 제공함
레딧 사용자가 Claude 4.6의 새로운 적응형 사고 기능이 Claude Code에서 토큰을 낭비하고 지연 시간을 추가할 수 있다고 보고하며, 이를 비활성화하거나 사고 토큰을 제한하는 셸 명령어를 제공합니다.
OpenClaw 업데이트가 브레이크 설정을 망가뜨림: 사용자들이 이에 대해 하는 조치
5개 사이트를 관리하는 사용자가 OpenClaw, Claude Code, Codex를 사용하며 업데이트가 기존 설정을 자주 망가뜨려 업그레이드에 신중한 접근을 취하게 되었다고 공유합니다.

Claude Code v2.1.154: Opus 4.8, 동적 워크플로우 및 주요 수정 사항
새로운 릴리스에는 높은 노력을 기본값으로 하는 Opus 4.8, 수십에서 수백 개의 에이전트를 조율하는 동적 워크플로, 2배 요금으로 2.5배 속도를 제공하는 고속 모드, 그리고 수많은 버그 수정이 포함되었습니다.