PinchBench 결과: 최초의 OpenClaw 전용 AI 코딩 에이전트 벤치마크

PinchBench은 OpenClaw 생태계에서 AI 코딩 에이전트를 평가하기 위해 특별히 설계된 첫 벤치마크로, 성공률, 비용, 속도로 모델을 순위 매깁니다.
주요 결과
벤치마크는 32개 모델을 테스트했습니다. 성공률 기준 상위 모델:
- 1. google/gemini-3-flash-preview: 95.1% 성공률, 0.72달러 비용, 254.50초 속도
- 2. minimax/minimax-m2.1: 93.6% 성공률, 0.14달러 비용, 239.79초 속도
- 3. moonshotai/kimi-k2.5: 93.4% 성공률, 0.20달러 비용, 291.67초 속도
- 4. anthropic/claude-sonnet-4.5: 92.7% 성공률, 3.07달러 비용, 304.53초 속도
- 5. google/gemini-3-pro-preview: 91.7% 성공률, 1.48달러 비용, 239.55초 속도
주목할 만한 발견
- Flash 모델이 Pro 모델보다 낮은 비용으로 우수: Gemini-3-Flash-Preview(95.1%, 0.72달러)가 Gemini-3-Pro-Preview(91.7%, 1.48달러)보다 성능이 뛰어남
- 더 비싼 모델이 반드시 더 나은 성능을 보이지는 않음
- Minimax 2.5는 35.5% 성공률, 105.96초 속도로 31위를 기록(비용은 명시되지 않음)
- 여러 모델이 90% 이상의 높은 성공률을 유지하면서도 비용을 1달러 미만으로 낮춤
성능 범위
성공률은 95.1%(최상위)에서 35.2%(최하위)까지 분포합니다. 비용 효율적인 옵션으로는:
- openai/gpt-5-nano: 85.8% 성공률에 0.03달러
- google/gemini-2.5-flash-lite: 83.2% 성공률에 0.05달러
- mistralai/devstral-2512: 81.7% 성공률에 0.10달러
순위 하위(23-32위)의 여러 모델은 약 40% 이하의 성공률을 보이며, 제공된 데이터에는 비용이 명시되지 않았습니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

오프 그리드 모바일 앱, 온디바이스 AI 도구 사용 추가 및 3배 속도 향상
오프 그리드 모바일 앱이 이제 AI 모델이 웹 검색, 계산기, 날짜/시간, 디바이스 정보와 같은 도구들을 완전히 오프라인에서 사용할 수 있도록 업데이트되었으며, 구성 가능한 KV 캐시 옵션으로 휴대폰에서 최대 30 토큰/초의 속도를 제공합니다.

AI 코딩 에이전트를 위한 교차 모델 검토 루프가 치명적인 계획 결함을 포착합니다
한 개발자가 코딩 에이전트의 계획을 실행 전에 두 번째 AI 모델이 검토하는 교차 모델 검토 시스템을 구축했습니다. 이 시스템은 롤백 실패와 보안 허점 같은 치명적 결함을 포착합니다. 이 도구는 MIT 라이선스로 배포되며 TUI 대시보드를 포함합니다.

스탠퍼드 연구진, 온디바이스 AI 에이전트를 위한 로컬-퍼스트 프레임워크 'OpenJarvis' 공개
스탠퍼드 연구진이 도구, 메모리, 학습 기능을 갖춘 온디바이스 개인 AI 에이전트 구축을 위한 로컬 퍼스트 프레임워크인 OpenJarvis를 공개했습니다. 이 프로젝트에는 개발자들이 살펴볼 수 있는 GitHub 저장소와 웹사이트 링크가 포함되어 있습니다.

에이전트 룸: Claude 코드 에이전트 팀 시각화 데스크톱 앱
Agents Room은 .claude/agents/ 폴더를 스캔하여 프론트매터를 읽고, 자동 연결선이 있는 캔버스 상에 에이전트 관계를 시각화하는 Electron 데스크톱 애플리케이션입니다. 마크다운 파일을 편집하는 대신 UI에서 직접 에이전트, 스킬, 명령을 생성/편집할 수 있습니다.