오픈소스 vs 프런티어 모델: 단일 파일 캔버스 자동차 장면 벤치마크

한 개발자가 12개 모델에 동일한 단일 파일 Canvas 프롬프트를 실행하여 현실적인 측면 자동차 주행 장면에서 오픈소스 모델과 최첨단 모델의 성능을 비교했습니다. 작업 조건: 하나의 독립적인 HTML 파일, 라이브러리나 외부 에셋 없음, 시차 배경, 회전하는 바퀴, 미묘한 차체 움직임, 영화 같은 조명, 끊김 없는 반복. 테스트 도구는 OpenCodeOrchestra이며, 결과는 oco-canvas-car-scene-compare에서 확인할 수 있습니다.
테스트된 모델
각 모델은 격리된 Orchestrator에서 가능한 가장 높은 사고/노력 설정으로 실행되었습니다. 목록에는 GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (최대 노력), Claude Opus 4.6 (최대 노력), Claude Sonnet 4.6 (높은 노력), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus, Grok 4.3이 포함됩니다. 토큰/초 및 생성 시간은 측정되지 않았습니다.
주요 발견 사항
- 일부 모델은 내부적으로 감사 모델을 사용했고, 그렇지 않은 모델도 있었습니다.
- 갤러리에서 명확한 승자와 모호한 결과를 확인할 수 있습니다.
- MiMo V2.5 Pro는 OpenCode Go 구독의 청구 문제로 제외되었습니다.
갤러리 페이지에서는 각 모델의 출력을 나란히 비교할 수 있습니다. 소스 코드는 GitHub의 AidenGeunGeun/oco-canvas-car-scene-compare에서 확인할 수 있습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

세계 최초 AI 에이전트 전용 GitHub 독점 출시: 100명 한정 베타 테스트
AI 코딩 에이전트를 위한 혁신적인 GitHub 독점 기능이 개발되었으며, 100명의 사용자로 제한된 베타 버전이 공개되었습니다. 이 도구가 AI 협업을 어떻게 혁신할지 알아보세요.
OpenClaw 업데이트가 브레이크 설정을 망가뜨림: 사용자들이 이에 대해 하는 조치
5개 사이트를 관리하는 사용자가 OpenClaw, Claude Code, Codex를 사용하며 업데이트가 기존 설정을 자주 망가뜨려 업그레이드에 신중한 접근을 취하게 되었다고 공유합니다.

분재 27B: 전화기에서 실행되는 최초의 27B급 모델 — 벤치마크 점수와 사양
PrismML이 Bonsai 27B를 출시했습니다. 이는 3.9~5.9GB로 스마트폰과 노트북에서 실행 가능한 ternary/binary 27B 모델로, full-precision 기준의 90~95% 성능을 유지합니다.

클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.
Anthropic는 4월 4일부터 Claude 구독 한도를 OpenClaw와 같은 서드파티 하네스와 함께 사용하는 것을 더 이상 허용하지 않으며, 이러한 사용에는 별도의 종량제 청구가 필요합니다. 사용자들은 월간 구독 가격과 동일한 일회성 크레딧을 받게 되며, 최대 30% 할인된 사용량 번들을 사전 구매할 수 있습니다.