오픈소스 vs 프런티어 모델: 단일 파일 캔버스 자동차 장면 벤치마크

✍️ OpenClawRadar📅 게시일: May 17, 2026🔗 Source
오픈소스 vs 프런티어 모델: 단일 파일 캔버스 자동차 장면 벤치마크
Ad

한 개발자가 12개 모델에 동일한 단일 파일 Canvas 프롬프트를 실행하여 현실적인 측면 자동차 주행 장면에서 오픈소스 모델과 최첨단 모델의 성능을 비교했습니다. 작업 조건: 하나의 독립적인 HTML 파일, 라이브러리나 외부 에셋 없음, 시차 배경, 회전하는 바퀴, 미묘한 차체 움직임, 영화 같은 조명, 끊김 없는 반복. 테스트 도구는 OpenCodeOrchestra이며, 결과는 oco-canvas-car-scene-compare에서 확인할 수 있습니다.

테스트된 모델

각 모델은 격리된 Orchestrator에서 가능한 가장 높은 사고/노력 설정으로 실행되었습니다. 목록에는 GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (최대 노력), Claude Opus 4.6 (최대 노력), Claude Sonnet 4.6 (높은 노력), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus, Grok 4.3이 포함됩니다. 토큰/초 및 생성 시간은 측정되지 않았습니다.

주요 발견 사항

  • 일부 모델은 내부적으로 감사 모델을 사용했고, 그렇지 않은 모델도 있었습니다.
  • 갤러리에서 명확한 승자와 모호한 결과를 확인할 수 있습니다.
  • MiMo V2.5 Pro는 OpenCode Go 구독의 청구 문제로 제외되었습니다.

갤러리 페이지에서는 각 모델의 출력을 나란히 비교할 수 있습니다. 소스 코드는 GitHub의 AidenGeunGeun/oco-canvas-car-scene-compare에서 확인할 수 있습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

세계 최초 AI 에이전트 전용 GitHub 독점 출시: 100명 한정 베타 테스트
News

세계 최초 AI 에이전트 전용 GitHub 독점 출시: 100명 한정 베타 테스트

AI 코딩 에이전트를 위한 혁신적인 GitHub 독점 기능이 개발되었으며, 100명의 사용자로 제한된 베타 버전이 공개되었습니다. 이 도구가 AI 협업을 어떻게 혁신할지 알아보세요.

OpenClawRadar
🦀
News

OpenClaw 업데이트가 브레이크 설정을 망가뜨림: 사용자들이 이에 대해 하는 조치

5개 사이트를 관리하는 사용자가 OpenClaw, Claude Code, Codex를 사용하며 업데이트가 기존 설정을 자주 망가뜨려 업그레이드에 신중한 접근을 취하게 되었다고 공유합니다.

OpenClawRadar
분재 27B: 전화기에서 실행되는 최초의 27B급 모델 — 벤치마크 점수와 사양
News

분재 27B: 전화기에서 실행되는 최초의 27B급 모델 — 벤치마크 점수와 사양

PrismML이 Bonsai 27B를 출시했습니다. 이는 3.9~5.9GB로 스마트폰과 노트북에서 실행 가능한 ternary/binary 27B 모델로, full-precision 기준의 90~95% 성능을 유지합니다.

OpenClawRadar
클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.
News

클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.

Anthropic는 4월 4일부터 Claude 구독 한도를 OpenClaw와 같은 서드파티 하네스와 함께 사용하는 것을 더 이상 허용하지 않으며, 이러한 사용에는 별도의 종량제 청구가 필요합니다. 사용자들은 월간 구독 가격과 동일한 일회성 크레딧을 받게 되며, 최대 30% 할인된 사용량 번들을 사전 구매할 수 있습니다.

OpenClawRadar