oMLX에서 Qwen 모델에 대한 M5 Max 대 M3 Max 추론 벤치마크

✍️ OpenClawRadar📅 게시일: March 28, 2026🔗 Source
oMLX에서 Qwen 모델에 대한 M5 Max 대 M3 Max 추론 벤치마크
Ad

Reddit 사용자 /u/onil_gova는 40개의 GPU 코어와 128GB 통합 메모리를 탑재한 M5 Max와 M3 Max 프로세서가 장착된 16인치 MacBook Pro를 비교하는 추론 벤치마크를 실행했습니다. 테스트에는 oMLX v0.2.23과 세 가지 Qwen 3.5 모델(122B-A10B MoE, 35B-A3B MoE, 27B dense)이 사용되었습니다.

벤치마크 결과

pp1024/tg128(프롬프트 처리 길이 1024, 토큰 생성 길이 128)에서 M5 Max는 상당한 속도 향상을 보였습니다:

  • 35B-A3B MoE: 134.5 vs 80.3 tg tok/s (1.7배 더 빠름)
  • 122B-A10B MoE: 65.3 vs 46.1 tg tok/s (1.4배 더 빠름)
  • 27B dense: 32.8 vs 23.0 tg tok/s (1.4배 더 빠름)

성능 차이는 더 긴 컨텍스트에서 더 커집니다. 65K 컨텍스트 길이에서 27B dense 모델은 M3 Max에서 6.8 tg tok/s, M5 Max에서 19.6 tg tok/s로 떨어졌습니다(2.9배 차이).

Ad

프리필 및 배칭 성능

프리필 이점은 더 컸으며, 긴 컨텍스트 길이에서 M5 Max가 최대 4배 더 빠른 속도를 보였는데, 이는 M5 Max의 GPU 신경 가속기 덕분입니다.

에이전트 작업 부하에 대한 배칭 성능은 중요한 차이를 보였습니다:

  • M5 Max는 35B-A3B 모델에서 4배 배치 크기에서 2.54배 처리량으로 확장됨
  • M3 Max의 dense 모델 배칭은 성능 저하를 초래함(122B 모델에서 2배 배치 시 0.80배)

대역폭 차이(M5 Max 614 GB/s vs M3 Max 400 GB/s)는 다단계 에이전트 루프나 병렬 도구 호출에 중요합니다.

MoE 효율성 통찰

벤치마크는 122B 모델(활성 매개변수 10B)이 두 기기에서 27B dense 모델보다 더 빠르게 생성한다는 것을 보여주었습니다. 이는 총 모델 크기가 아닌 활성 매개변수 수가 추론 속도를 결정한다는 것을 입증합니다.

모든 차트와 데이터가 포함된 전체 상호작용 분석은 다음에서 확인할 수 있습니다: https://claude.ai/public/artifacts/c9fba245-e734-4b3b-be44-a6cabdec6f8f

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
News

Claude Code v2.1.285, 데스크톱 핸드오프, 플러그인 구성 CLI 및 공급자 제한 추가

Claude Code v2.1.285에는 CLAUDE_CODE_DISABLE_WEB_FETCH, 세션을 데스크톱 앱으로 넘기는 claude --desktop, 플러그인 옵션을 읽고 쓰는 claude plugin configure, allowedProviders 관리형 설정, 그리고 서브에이전트와 MCP 관련 수많은 수정 사항이 포함되었습니다.

OpenClawRadar
AI 공급업체 종속 심화: 모델 전환 비용, 대부분의 예상보다 더 비싸져
News

AI 공급업체 종속 심화: 모델 전환 비용, 대부분의 예상보다 더 비싸져

Zapier가 미국 임원 542명을 대상으로 한 설문조사에서 90%가 4주 이내에 AI 공급업체를 전환할 수 있다고 생각했지만, 실제 전환 시도 중 58%가 실패하거나 훨씬 더 오래 걸린 것으로 나타났습니다. 한편, OpenAI는 GPT-5.2의 입력 토큰 가격을 $1.25에서 $5.75로 인상했고, Anthropic은 Claude 엔터프라이즈를 동적 가격 책정으로 전환하여 헤비 유저의 비용이 두 배 또는 세 배로 늘어날 수 있습니다.

OpenClawRadar
Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트
News

Qwen 3.6-35B-A3B KV 캐시 벤치마크: M5 Max에서 f16 vs q8_0 vs Turbo3 vs Turbo4, 최대 1M 컨텍스트

M5 Max에서 TheTom의 TurboQuant Metal 포크 벤치마크 결과, f16과 q8_0은 256K를 넘어가면 OOM이 발생하는 반면, turbo3는 1M 컨텍스트에서 6.5 tok/s의 디코드 속도를 기록했습니다. 프리필과 디코드 분할에서는 긴 컨텍스트에서 프리필은 turbo3, 디코드는 turbo4가 우세했습니다.

OpenClawRadar
아홈 가지 일반적인 AI 코딩 에이전트 실패 패턴과 사전 실행 검증
News

아홈 가지 일반적인 AI 코딩 에이전트 실패 패턴과 사전 실행 검증

레딧 게시물은 AI 코딩 에이전트가 실패하는 일반적인 원인인 9가지 특정 실패 패턴을 식별하며, 불완전한 열거형 처리, 침묵하는 널 경로, 환각된 임포트 등을 포함합니다. 저자는 실행 전에 검증 단계를 구현하면 이러한 실패의 약 70%를 잡을 수 있다고 보고합니다.

OpenClawRadar