oMLX에서 Qwen 모델에 대한 M5 Max 대 M3 Max 추론 벤치마크

Reddit 사용자 /u/onil_gova는 40개의 GPU 코어와 128GB 통합 메모리를 탑재한 M5 Max와 M3 Max 프로세서가 장착된 16인치 MacBook Pro를 비교하는 추론 벤치마크를 실행했습니다. 테스트에는 oMLX v0.2.23과 세 가지 Qwen 3.5 모델(122B-A10B MoE, 35B-A3B MoE, 27B dense)이 사용되었습니다.
벤치마크 결과
pp1024/tg128(프롬프트 처리 길이 1024, 토큰 생성 길이 128)에서 M5 Max는 상당한 속도 향상을 보였습니다:
- 35B-A3B MoE: 134.5 vs 80.3 tg tok/s (1.7배 더 빠름)
- 122B-A10B MoE: 65.3 vs 46.1 tg tok/s (1.4배 더 빠름)
- 27B dense: 32.8 vs 23.0 tg tok/s (1.4배 더 빠름)
성능 차이는 더 긴 컨텍스트에서 더 커집니다. 65K 컨텍스트 길이에서 27B dense 모델은 M3 Max에서 6.8 tg tok/s, M5 Max에서 19.6 tg tok/s로 떨어졌습니다(2.9배 차이).
프리필 및 배칭 성능
프리필 이점은 더 컸으며, 긴 컨텍스트 길이에서 M5 Max가 최대 4배 더 빠른 속도를 보였는데, 이는 M5 Max의 GPU 신경 가속기 덕분입니다.
에이전트 작업 부하에 대한 배칭 성능은 중요한 차이를 보였습니다:
- M5 Max는 35B-A3B 모델에서 4배 배치 크기에서 2.54배 처리량으로 확장됨
- M3 Max의 dense 모델 배칭은 성능 저하를 초래함(122B 모델에서 2배 배치 시 0.80배)
대역폭 차이(M5 Max 614 GB/s vs M3 Max 400 GB/s)는 다단계 에이전트 루프나 병렬 도구 호출에 중요합니다.
MoE 효율성 통찰
벤치마크는 122B 모델(활성 매개변수 10B)이 두 기기에서 27B dense 모델보다 더 빠르게 생성한다는 것을 보여주었습니다. 이는 총 모델 크기가 아닌 활성 매개변수 수가 추론 속도를 결정한다는 것을 입증합니다.
모든 차트와 데이터가 포함된 전체 상호작용 분석은 다음에서 확인할 수 있습니다: https://claude.ai/public/artifacts/c9fba245-e734-4b3b-be44-a6cabdec6f8f
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenAI의 국방부 계약 조건은 잠재적 감시를 포함한 '합법적인 모든 사용'을 허용합니다
오픈AI는 '합법적 사용'이라는 문구를 포함한 국방부와의 새로운 조건을 협상했으며, 관계자들에 따르면 이는 군이 기술적으로 합법적인 경우 오픈AI의 기술을 대규모 감시 프로그램에 사용할 수 있도록 허용합니다. 앤트로픽은 두 가지 빨간 선, 즉 미국인에 대한 대규모 감시와 치명적 자율 무기 사용을 거부하며 양보하지 않아 블랙리스트에 올랐습니다.

IPO 앞두고 AI 일자리 종말 예측 거둬들이는 알트만과 아모데이
오픈AI의 샘 알트먼과 앤트로픽의 다리오 아모데이가 AI가 사무직 일자리를 없앨 것이라는 경고를 철회하고 있습니다. 두 회사는 각각 1조 달러 규모의 IPO를 준비 중입니다. 골드만삭스 CEO 데이비드 솔로몬은 자신이 처음부터 옳았다고 말합니다.

머큐리 2: 실시간 AI 코딩을 위한 확산 기반 모델
머큐리 2는 순차적인 토큰별 디코딩 대신 확산 기반 생성을 사용하며, 토큰을 병렬로 생성하고 여러 단계에 걸쳐 개선합니다. NVIDIA Blackwell GPU에서 1,009 토큰/초를 달성한다고 주장하며, 가격은 입력 토큰 100만 개당 $0.25, 출력 토큰 100만 개당 $0.75입니다.

Claude Code v2.1.79 자동 업데이트 후 OAuth 로그인 오류: 해결 방법과 수정
Claude Code v2.1.79에는 네이티브 설치 프로그램을 통해 자동 업데이트된 후 OAuth 로그인이 작동하지 않는 확인된 버그가 있습니다. 이 문제를 해결하려면 네이티브 설치를 제거하고 v2.1.75로 다운그레이드해야 합니다.