애플 실리콘 벤치마크: 비전 LLM 분류를 위한 M3, M4, M5 Max에서의 Qwen3-VL 성능

✍️ OpenClawRadar📅 게시일: April 6, 2026🔗 Source
애플 실리콘 벤치마크: 비전 LLM 분류를 위한 M3, M4, M5 Max에서의 Qwen3-VL 성능
Ad

벤치마크 설정 및 하드웨어

기술 도면(다양한 메가픽셀 해상도의 PDF)에 대해 비전 LLM 분류 파이프라인을 테스트했습니다. LM Studio와 MLX 백엔드를 사용했으며, 스트리밍이 활성화되었고, 동일한 53개 파일 테스트 데이터셋과 동일한 프롬프트를 적용했습니다. 이 작업은 모델이 이미지를 분석하고 짧은 구조화된 JSON 응답(~300-400 토큰)을 반환하는 분류 작업으로, 추론은 최소한의 토큰 생성과 함께 프리필이 지배적으로 이루어집니다.

테스트된 하드웨어:

  • M3 Max: 40 GPU 코어, 48 GB RAM, 400 GB/s 메모리 대역폭
  • M4 Max Studio: 40 GPU 코어, 64 GB RAM, 546 GB/s 메모리 대역폭
  • M5 Max: 40 GPU 코어, 64 GB RAM, 614 GB/s 메모리 대역폭

테스트된 모델

  • Qwen3-VL 8B: 8B 매개변수, 4비트 MLX 양자화, 디스크 상 ~5.8 GB
  • Qwen3.5 9B: 9B 매개변수 (밀집, 하이브리드 어텐션), 4비트 MLX 양자화, 디스크 상 ~6.2 GB
  • Qwen3-VL 32B: 32B 매개변수, 4비트 MLX 양자화, 디스크 상 ~18 GB

8B 모델 결과

Qwen3-VL 8B (4비트)의 이미지당 총 시간:

  • 4 MP: M3 Max 48GB: 16.5초, M4 Studio 64GB: 15.8초, M5 Max 64GB: 9.0초 (M5는 M3보다 83% 빠름)
  • 5 MP: M3 Max: 20.3초, M4 Studio: 19.8초, M5 Max: 11.5초 (77% 빠름)
  • 6 MP: M3 Max: 24.1초, M4 Studio: 24.4초, M5 Max: 14.0초 (72% 빠름)
  • 7.5 MP: M4 Studio: 32.7초, M5 Max: 20.3초

M3 Max와 M4 Studio는 8B 모델에서 기본적으로 동일한 성능을 보이며, M4가 37% 더 많은 메모리 대역폭을 가짐에도 불구하고 총 추론 시간은 3-5% 내에 있습니다. M5 Max는 둘보다 약 75-83% 더 빠릅니다.

Ad

M3와 M4가 유사한 속도를 보이는 이유

프리필(프롬프트 처리)은 메모리 대역폭이 아닌 GPU 컴퓨팅 코어 수에 따라 확장됩니다. 두 칩 모두 40개의 GPU 코어를 가지고 있으므로 프리필 속도는 동일합니다. 비전 모델의 경우 프리필이 지배적입니다: TTFT(첫 번째 토큰까지의 시간)는 총 추론 시간의 70-85%를 차지하는데, 이는 비전 인코더가 이미지당 많은 컴퓨팅 작업을 수행하기 때문입니다.

M4는 토큰 생성에서 대역폭 이점을 보입니다: 76-80 T/s 대 M3의 60-64 T/s (25% 더 빠름), 이는 37%의 대역폭 차이(546 대 400 GB/s)와 일치합니다. 그러나 짧은 출력(~300-400 토큰)이 있는 분류 작업의 경우 생성은 총 시간의 약 15%에 불과하므로, 25%의 생성 속도 이점은 최종적으로 단 3-5%의 개선으로 이어집니다.

32B 모델 결과

Qwen3-VL 32B (4비트)의 이미지당 총 시간:

  • 2 MP: M3 Max 48GB: 47.6초, M4 Studio 64GB: 35.3초, M5 Max 64GB: 21.2초
  • 4 MP: M3 Max: 63.2초, M4 Studio: 50.0초, M5 Max: 27.4초
  • 5 MP: M3 Max: 72.9초, M4 Studio: 59.2초, M5 Max: 30.7초
  • 6 MP: M3 Max: 85.3초, M4 Studio: 78.0초, M5 Max: 35.6초

요약, 설명 또는 코드 생성과 같은 더 긴 생성 작업의 경우 M4의 대역폭 이점은 이 분류 작업보다 더 중요할 것입니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

간단한 자기 증류 방법이 LLM 코드 생성 성능을 향상시킵니다
News

간단한 자기 증류 방법이 LLM 코드 생성 성능을 향상시킵니다

연구자들은 LLM을 자체 샘플링된 출력(단순 자기 증류)으로 미세 조정하면 코드 생성 성능이 향상된다는 것을 보여주었으며, Qwen3-30B-Instruct의 LiveCodeBench v6 pass@1 성능을 42.4%에서 55.3%로 향상시켰습니다.

OpenClawRadar
🦀
News

AI 스타트업, 연구 발표 감소: 오픈소스와 개발자에 미치는 영향

최고의 AI 스타트업들이 연구 결과를 거의 공개하지 않아, 분야의 투명성과 재현성에 대한 우려가 커지고 있습니다.

OpenClawRadar
레딧 토론에서 챗봇에서 로컬 실행이 가능한 자율 에이전트로의 전환을 강조합니다
News

레딧 토론에서 챗봇에서 로컬 실행이 가능한 자율 에이전트로의 전환을 강조합니다

레딧 게시물은 구체적인 예시를 통해 챗봇과 자율 에이전트를 구분하며, LLaMA와 같은 모델이 개인 워크스테이션에서 실행되는 로컬 실행 트렌드를 언급합니다.

OpenClawRadar
Anthropic, 모델 버전 고정 기능을 제거해 클라이언트 애플리케이션에 차질
News

Anthropic, 모델 버전 고정 기능을 제거해 클라이언트 애플리케이션에 차질

Anthropic은 claude-sonnet-4-5-20250929 모델을 지원 중단하고 사용자들을 claude-sonnet-4-6으로 강제 이전시키고 있습니다. 이 모델은 항상 최신 버전을 참조하며 특정 버전을 고정할 수 있는 방법이 없습니다. 이는 모델 버전이 변경될 때 클라이언트 애플리케이션이 예측 불가능하게 중단될 수 있음을 의미합니다.

OpenClawRadar