벤치마크: M5 Max MacBook Pro에서 Qwen3-Coder-Next 8비트 실행 시 MLX 대 Ollama

✍️ OpenClawRadar📅 게시일: April 16, 2026🔗 Source
벤치마크: M5 Max MacBook Pro에서 Qwen3-Coder-Next 8비트 실행 시 MLX 대 Ollama
Ad

애플 실리콘에서 8비트 양자화된 동일한 Qwen3-Coder-Next 모델을 실행하는 두 개의 로컬 추론 백엔드—MLX(애플의 네이티브 ML 프레임워크)와 Ollama(llama.cpp 기반)—를 비교하는 벤치마크가 수행되었습니다. 목표는 실제 프로그래밍 작업에서 원시 처리량(초당 토큰 수), 첫 번째 토큰까지의 시간(TTFT), 그리고 전반적인 코딩 능력을 측정하는 것이었습니다.

방법론

설정은 다음과 같았습니다:

  • MLX 백엔드: mlx-lm v0.29.1이 내장된 OpenAI 호환 HTTP 서버(포트 8080)를 통해 mlx-community/Qwen3-Coder-Next-8bit를 제공합니다.
  • Ollama 백엔드: Ollama가 OpenAI 호환 API(포트 11434)를 통해 qwen3-coder-next:Q8_0를 제공합니다.

두 백엔드는 모두 스트리밍이 활성화된 OpenAI 클라이언트 라이브러리를 사용하는 동일한 Python 벤치마크 하니스를 통해 접근되었습니다. 각 테스트는 프롬프트당 3회 반복 실행되었으며, 결과는 평균화되었고 초기 콜드 스타트 프롬프트(모델 로드)에 대한 첫 번째 반복의 TTFT는 제외되었습니다.

테스트 스위트

여섯 개의 프롬프트가 다양한 코딩 작업을 다루었습니다:

  • 짧은 완성: 회문 검사 함수 작성(최대 150 토큰)
  • 중간 생성: 타입 힌트가 포함된 LRU 캐시 클래스 구현(최대 500 토큰)
  • 긴 추론: 예제와 함께 async/await 대 스레딩 설명(최대 1000 토큰)
  • 디버그 작업: 병합 정렬 및 이진 검색에서 버그 찾기 및 수정(최대 800 토큰)
  • 복잡한 코딩: 컨텍스트 관리자가 있는 스레드 안전 경계 블로킹 큐(최대 1000 토큰)
  • 코드 리뷰: 성능/정확성/스타일에 대해 3개의 함수 검토(최대 1000 토큰)
Ad

결과

128GB RAM이 탑재된 M5 Max에서의 처리량(초당 토큰 수):

  • 짧은 완성: Ollama 32.51 토큰/초, MLX 69.62 토큰/초 (MLX +114%)
  • 중간 생성: Ollama 35.97 토큰/초, MLX 78.28 토큰/초 (MLX +118%)
  • 긴 추론: Ollama 40.45 토큰/초, MLX 78.29 토큰/초 (MLX +94%)
  • 디버그 작업: Ollama 37.06 토큰/초, MLX 74.89 토큰/초 (MLX +102%)
  • 복잡한 코딩: Ollama 35.84 토큰/초, MLX 76.99 토큰/초 (MLX +115%)
  • 코드 리뷰: Ollama 39.00 토큰/초, MLX 74.98 토큰/초 (MLX +92%)

전체 평균: MLX는 약 초당 72 토큰을 달성하여 Ollama의 처리량을 약 2배로 능가했습니다. 측정된 지표에는 토큰/초(초당 생성된 출력 토큰, 높을수록 좋음), TTFT(요청 전송부터 첫 번째 토큰 수신까지의 시간, 낮을수록 좋음), 총 시간(전체 응답에 대한 실제 시간, 낮을수록 좋음), 그리고 psutil을 통해 측정된 메모리 사용량이 포함되었습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Engramx v3.4: MCP 서버 + SQLite 지식 그래프로 클로드 코드 토큰 사용량 89% 감소
Tools

Engramx v3.4: MCP 서버 + SQLite 지식 그래프로 클로드 코드 토큰 사용량 89% 감소

Engramx v3.4는 Claude Code 에이전트의 파일 읽기를 가로채 원시 콘텐츠 대신 구조적 요약을 반환합니다. 벤치마크 결과 87개 파일 코드베이스에서 총 89.1%의 토큰 감소를 보였습니다.

OpenClawRadar
Ouroboros, Claude Code의 사양 격차를 해소하기 위해 PM 인터뷰 모드 추가
Tools

Ouroboros, Claude Code의 사양 격차를 해소하기 위해 PM 인터뷰 모드 추가

Ouroboros에는 이제 Claude Code로 작업을 넘기기 전에 안내 인터뷰를 실행하는 PM 모드가 포함되어 있습니다. 이 모드는 해결하려는 문제, 대상 사용자, 중요한 제약 조건과 같은 질문을 합니다. 결과물은 목표, 사용자 스토리, 제약 조건, 성공 기준, 가정, 보류 항목이 포함된 PRD/PM 문서입니다.

OpenClawRadar
OpenClaw용 스킬 크리에이터 도구는 개발자가 워크플로우를 패키징하는 데 도움을 줍니다.
Tools

OpenClaw용 스킬 크리에이터 도구는 개발자가 워크플로우를 패키징하는 데 도움을 줍니다.

한 개발자가 OpenClaw를 위한 고품질 스킬을 만드는 과정을 안내하는 'skills-creator'라는 스킬을 만들었습니다. 이 도구는 모호한 설명이나 문서처럼 읽히는 지침서 같은 개발자들이 스킬을 만들 때 자주 겪는 문제점들을 해결합니다. ClawHub에서 이용 가능하며, 설명 작성 공식, 체크리스트, 복잡도 단계를 포함한 설계 중심 접근 방식을 제공합니다.

OpenClawRadar
고급 클로드 코드 팁 8가지: 비용 절감, 컨텍스트 관리, 사용자 명령어
Tools

고급 클로드 코드 팁 8가지: 비용 절감, 컨텍스트 관리, 사용자 명령어

Claude Code를 일상적으로 많이 사용하면서 얻은 실용적인 팁들로, Git 워크플로 자동화, 멀티모달 이미지 입력, API 사용량 추적, 컨텍스트 압축, 세션 재개, 규칙 관리, 사고 트리거, 사용자 정의 명령어를 다룹니다.

OpenClawRadar