벤치마크: M5 Max MacBook Pro에서 Qwen3-Coder-Next 8비트 실행 시 MLX 대 Ollama

애플 실리콘에서 8비트 양자화된 동일한 Qwen3-Coder-Next 모델을 실행하는 두 개의 로컬 추론 백엔드—MLX(애플의 네이티브 ML 프레임워크)와 Ollama(llama.cpp 기반)—를 비교하는 벤치마크가 수행되었습니다. 목표는 실제 프로그래밍 작업에서 원시 처리량(초당 토큰 수), 첫 번째 토큰까지의 시간(TTFT), 그리고 전반적인 코딩 능력을 측정하는 것이었습니다.
방법론
설정은 다음과 같았습니다:
- MLX 백엔드: mlx-lm v0.29.1이 내장된 OpenAI 호환 HTTP 서버(포트 8080)를 통해 mlx-community/Qwen3-Coder-Next-8bit를 제공합니다.
- Ollama 백엔드: Ollama가 OpenAI 호환 API(포트 11434)를 통해 qwen3-coder-next:Q8_0를 제공합니다.
두 백엔드는 모두 스트리밍이 활성화된 OpenAI 클라이언트 라이브러리를 사용하는 동일한 Python 벤치마크 하니스를 통해 접근되었습니다. 각 테스트는 프롬프트당 3회 반복 실행되었으며, 결과는 평균화되었고 초기 콜드 스타트 프롬프트(모델 로드)에 대한 첫 번째 반복의 TTFT는 제외되었습니다.
테스트 스위트
여섯 개의 프롬프트가 다양한 코딩 작업을 다루었습니다:
- 짧은 완성: 회문 검사 함수 작성(최대 150 토큰)
- 중간 생성: 타입 힌트가 포함된 LRU 캐시 클래스 구현(최대 500 토큰)
- 긴 추론: 예제와 함께 async/await 대 스레딩 설명(최대 1000 토큰)
- 디버그 작업: 병합 정렬 및 이진 검색에서 버그 찾기 및 수정(최대 800 토큰)
- 복잡한 코딩: 컨텍스트 관리자가 있는 스레드 안전 경계 블로킹 큐(최대 1000 토큰)
- 코드 리뷰: 성능/정확성/스타일에 대해 3개의 함수 검토(최대 1000 토큰)
결과
128GB RAM이 탑재된 M5 Max에서의 처리량(초당 토큰 수):
- 짧은 완성: Ollama 32.51 토큰/초, MLX 69.62 토큰/초 (MLX +114%)
- 중간 생성: Ollama 35.97 토큰/초, MLX 78.28 토큰/초 (MLX +118%)
- 긴 추론: Ollama 40.45 토큰/초, MLX 78.29 토큰/초 (MLX +94%)
- 디버그 작업: Ollama 37.06 토큰/초, MLX 74.89 토큰/초 (MLX +102%)
- 복잡한 코딩: Ollama 35.84 토큰/초, MLX 76.99 토큰/초 (MLX +115%)
- 코드 리뷰: Ollama 39.00 토큰/초, MLX 74.98 토큰/초 (MLX +92%)
전체 평균: MLX는 약 초당 72 토큰을 달성하여 Ollama의 처리량을 약 2배로 능가했습니다. 측정된 지표에는 토큰/초(초당 생성된 출력 토큰, 높을수록 좋음), TTFT(요청 전송부터 첫 번째 토큰 수신까지의 시간, 낮을수록 좋음), 총 시간(전체 응답에 대한 실제 시간, 낮을수록 좋음), 그리고 psutil을 통해 측정된 메모리 사용량이 포함되었습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

비공식 Ultrahuman 링 MCP 서버 - AI 에이전트 통합용
커뮤니티에서 개발한 MCP 서버가 Ultrahuman Partner API를 래핑하여 AI 코딩 에이전트가 수면, HRV, 혈당, 회복 점수와 같은 링 및 CGM 지표를 구조화된 데이터 호출을 통해 직접 접근할 수 있도록 합니다.

코리 헤인스의 AI 에이전트를 위한 마케팅 스킬 세트
OpenClaw에 AI 에이전트를 위한 25가지 마케팅 스킬 세트가 추가되었습니다. 이 세트는 전환 최적화, 카피라이팅, 분석, 성장 엔지니어링을 다루고 있습니다. 특히 전환 최적화 스킬은 다중 에이전트 설정에서 매우 효과적인 것으로 알려져 있습니다.

매니페스트 라우터, 오픈클로 모델 관리를 위한 ZAI 구독 지원 추가
Manifest 라우터가 이제 ZAI 구독을 지원하여 모든 ZAI 모델이 라우팅 계층에 표시되고 요청별로 자동 모델 선택이 가능해졌습니다. 이 도구는 베타 버전으로 무료, 오픈 소스이며 에이전트, 메시지, 모델별 비용을 추적할 수 있는 대시보드를 포함합니다.

아고라젠틱: 기능을 사고 팔 수 있는 pip로 설치 가능한 에이전트 마켓플레이스
아고라젠틱은 AI 에이전트가 다른 에이전트의 기능을 발견하고 호출할 수 있는 에이전트 간 마켓플레이스입니다. 이 마켓플레이스는 Base L2의 USDC를 결제 수단으로 사용하며 3%의 플랫폼 수수료가 적용되고 무료 테스트 크레딧을 제공합니다.