JANG 양자화 방법으로 대규모 모델의 MLX 성능 향상

MLX와 GGUF 양자화 간의 성능 격차
이 내용은 대규모 언어 모델에 대한 표준 MLX 양자화 방법의 심각한 성능 문제를 다룹니다. MMLU 벤치마크(200개 질문)에서, MLX용으로 4비트로 양자화된 MiniMax-M2.5는 26.5%(53/200)만 기록한 반면, JANG_2S 방법으로 양자화된 동일 모델은 74%(148/200)를 기록했습니다. JANG 방법은 모두 약 25%의 무작위 확률 수준에 가까운 점수를 기록한 모든 MLX 양자화 수준(2비트, 3비트, 4비트)을 능가했습니다.
세부 벤치마크 결과
상세한 MMLU 주제별 분석은 JANG_2L이 MLX 양자화를 지속적으로 능가함을 보여줍니다:
- 추상대수학: JANG_2L 10/20 vs MLX 4비트 3/20
- 천문학: JANG_2L 20/20 vs MLX 4비트 7/20
- 대학 컴퓨터 과학: JANG_2L 13/20 vs MLX 4비트 4/20
- 고등학교 생물학: JANG_2L 18/20 vs MLX 4비트 4/20
MLX 성능 저하의 근본 원인은 "MLX가 이 모델에서 직접적인 답변 대신 메타 코멘터리를 생성한다"는 점으로 확인되었습니다.
모델 크기 및 성능 비교
Qwen 3.5 122B 모델의 경우:
- JANG_4K: 86% MMLU 점수, 69 GB 크기
- MLX 4비트: 85% MMLU 점수, 64 GB 크기
- JANG_2S: 79% MMLU 점수, 38 GB 크기
- MLX 2비트: 56.5% MMLU 점수, 36 GB 크기
저자는 "사람들은 M 칩의 속도를 일관성과 맞바꾸며, MLX에는 GGUF에 상응하는 것이 없다"고 언급하고, "GGUF를 사용할 때 Mac의 Qwen 3.5는 MLX보다 1/3 느리다"고 덧붙였습니다.
MiniMax-M2.5 코드 생성 문제
인용된 벤치마크에서: "MiniMax-M2.5는 코드를 생성할 수 없습니다 — 87%의 도구 호출 및 80%의 추론 능력에도 불구하고 HumanEval+에서 10%만 기록했습니다. 코드 생성 형식에 문제가 있습니다. 추론에는 뛰어나지만."
가용성 및 구현
현재 다음을 통해 이용 가능합니다:
- MLX Studio: https://mlx.studio/ - JANG_Q 추론 엔진이 내장되어 있음
- 저장소: 자체 설치 및 모델 양자화용
이 방법은 "이전에는 MLX에서 불가능했던 테스트 결과를 얻으면서도 2비트 MLX에 상응하는" MiniMax-M2.5와 같은 모델을 실행할 수 있게 합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Tendril: 즉석에서 도구를 구축하고 등록하는 자체 확장 에이전트
Tendril은 자율적으로 도구를 발견, 구축 및 등록하는 에이전틱 샌드박스입니다. 단 세 개의 부트스트랩 도구로 시작하여 사용자에게 묻지 않고 동적으로 기능 레지스트리를 확장합니다.

ClearSpec: Claude 코드의 환각 현상을 줄이기 위한 사양 생성기
ClearSpec은 일반 영어 설명에서 구조화된 명세서를 생성하는 도구로, GitHub 저장소에 연결하여 실제 파일 경로와 의존성을 참조한 다음, Claude Code에 더 나은 컨텍스트를 제공하기 위해 해당 명세서를 프롬프트로 사용합니다.

Claude 4.6 Opus 추론 기능이 MLX 양자화를 통해 Apple Silicon용으로 14GB로 경량화되었습니다.
한 개발자가 Claude 4.6 Opus의 추론 궤적에서 증류된 Qwen 3.5 27B 모델을 MLX를 사용해 Apple Silicon용으로 양자화하여 55.6GB에서 14GB로 줄였으며, M4 Pro에서 약 16 토큰/초의 속도를 유지하면서 모델의 분석적 추론 능력을 보존했습니다.

OpenClaw의 기본 마크다운 메모리를 뜯어내고 Node.js/Postgres API 레이어로 대체했습니다
한 개발자가 OpenClaw의 기본 메모리 코어 플러그인을 비활성화하고 타입 기반 Node.js/Express + PostgreSQL 백엔드를 구축했습니다. 컨텍스트 드리프트가 0으로 감소했습니다.