JANG 양자화 방법으로 대규모 모델의 MLX 성능 향상

MLX와 GGUF 양자화 간의 성능 격차
이 내용은 대규모 언어 모델에 대한 표준 MLX 양자화 방법의 심각한 성능 문제를 다룹니다. MMLU 벤치마크(200개 질문)에서, MLX용으로 4비트로 양자화된 MiniMax-M2.5는 26.5%(53/200)만 기록한 반면, JANG_2S 방법으로 양자화된 동일 모델은 74%(148/200)를 기록했습니다. JANG 방법은 모두 약 25%의 무작위 확률 수준에 가까운 점수를 기록한 모든 MLX 양자화 수준(2비트, 3비트, 4비트)을 능가했습니다.
세부 벤치마크 결과
상세한 MMLU 주제별 분석은 JANG_2L이 MLX 양자화를 지속적으로 능가함을 보여줍니다:
- 추상대수학: JANG_2L 10/20 vs MLX 4비트 3/20
- 천문학: JANG_2L 20/20 vs MLX 4비트 7/20
- 대학 컴퓨터 과학: JANG_2L 13/20 vs MLX 4비트 4/20
- 고등학교 생물학: JANG_2L 18/20 vs MLX 4비트 4/20
MLX 성능 저하의 근본 원인은 "MLX가 이 모델에서 직접적인 답변 대신 메타 코멘터리를 생성한다"는 점으로 확인되었습니다.
모델 크기 및 성능 비교
Qwen 3.5 122B 모델의 경우:
- JANG_4K: 86% MMLU 점수, 69 GB 크기
- MLX 4비트: 85% MMLU 점수, 64 GB 크기
- JANG_2S: 79% MMLU 점수, 38 GB 크기
- MLX 2비트: 56.5% MMLU 점수, 36 GB 크기
저자는 "사람들은 M 칩의 속도를 일관성과 맞바꾸며, MLX에는 GGUF에 상응하는 것이 없다"고 언급하고, "GGUF를 사용할 때 Mac의 Qwen 3.5는 MLX보다 1/3 느리다"고 덧붙였습니다.
MiniMax-M2.5 코드 생성 문제
인용된 벤치마크에서: "MiniMax-M2.5는 코드를 생성할 수 없습니다 — 87%의 도구 호출 및 80%의 추론 능력에도 불구하고 HumanEval+에서 10%만 기록했습니다. 코드 생성 형식에 문제가 있습니다. 추론에는 뛰어나지만."
가용성 및 구현
현재 다음을 통해 이용 가능합니다:
- MLX Studio: https://mlx.studio/ - JANG_Q 추론 엔진이 내장되어 있음
- 저장소: 자체 설치 및 모델 양자화용
이 방법은 "이전에는 MLX에서 불가능했던 테스트 결과를 얻으면서도 2비트 MLX에 상응하는" MiniMax-M2.5와 같은 모델을 실행할 수 있게 합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

skillcheck: SKILL.md 파일의 크로스 에이전트 호환성 문제를 감지하는 린터
skillcheck는 agentskills.io 사양에 맞춰 SKILL.md 파일을 검증하는 Python 도구로, 기존 검증기에는 없는 설명 품질 점수화, Claude 전용 필드 경고, 파일 참조 검증 등 독특한 기능을 제공합니다.

ESP32 기반 모치 봇과 함께하는 3D 프린팅 클로드 마스코트
한 개발자가 클로드 코드 마스코트에서 영감을 받은 물리적 3D 클로드를 제작했으며, ESP32로 구동되는 모치 봇에 작은 디스플레이가 포함되어 있습니다. 파일과 코드는 MakerWorld와 GitHub에서 확인할 수 있습니다.

제품 관리자가 PM 업무 자동화를 위한 70가지 이상의 Claude 스킬 공유
20년 경력의 제품 관리자가 일반적인 PM 업무를 자동화하는 70개 이상의 Claude 스킬을 만들었습니다. 여기에는 PRD 생성, 사용자 인터뷰 분석, 경쟁사 프로파일링, 로드맵 구축이 포함됩니다. 이 스킬들은 Claude Code용 다운로드 가능한 .md 파일로 제공됩니다.

AI 샌드박스 매니저: 헤드리스 리눅스에서 GPU 패스스루와 컴퓨터 사용이 가능한 LXC 기반 Codex 샌드박스
ai-sandbox-manager는 헤드리스 Linux에서 Codex 에이전트를 위한 오픈소스 LXC 기반 샌드박스입니다. GPU 패스스루, 전체 sudo 액세스, 영구 환경 및 CUA를 통한 컴퓨터 사용을 제공하면서 에이전트를 호스트 OS로부터 격리합니다.