Qwen 3.6 27B 양자화 벤치마크: 실용적 트레이드오프에서 Q4_K_M이 Q8_0을 앞서다

✍️ OpenClawRadar📅 게시일: April 28, 2026🔗 Source
Qwen 3.6 27B 양자화 벤치마크: 실용적 트레이드오프에서 Q4_K_M이 Q8_0을 앞서다
Ad

Reddit 사용자가 Neo AI Engineer 프레임워크를 통해 llama-cpp-python을 사용하여 세 가지 GGUF 양자화 변형(BF16, Q4_K_M, Q8_0)에서 Qwen 3.6 27B를 벤치마킹했습니다. 평가는 세 가지 작업에 걸쳐 총 664개의 샘플을 대상으로 진행되었습니다: HumanEval(코드 생성, 164개 샘플), HellaSwag(상식 추론, 100개 샘플), BFCL(함수 호출, 400개 샘플).

벤치마크 결과

  • BF16 (모델 크기 53.8 GB, 최대 RAM 54 GB, 처리량 15.5 tok/s): HumanEval 56.10% (92/164), HellaSwag 90.00% (90/100), BFCL 63.25% (253/400). 평균 정확도: 69.78%.
  • Q4_K_M (16.8 GB, 28 GB RAM, 22.5 tok/s): HumanEval 50.61% (83/164), HellaSwag 86.00% (86/100), BFCL 63.00% (252/400). 평균: 66.54%.
  • Q8_0 (28.6 GB, 42 GB RAM, 18.0 tok/s): HumanEval 52.44% (86/164), HellaSwag 83.00% (83/100), BFCL 63.00% (252/400). 평균: 66.15%.
Ad

주요 시사점

Q4_K_M은 실용적으로 가장 뛰어난 변형입니다. BFCL 정확도를 유지하고(63.00% 대 63.25%), HumanEval에서 약 5.5포인트만 하락하며, HellaSwag에서는 BF16보다 약 4포인트 낮습니다. 트레이드오프: BF16보다 1.45배 빠름, 최대 RAM 48% 감소, 파일 크기 68.8% 감소, 거의 동일한 함수 호출 성능. Q8_0은 실망스러웠습니다: HumanEval에서 Q4_K_M보다 약 1.8포인트만 개선되었지만 42 GB RAM(28 GB 대비)을 사용하고 더 느렸으며 HellaSwag에서 더 낮은 점수를 기록했습니다.

로컬/CPU 배포의 경우, 작업 부하가 주로 코드 생성에 집중되지 않는다면 Q4_K_M을 권장합니다. 최고 품질을 위해서는 BF16이 여전히 우수합니다.

평가 설정

llama-cpp-python을 통한 GGUF 변형, n_ctx: 32768, 체크포인트 평가 사용. Neo AI Engineer 프레임워크가 GGUF 평가 파이프라인을 구축하고, 체크포인트 실행을 처리했으며, 결과를 통합했습니다. 전체 사례 연구 및 코드 조각은 원본 Reddit 댓글에 링크되어 있습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

클로드의 코드 대시보드, GitHub에서 1900만 개 이상의 AI 생성 커밋 추적
Tools

클로드의 코드 대시보드, GitHub에서 1900만 개 이상의 AI 생성 커밋 추적

한 개발자가 GitHub 공개 저장소에서 Claude Code가 생성한 1,900만 개 이상의 커밋을 추적하는 대시보드를 구축했으며, TypeScript(35.3%), Python(19.2%), JavaScript(10.3%)가 가장 많이 사용된 언어로 나타났습니다. 이 시스템은 Next.js, Recharts, PostgreSQL을 사용하며, GitHub API의 요청 제한을 우회하는 ETL 파이프라인을 갖추고 있습니다.

OpenClawRadar
Adeu v1.4: DOCX 변경 추적을 위한 오픈소스 MCP
Tools

Adeu v1.4: DOCX 변경 추적을 위한 오픈소스 MCP

Adeu v1.4는 네이티브 OOXML 교정 내용을 DOCX 파일에 정밀하게 주입하여 서식, 번호 매기기 및 레이아웃을 보존합니다. 각주/미주 인라인 편집, 정의된 용어 린팅, 상호 참조 맵, 다단계 목록 왕복 편집이 추가되었습니다.

OpenClawRadar
클로드 코드 아키텍처 분석: 유출된 소스 맵에서
Tools

클로드 코드 아키텍처 분석: 유출된 소스 맵에서

Claude Code의 512,000줄에 달하는 TypeScript 코드베이스 분석 결과, Bun 기반 런타임에 React/Ink CLI, 100개 이상의 명령어, 38개 이상의 도구, 그리고 다중 에이전트 조정 기능이 포함된 것으로 나타났습니다. 이 시스템은 Zod를 검증에, OpenTelemetry를 원격 측정에 사용하며, 컨텍스트 압축 메커니즘을 포함하고 있습니다.

OpenClawRadar
🦀
Tools

허깅페이스의 물리학 인턴: 멀티 에이전트 프레임워크, CritPt 벤치마크에서 제미니 대비 2배 성능

Hugging Face가 physics-intern을 출시했습니다. 이론 물리학 연구를 위한 다중 에이전트 프레임워크로, CritPt 벤치마크에서 Gemini 모델의 성능을 두 배로 향상시키고 GPT-5.5 Pro를 능가하는 새로운 SOTA를 더 낮은 비용으로 달성했습니다.

OpenClawRadar