Qwen3.6-27B가 단일 24GB GPU에서 실행, SWE-bench에서 기존 397B MoE 능가

Qwen3.6-27B가 4월 22일에 출시되어, 단일 24GB GPU에 Q4_K_M(~16.8GB)으로 들어맞는 27B 밀집 모델을 선보였으며 SWE-bench Verified에서 77.2점을 기록하여 이전 397B MoE 모델(76.2)을 능가했습니다. 소비자 하드웨어에서 로컬 코딩 에이전트를 실행하는 개발자에게, 이는 유능한 에이전트 모델의 기준을 바꿉니다.
주요 사양 및 아키텍처
- 262K 컨텍스트 길이
- Apache 2.0 라이선스
- Gated DeltaNet 선형 어텐션(4개 서브레이어 중 3개)과 나머지에 Gated Attention 적용
- "Thinking Preservation"이 추론 흔적을 턴 간에 전달하여 중복 토큰 생성을 줄이고 긴 에이전트 세션에서 KV 캐시 효율성을 향상
하드웨어 요구 사항
Q4_K_M에서 모델은 약 16.8GB VRAM을 사용하여 단일 24GB 카드(예: RTX 3090/4090, A10G)에 무리 없이 들어맞습니다. 반면 Qwen3-Coder-Next(80B MoE, 3B 활성)는 동일한 양자화에서 45–80GB가 필요하여 듀얼 GPU 설정이나 48GB 이상 통합 메모리를 갖춘 Apple Silicon으로 제한됩니다.
주의 사항 및 문제점
- CUDA 13.2를 사용하지 마십시오. 잘못된 출력을 생성합니다. CUDA 13.1 또는 12.x를 사용하세요.
- 이미 48GB 이상 하드웨어에서 에이전트 작업을 위해 Coder-Next를 실행 중인 사용자에게는 전환이 명백히 유리하지 않습니다.
- 오래되거나 약한 로컬 코딩 모델에 갇힌 단일 GPU 사용자에게 Qwen3.6-27B는 현재 24GB 계층에서 가장 유능한 옵션입니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

AI 칩 생산이 소비자 PC 부품을 밀어내면서 메인보드 판매 25% 이상 급감
에이수스, 기가바이트, MSI, 에이수스락 모두 2026년 마더보드 출하 목표를 22~37% 삭감. 칩 제조사들이 AI 프로세서 생산에 집중하면서 부품 부족과 가격 인상이 발생하고 있습니다.

Claude Code v2.1.202: 동적 워크플로우 크기, /review 되돌리기, 20개 이상의 수정
/config에서 동적 워크플로우 크기 설정, /review를 단일 패스로 전환, mTLS 핸드셰이크 실패, 음성 받아쓰기 루프, 여러 git 워크트리로 인한 느린 세션 재개 등 다양한 버그 수정.

마이크로소프트, 오픈AI와의 수익 공유 종료... AI 에이전트에 미칠 영향 불확실
블룸버그 보도에 따르면, 마이크로소프트가 주요 AI 파트너인 OpenAI와의 수익 공유를 중단할 예정입니다. 이 움직임은 개발자들이 Azure OpenAI 서비스를 통해 AI 에이전트를 통합하는 방식에 영향을 미칠 수 있습니다.

MLX 추론 성능 업데이트: 2026년 4월 벤치마크 및 기능
MLX 추론 성능이 크게 향상되었으며, Qwen3.5-35B-A3B는 4K 컨텍스트에서 초당 71.8 토큰을 달성했고, Multi-Token Prediction과 SpecPrefill 같은 새로운 기능들은 대형 모델에 대해 2.3배에서 5.5배의 속도 향상을 제공합니다.