Qwen3.6-27B가 단일 24GB GPU에서 실행, SWE-bench에서 기존 397B MoE 능가

Qwen3.6-27B가 4월 22일에 출시되어, 단일 24GB GPU에 Q4_K_M(~16.8GB)으로 들어맞는 27B 밀집 모델을 선보였으며 SWE-bench Verified에서 77.2점을 기록하여 이전 397B MoE 모델(76.2)을 능가했습니다. 소비자 하드웨어에서 로컬 코딩 에이전트를 실행하는 개발자에게, 이는 유능한 에이전트 모델의 기준을 바꿉니다.
주요 사양 및 아키텍처
- 262K 컨텍스트 길이
- Apache 2.0 라이선스
- Gated DeltaNet 선형 어텐션(4개 서브레이어 중 3개)과 나머지에 Gated Attention 적용
- "Thinking Preservation"이 추론 흔적을 턴 간에 전달하여 중복 토큰 생성을 줄이고 긴 에이전트 세션에서 KV 캐시 효율성을 향상
하드웨어 요구 사항
Q4_K_M에서 모델은 약 16.8GB VRAM을 사용하여 단일 24GB 카드(예: RTX 3090/4090, A10G)에 무리 없이 들어맞습니다. 반면 Qwen3-Coder-Next(80B MoE, 3B 활성)는 동일한 양자화에서 45–80GB가 필요하여 듀얼 GPU 설정이나 48GB 이상 통합 메모리를 갖춘 Apple Silicon으로 제한됩니다.
주의 사항 및 문제점
- CUDA 13.2를 사용하지 마십시오. 잘못된 출력을 생성합니다. CUDA 13.1 또는 12.x를 사용하세요.
- 이미 48GB 이상 하드웨어에서 에이전트 작업을 위해 Coder-Next를 실행 중인 사용자에게는 전환이 명백히 유리하지 않습니다.
- 오래되거나 약한 로컬 코딩 모델에 갇힌 단일 GPU 사용자에게 Qwen3.6-27B는 현재 24GB 계층에서 가장 유능한 옵션입니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

개발자의 딜레마: 국가 안보 우려로 인한 오픈 모델 선택의 제한
보안에 민감한 고객들과 일하는 개발자가 보고한 바에 따르면, gpt-oss-120b와 같은 구식 미국 오픈 모델과 GLM, MiniMax 같은 더 강력한 중국 모델 사이에서 선택을 강요받고 있으며, 고객들은 후자를 국가 안보 위험으로 거부한다고 합니다.

알리바바, 기업 자동화를 위한 'Wukong' AI 플랫폼 출시
알리바바가 문서 편집, 스프레드시트 업데이트, 회의 녹취록 작성, 연구 등 복잡한 비즈니스 업무를 처리하기 위해 여러 에이전트를 조율하는 AI 플랫폼 'Wukong'을 출시했습니다. 현재 초대 전용 베타 테스트 중입니다.
엔비디아의 5000억 달러 규모 월스트리트 AI 인프라 패키지: 그 의미
엔비디아가 AI 인프라에 5000억 달러 규모의 자금 조달 패키지를 위해 여러 금융 회사와 협력하고 있습니다. 이 거래는 순환 자금 조달과 수요가 따르지 않을 경우 누가 위험을 부담하는지에 대한 의문을 제기합니다.

CBP의 클리어뷰 AI 계약: 전술적 표적 식별을 위한 얼굴 인식
미국 세관 및 국경 보호국은 전술적 표적 지정을 위해 클리어뷰 AI와 계약을 체결하여, 인터넷에서 수집된 수십억 장의 이미지에 대한 얼굴 인식 기술을 사용합니다.