Qwen3.6-27B가 단일 24GB GPU에서 실행, SWE-bench에서 기존 397B MoE 능가

✍️ OpenClawRadar📅 게시일: April 29, 2026🔗 Source
Qwen3.6-27B가 단일 24GB GPU에서 실행, SWE-bench에서 기존 397B MoE 능가
Ad

Qwen3.6-27B가 4월 22일에 출시되어, 단일 24GB GPU에 Q4_K_M(~16.8GB)으로 들어맞는 27B 밀집 모델을 선보였으며 SWE-bench Verified에서 77.2점을 기록하여 이전 397B MoE 모델(76.2)을 능가했습니다. 소비자 하드웨어에서 로컬 코딩 에이전트를 실행하는 개발자에게, 이는 유능한 에이전트 모델의 기준을 바꿉니다.

주요 사양 및 아키텍처

  • 262K 컨텍스트 길이
  • Apache 2.0 라이선스
  • Gated DeltaNet 선형 어텐션(4개 서브레이어 중 3개)과 나머지에 Gated Attention 적용
  • "Thinking Preservation"이 추론 흔적을 턴 간에 전달하여 중복 토큰 생성을 줄이고 긴 에이전트 세션에서 KV 캐시 효율성을 향상

하드웨어 요구 사항

Q4_K_M에서 모델은 약 16.8GB VRAM을 사용하여 단일 24GB 카드(예: RTX 3090/4090, A10G)에 무리 없이 들어맞습니다. 반면 Qwen3-Coder-Next(80B MoE, 3B 활성)는 동일한 양자화에서 45–80GB가 필요하여 듀얼 GPU 설정이나 48GB 이상 통합 메모리를 갖춘 Apple Silicon으로 제한됩니다.

주의 사항 및 문제점

  • CUDA 13.2를 사용하지 마십시오. 잘못된 출력을 생성합니다. CUDA 13.1 또는 12.x를 사용하세요.
  • 이미 48GB 이상 하드웨어에서 에이전트 작업을 위해 Coder-Next를 실행 중인 사용자에게는 전환이 명백히 유리하지 않습니다.
  • 오래되거나 약한 로컬 코딩 모델에 갇힌 단일 GPU 사용자에게 Qwen3.6-27B는 현재 24GB 계층에서 가장 유능한 옵션입니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

AI 칩 생산이 소비자 PC 부품을 밀어내면서 메인보드 판매 25% 이상 급감
News

AI 칩 생산이 소비자 PC 부품을 밀어내면서 메인보드 판매 25% 이상 급감

에이수스, 기가바이트, MSI, 에이수스락 모두 2026년 마더보드 출하 목표를 22~37% 삭감. 칩 제조사들이 AI 프로세서 생산에 집중하면서 부품 부족과 가격 인상이 발생하고 있습니다.

OpenClawRadar
Claude Code v2.1.202: 동적 워크플로우 크기, /review 되돌리기, 20개 이상의 수정
News

Claude Code v2.1.202: 동적 워크플로우 크기, /review 되돌리기, 20개 이상의 수정

/config에서 동적 워크플로우 크기 설정, /review를 단일 패스로 전환, mTLS 핸드셰이크 실패, 음성 받아쓰기 루프, 여러 git 워크트리로 인한 느린 세션 재개 등 다양한 버그 수정.

OpenClawRadar
마이크로소프트, 오픈AI와의 수익 공유 종료... AI 에이전트에 미칠 영향 불확실
News

마이크로소프트, 오픈AI와의 수익 공유 종료... AI 에이전트에 미칠 영향 불확실

블룸버그 보도에 따르면, 마이크로소프트가 주요 AI 파트너인 OpenAI와의 수익 공유를 중단할 예정입니다. 이 움직임은 개발자들이 Azure OpenAI 서비스를 통해 AI 에이전트를 통합하는 방식에 영향을 미칠 수 있습니다.

OpenClawRadar
MLX 추론 성능 업데이트: 2026년 4월 벤치마크 및 기능
News

MLX 추론 성능 업데이트: 2026년 4월 벤치마크 및 기능

MLX 추론 성능이 크게 향상되었으며, Qwen3.5-35B-A3B는 4K 컨텍스트에서 초당 71.8 토큰을 달성했고, Multi-Token Prediction과 SpecPrefill 같은 새로운 기능들은 대형 모델에 대해 2.3배에서 5.5배의 속도 향상을 제공합니다.

OpenClawRadar