Qwen3.6-27Bが単一の24GB GPUに収まり、SWE-benchで以前の397B MoEを上回る性能を達成

Qwen3.6-27Bが4月22日にリリースされました。これは27Bの高密度モデルで、Q4_K_M(約16.8GB)で1つの24GB GPUに収まり、SWE-bench Verifiedで77.2のスコアを記録し、以前の397B MoEモデル(76.2)を上回っています。コンシューマーハードウェアでローカルコーディングエージェントを実行する開発者にとって、これは有能なエージェントモデルの敷居を変えるものです。
主な仕様とアーキテクチャ
- 262Kコンテキスト長
- Apache 2.0ライセンス
- Gated DeltaNet線形注意機構(4つのサブレイヤーのうち3つ)と残りにGated Attention
- Thinking Preservationにより、ターン間で推論トレースを引き継ぎ、冗長なトークン生成を削減し、長いエージェントセッションでのKVキャッシュ効率を向上
ハードウェア要件
Q4_K_Mでは、モデルは約16.8GBのVRAMを使用し、1枚の24GBカード(例:RTX 3090/4090、A10G)に快適に収まります。対照的に、Qwen3-Coder-Next(80B MoE、3Bアクティブ)では、同じ量子化で45〜80GB必要であり、デュアルGPUセットアップまたは48GB以上のユニファイドメモリを搭載したApple Siliconに制限されます。
注意点と落とし穴
- CUDA 13.2は使用しないでください。出力がガタガタになります。CUDA 13.1または12.xを使用してください。
- すでに48GB以上のハードウェアでエージェントタスク用にCoder-Nextを実行しているユーザーにとって、切り替えは明らかに有益ではありません。
- 古いまたは性能の低いローカルコーディングモデルで行き詰まっているシングルGPUユーザーにとって、Qwen3.6-27Bは現在、24GBクラスで最も有能なオプションです。
📖 出典全文: r/LocalLLaMA
👀 See Also

AIは高すぎる:ハイパースケーラーが損益分岐点に達するには3兆ドルが必要
ハイパースケーラーはAIに8000億ドル以上の資本的支出を行い、2027年までにさらに1兆ドルを計画している。マイクロソフトだけでもOpenAIのインフラに約1000億ドルを費やしたが、AI収益は資本的支出の約20%しかカバーしていない。

GitHub Copilot経由でのClaudeの使用とVS Code拡張機能としての使用の違い
GitHub CopilotのターゲットセッションとVS Code拡張機能としてのClaude AIの使用法の違いを、統合方法と機能性に基づいて探ります。

Bonsai 1.7B 三元モデル、M4 Max上で自律調整されたMetalカーネルにより442 T/sを達成
自律エージェントataがBonsai 1.7B Q2_0向けにMetalカーネルを最適化し、M4 Max上で未変更のllama.cppと比較してデコード442 t/s(+42%)、プリフィル4622 t/s(+9%)を達成しました。

Claude Code Opusが利用可能な週間容量があるにもかかわらず、レート制限エラーで失敗する
Claude Maxの購読者が、週間の「全モデル」使用容量の97%が未使用であるにもかかわらず、Claude Code Opusが「APIエラー: レート制限に達しました」を返すと報告しています。この問題はClaude Codeで特に発生し、同じアカウントのclaude.aiではOpusが正常に動作します。