DeepSWEベンチマークにおけるQwen 3.6 27Bの性能:スコア2%、処理時間70時間、平均出力トークン数44k

✍️ OpenClawRadar📅 公開日: June 22, 2026🔗 Source
DeepSWEベンチマークにおけるQwen 3.6 27Bの性能:スコア2%、処理時間70時間、平均出力トークン数44k
Ad

RedditユーザーがQwen 3.6 27BをDeepSWEベンチマークで評価し、2%(切り上げ1.79%)のスコアを記録。20モデル中18位で、Haiku 4.5やMinimax M2.7を上回りました。全実行は70時間、タスク平均時間32分、タスクあたり平均出力トークン数44kで、これは大規模モデルであるQwen 3.6 Plusと驚くほど同等であり、27Bモデルの冗長性が知られているにもかかわらずです。

方法論

  • モデル: Qwen 3.6 27B FP8(BF16 KVキャッシュ、推論有効、262kコンテキストウィンドウ、VLLM経由)
  • ハードウェア: RunPod上の1x RTX6000 Pro Blackwell
  • エージェントハーネス: Modalサンドボックス上のmini-swe
  • タスクあたり1ロールアウト(公式の4ロールアウトの代わりに時間節約のため); スコア範囲なし
  • コストはRunPodの時間単価から計算(完了タスク対象)
  • オーケストレーション: Codex 5.5xhighが全実行を監視・管理

主な観察

著者は、スコアがQwen 3.6 Plusと不気味なほど近いことに言及し、アーキテクチャの違いについて疑問を呈しています。ローカルモデルは最先端のクローズドソースモデルにますます遅れを取っていると論じています。K2.6は最高のオープンソースモデルですが、ほとんどの人はローカルで実行できません。Qwen 3.6 27Bは「貧乏人のSOTA」ローカルオプションとして位置づけられています。この傾向は、最先端のパフォーマンスには大規模が必要であり、それがクローズドソースにつながることが多く、ローカル推論は競争力の面で負け戦であることを示唆しています。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

🦀
News

Claude Code v2.1.259:管理型MCP服务器、无头权限模式及并发修复

Claude Code v2.1.259は、組織向けの管理MCPサーバーの展開、無人ホスト向けの`--permission-prompts none`フラグを追加し、並行セッションでの静かな状態破損を修正しました。

OpenClawRadar
ブリタニカ百科事典、AI学習データを巡りOpenAIを提訴
News

ブリタニカ百科事典、AI学習データを巡りOpenAIを提訴

ブリタニカ百科事典は、AI学習データに関連する著作権侵害を主張してOpenAIを提訴しました。この訴訟は2026年3月16日にロイターによって報道され、Hacker Newsで議論を呼んでいます。

OpenClawRadar
Claude AIがQGISワークフローで「Sketcher」用語の反復バグを示す
News

Claude AIがQGISワークフローで「Sketcher」用語の反復バグを示す

ユーザーが報告したところによると、Claude AIはDXFファイルの位置合わせに関するQGISのガイダンスを提供する際に「sketcher」という単語を繰り返し出力しており、特定の用語に対するモデルの潜在的なバグを示唆しています。ソースには、座標系の位置合わせに関する実践的なQGISワークフローの詳細が含まれています。

OpenClawRadar
🦀
News

AIの生産性向上がエネルギー・経済モデルにおいて純CO₂排出量の増加を牽引

新しい研究では、AIをグローバルなエネルギー経済モデルにおける双方向の生産性増幅器としてモデル化し、化石燃料の生産性向上による排出量の増加が、再生可能エネルギーの改善による回避排出量を上回ることを発見した。再生可能エネルギーの利得が化石燃料の4〜5倍以上でない限り、純排出量は増加する。

OpenClawRadar