Qwen3.6 Plusと欧米のSOTAモデルとのベンチマーク比較

r/LocalLLaMAのReddit投稿では、Qwen3.6 Plusを複数のベンチマークでいくつかの西洋の最先端モデルと比較しています。この比較には、各モデルの具体的なパフォーマンス指標が含まれています。
ベンチマーク結果
ソースでは以下の正確なスコアが提供されています:
- Qwen3.6-Plus: SWE-bench Verified 78.8、GPQA / GPQA Diamond 90.4、HLE(ツールなし)28.8、MMMU-Pro 78.8
- GPT‑5.4 (xhigh): SWE-bench Verified 78.2、GPQA / GPQA Diamond 93.0、HLE(ツールなし)39.8、MMMU-Pro 81.2
- Claude Opus 4.6 (thinking heavy): SWE-bench Verified 80.8、GPQA / GPQA Diamond 91.3、HLE(ツールなし)34.44、MMMU-Pro 77.3
- Gemini 3.1 Pro Preview: SWE-bench Verified 80.6、GPQA / GPQA Diamond 94.3、HLE(ツールなし)44.7、MMMU-Pro 80.5
投稿には、以下のURLで視覚的な比較チャートが利用可能です:https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface
ユーザー評価
投稿者は、Qwen3.6 Plusは「競争力はあるがトップではない」と指摘し、「その安さから私の新しいモデルになるだろうが、実際に良いかどうかはベンチマーク以上に依存する」と述べています。また、「Opusはartificalanalysisでは3位か4位にもかかわらず、他のすべてを圧倒している」とも観察しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

なぜ弁護士がAIが幻覚を見た事例を引用し続けるのか:開発者の視点
AIが作り出した架空の法的先例を引用した裁判例が1,400件以上。弁護士は制裁を受けても幻覚を信頼し続ける。自動化バイアスが専門的判断を損なう仕組み。

OpenClaw 0.9 CLIの削除によるエージェントの機能停止
ユーザーから報告されたところによると、AIエージェントを通じてOpenClawを更新しようとした結果、CLIが削除され、ゲートウェイコマンドとTelegramチャット機能が破損しました。OpenClaw 0.9ではCLIが完全に廃止され、'openclaw gateway start'や'openclaw status'などのコマンドが削除されました。

開発者のジレンマ:Claudeスキルにクリエイター向けビジネスモデルがない
Redditの投稿で、Claudeスキルクリエイターが作品を収益化できない問題が指摘されています。Anthropicは優れたランタイムを提供したものの、クリエイターエコノミーの仕組みを実装していません。ビルダーは週末を費やしてツールを作っても、将来のリリースに吸収されるリスクがあります。

ハリウッド脚本家がAIトレーニングへ転身:データアノテーション作業の一人称レポート
ハリウッドのショーランナーが、2023年のストライキ後に時給52ドルでAIトレーニングの仕事に転身した体験を綴る。会話、画像、動画に注釈を付け、MercorやOutlierといった企業と協業している。