Gemma 4 対 Qwen 3.5 のブラインド評価結果(Claude Opus が審査員)

✍️ OpenClawRadar📅 公開日: April 15, 2026🔗 Source
Gemma 4 対 Qwen 3.5 のブラインド評価結果(Claude Opus が審査員)
Ad

Redditユーザーが、Claude Opus 4.6を採点審査員として使用し、Gemma 4 31B、Gemma 4 26B-A4B、Qwen 3.5 27Bモデルの三者間直接対決評価を実施しました。

評価の設定

テストでは、コード、推論、分析、コミュニケーション、メタアライメントの5カテゴリー(各カテゴリー6問ずつ)から合計30問を使用しました。すべてのモデルは、システムプロンプトの違いや温度設定を同じにし、同じ質問にブラインドで回答しました。Claude Opus 4.6は、構造化された評価基準を用いて、各回答を0〜10点で独立して採点し、ペアごとの比較ではなく回答ごとの絶対評価を行いました。評価は一貫性を優先するため単一の審査員(Opus 4.6)を使用しましたが、これは位置バイアスのリスクを伴います。総費用は4.50ドルでした。

結果

勝利数(質問ごとの最高得点):

  • Qwen 3.5 27B: 14勝 (46.7%)
  • Gemma 4 31B: 12勝 (40.0%)
  • Gemma 4 26B-A4B: 4勝 (13.3%)

平均スコア:

  • Gemma 4 31B: 8.82 (30評価)
  • Gemma 4 26B-A4B: 8.82 (28評価)
  • Qwen 3.5 27B: 8.17 (30評価)

Qwenはより多くの対戦で勝利しましたが、CODE-001、REASON-004、ANALYSIS-017の3問で0.0点を取ったため平均スコアは低くなりました。これらは、本当にひどい回答というより、フォーマットの失敗や回答拒否のように見えました。この3つのスコアを除くと、Qwenの平均は約9.08に跳ね上がり、3モデルの中で最高となります。

Ad

カテゴリー別内訳

  • コード: Gemma 4 31BとQwenが同点(各3勝)
  • 推論: Qwenが圧倒(6問中5勝)
  • 分析: Qwenが圧倒(6問中4勝)
  • コミュニケーション: Gemma 4 31Bが圧倒(6問中5勝)
  • メタアライメント: 三者で分かれた(2-2-2勝)

観察結果

  • Gemma 4 26B-A4B(MoEバリアント)は2問で完全にエラーを起こしました。動作した場合、そのスコアは密モデルの31Bとほぼ同じ8.82平均で一致しました。
  • Gemma 4 31Bは、重い内部連鎖思考が関与していると思われる複数回の5分間生成を含め、いくつかの異常に長い応答時間がありましたが、これはより良いスコアと相関しませんでした。
  • Qwen 3.5 27Bは平均して応答ごとに3〜5倍多くのトークンを生成し、冗長性のペナルティを生み出しましたが、審査員はこれを一貫して罰したり報いたりしているようには見えませんでした。

方法論に関する注意点

  • 30問は小さなサンプルであり、統計的有意性を主張するものではありません
  • 単一の審査員(Opus 4.6)を使用しているため、体系的バイアスがすべてのスコアに影響します
  • LLMを審査員として使用することには、冗長性バイアス、自己選好バイアス、位置バイアスなどの既知の問題があります
  • 質問は標準的なベンチマークからのものではなくオリジナルであり、評価者のバイアスを反映しています

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

LLMの失敗パターンとADHD認知の間にある、研究に裏付けられた6つの類似点
News

LLMの失敗パターンとADHD認知の間にある、研究に裏付けられた6つの類似点

ADHDを持つ開発者が、連想処理、虚偽記憶、作業記憶の制限、パターン補完、構造依存性、スレッド継続性に関する独立した研究に基づき、LLMの失敗パターンとADHDの認知科学との間に6つの類似点を指摘しています。

OpenClawRadar
AIメモ作成に同意しない新規患者を受け入れないメルボルンの精神科医
News

AIメモ作成に同意しない新規患者を受け入れないメルボルンの精神科医

メルボルンの精神科医が新規患者に対し、セッションのAI文字起こしに同意するか、他の医療機関を紹介されるかを求めるようになり、データセキュリティと正確性への懸念が生じている。

OpenClawRadar
親しみやすいAIチャットボット:精度は30%低下、陰謀論を支持する確率は40%上昇
News

親しみやすいAIチャットボット:精度は30%低下、陰謀論を支持する確率は40%上昇

オックスフォード大学の研究者らは、チャットボットの親しみやすさを高めると精度が10~30%低下し、誤った信念への支持が40%増加することを発見した。GPT-4oとLlamaでテスト済み。

OpenClawRadar
AIコーディングエージェントの依存の罠:50人規模のローコードショップが12ヶ月で消滅
News

AIコーディングエージェントの依存の罠:50人規模のローコードショップが12ヶ月で消滅

50人のローコード開発会社が12ヶ月で全クライアントを失った。「ローコード+AI」が純粋なローコードやフルスタックを凌駕したからだ。一方、Claude Maxに依存する個人開発者はセッション制限とコスト上昇に直面する。どちらも同じジレンマを示している:適応するか、依存するか。

OpenClawRadar