ローカル vs クラウドモデル:Qwen-3.6-27B、Gemma-4-31B、Claude Haiku、Codex-Spark のハードコード生成比較

✍️ OpenClawRadar📅 公開日: April 30, 2026🔗 Source
ローカル vs クラウドモデル:Qwen-3.6-27B、Gemma-4-31B、Claude Haiku、Codex-Spark のハードコード生成比較
Ad

あるRedditユーザーが、ローカルで実行したQwen-3.6-27B(GGUF q4_k_m)とAPIでの同等モデル(OpenRouter経由のQwen-3.6-27B、OpenRouter経由のGemma-4-31B、Claude Haiku 4.5、GPT-Codex-Spark)を比較しました。テストでは、設計書からのオートリサーチループの実装という、成功率ではなく失敗の鮮明さを評価するために意図的に難しいタスクが使用されました。

ハードウェア構成

  • CPU: Ryzen 7 7800X3D
  • RAM: 64 GB DDR5-6400
  • GPU: RTX 5080(16 GB VRAM)
  • ローカルモデル: Qwen-3.6-27B q4_k_m(GGUF)—量子化により16 GB VRAMに適合

結果

  • Gemma-4-31B(API): 完全に失敗。モックされたモジュールでスケルトンを作成したが、テストや設定ファイル(__init__.py、requirements.txt、pyproject.toml)はなし。コスト: $0.112、803kコンテキストトークン消費、21k生成。
  • Codex-Spark(API): 美しいフォルダ構造とコードを生成したが、インポートは幻覚。単体テストなし。$100/月のSpark制限の1%を使用。
  • Claude Haiku 4.5(API): 詳細な実装だが、正しさに失敗。(詳細はソースで省略)
  • Qwen-3.6-27B(ローカルq4_k_m): 明示的なスコアはないが、量子化推論はフル精度API版と比べて品質が低下するとユーザーは指摘。

コンテキスト

ユーザーは、典型的なローカルモデル評価では、ローカルモデルも最先端モデルも成功する簡単なタスク(例:HTMLでスネークゲーム)が使われ、そのためローカルモデルが実際よりも優れているように見えると主張。このテストでは設計書付きの実際のプロジェクトを使用し、完全に書かれた(ただし壊れた)コードを生成したのはCodex-Sparkだけだった。ポイントは、ローカルモデルは大幅な修正なしでは複雑なコード生成にはまだ対応していないということ。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

ローカルQwen3.6 27b + HermesエージェントがジュニアIT管理者タスクを処理
News

ローカルQwen3.6 27b + HermesエージェントがジュニアIT管理者タスクを処理

30年のIT経験者が報告。Qwen3.6 27bをHermes Agentで動かしたところ、パッチ適用、Dockerインストール、サービス設定など、ジュニアIT管理者向けのタスクリストを1.5時間で完了した。

OpenClawRadar
Gemma 4 早期シグナル:ローカルエージェントワークフローには、誇大広告よりも導入実用性を重視
News

Gemma 4 早期シグナル:ローカルエージェントワークフローには、誇大広告よりも導入実用性を重視

Gemma 4のローンチは、パーソナルハードウェアとエッジ/モバイル向けの公式ポジショニングによるハードウェア階層全体での展開を重視しており、NVIDIAのNVFP4量子化はGPQAで99.7%のベースライン保持率を維持した4倍の圧縮を示し、Arenaランキングでは31B高密度モデルが約27位に位置しています。

OpenClawRadar
Claude Code v2.1.212: /fork機能がバックグラウンドセッションコピーに+暴走ループガード
News

Claude Code v2.1.212: /fork機能がバックグラウンドセッションコピーに+暴走ループガード

Claude Code v2.1.212 では、/fork が会話を新しいバックグラウンドセッションにコピーするように変更され、WebSearch とサブエージェントの生成にセッションごとの制限(デフォルト200)が追加され、MCP 呼び出しが2分後に自動的にバックグラウンド化されるようになりました。

OpenClawRadar
41万3000回のAIエージェント実行分析から、成功の要因が明らかに
News

41万3000回のAIエージェント実行分析から、成功の要因が明らかに

CoderForge-Previewデータセットの413,278回のAIソフトウェアエンジニアリングエージェント実行の分析によると、人間のソフトウェアエンジニアリングのベストプラクティスは、しばしばエージェントのパフォーマンスを損なうことが示されています。データは、同じ問題に対する成功実行と失敗実行を分ける特定のパターンを明らかにしています。

OpenClawRadar