ローカル vs クラウドモデル:Qwen-3.6-27B、Gemma-4-31B、Claude Haiku、Codex-Spark のハードコード生成比較

あるRedditユーザーが、ローカルで実行したQwen-3.6-27B(GGUF q4_k_m)とAPIでの同等モデル(OpenRouter経由のQwen-3.6-27B、OpenRouter経由のGemma-4-31B、Claude Haiku 4.5、GPT-Codex-Spark)を比較しました。テストでは、設計書からのオートリサーチループの実装という、成功率ではなく失敗の鮮明さを評価するために意図的に難しいタスクが使用されました。
ハードウェア構成
- CPU: Ryzen 7 7800X3D
- RAM: 64 GB DDR5-6400
- GPU: RTX 5080(16 GB VRAM)
- ローカルモデル: Qwen-3.6-27B q4_k_m(GGUF)—量子化により16 GB VRAMに適合
結果
- Gemma-4-31B(API): 完全に失敗。モックされたモジュールでスケルトンを作成したが、テストや設定ファイル(
__init__.py、requirements.txt、pyproject.toml)はなし。コスト: $0.112、803kコンテキストトークン消費、21k生成。 - Codex-Spark(API): 美しいフォルダ構造とコードを生成したが、インポートは幻覚。単体テストなし。$100/月のSpark制限の1%を使用。
- Claude Haiku 4.5(API): 詳細な実装だが、正しさに失敗。(詳細はソースで省略)
- Qwen-3.6-27B(ローカルq4_k_m): 明示的なスコアはないが、量子化推論はフル精度API版と比べて品質が低下するとユーザーは指摘。
コンテキスト
ユーザーは、典型的なローカルモデル評価では、ローカルモデルも最先端モデルも成功する簡単なタスク(例:HTMLでスネークゲーム)が使われ、そのためローカルモデルが実際よりも優れているように見えると主張。このテストでは設計書付きの実際のプロジェクトを使用し、完全に書かれた(ただし壊れた)コードを生成したのはCodex-Sparkだけだった。ポイントは、ローカルモデルは大幅な修正なしでは複雑なコード生成にはまだ対応していないということ。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude AIは、企業向けカスタマイズと新規コネクターを備えたCoworkプラグインのアップデートを発表しました。
Claude AIはCoworkプラグインのアップデートをリリースし、企業管理者がプライベートなプラグインマーケットプレイスを作成し、Google Workspace、Docusign、Apolloなどのツールへのコネクターを追加できるようになりました。新しい研究プレビューでは、ClaudeがExcelとPowerPointを横断して作業し、エンドツーエンドの分析とプレゼンテーション作成を行えるようになります。

グローバルAI導入強度に関するアンソロピック・レポート
Anthropicの最新データは、AIのグローバルな普及が不均一であることを明らかにしており、総ユーザー数ではなく使用の強度を測定しています。このレポートは、個人や企業におけるコーディング、研究、意思決定などのワークフローにAIがどのように組み込まれているかを示しています。

AIデータセンター資金調達構造における訴訟リスク
AIデータセンターの構築には、2030年までに5.2兆ドルのインフラ投資が必要であり、企業はSPVやGPU担保ファシリティなどの複雑な資金調達構造を利用しており、これが9つの訴訟リスクカテゴリーを生み出しています。

OpenClaw LTS、AGENTS.mdよりCodex指示を優先しカスタムワークフローを破壊
OpenClaw LTS 2026.6.33では、すべてのエージェントがCodexハーネスを経由するため、AGENTS.mdのカスタム指示が無視されます。これにより、カスタムAGENTS.mdファイルを使用するワークフローが壊れます。