Netlifyが11のAIモデルをコーディング用にテスト:最適なのはどれ?

✍️ OpenClawRadar📅 公開日: August 14, 2026🔗 Source
Ad

Netlifyは、新たにオープンソース化した評価ツールAXISを使用して、11のAIモデルに同一のコーディングプロンプトを実行した実世界での比較を公開しました。テストでは、コーヒーショップのサイト構築、ToDoアプリ、AIレシピアプリなどの一般的なWeb開発タスクをカバーし、モデルの品質とクレジットコストに関する具体的なデータを提供しています。

この比較は、NetlifyがOpenRouterと提携し、プロジェクトでAIゲートウェイを通じてOpenRouter上の任意のモデルを使用できるようにした直後に行われました。Agent Runners(Netlifyでプロジェクトを構築・反復するチャットプロンプトボックス)には、オープンソースのOpenCodeエージェントを追加し、Kimi K3、GLM 5.2、DeepSeek V4など、より幅広いモデルを駆動できるようにしました。

テスト内容

Netlifyは社内のAXISフレームワークを使用して、3つの単純なユースケースを実行しました:

  • コーヒーショップサイト – シンプルな静的サイトに、席の予約機能を追加するフォローアップタスク。
  • ToDoリストアプリ – 初期段階から共有データベースが必要で、後から写真アップロード機能を追加。
  • 「何を作ろうか」アプリ – ユーザーが材料を入力すると、AIゲートウェイがレシピを生成。

評価は機能面(デザインではなく)に焦点を当て、データベースが必要なときに使用しているか、Netlify Databaseを適切に使用しているか、過剰なエンジニアリングを避けているかなどをチェックしました。チェックを一貫して満たさないモデルはAgent Runnersでは提供されません。

Ad

主な発見

完全なレポートはブログで公開されており、各モデルが生成したサイト、顕著な問題点、クレジットコストが示されています。この投稿では公式スコアは公開していませんが、結果に大きな違いがあることを強調しています。例えば、GPT 5.6 Solを低労力設定で実行し、Opusよりも経済的な代替案を提供しつつ「かなり良い結果」が得られると述べています。

また、同じタスクでもモデルによってクレジットコストが大幅に異なり、より良い出力を生み出さないモデルに割増料金を支払う可能性があることも指摘しています。

まとめ

自身のエージェントベースのプロジェクト用にコーディングモデルを選択する場合、これは有用なデータポイントです。テストは実際のWeb開発シナリオに焦点を当て、しばしば誇大広告されるオープンソースモデルも含まれています。結果は主観的ですが(彼らも認めています)、デフォルトモデルを決定したりクレジットを消費したりする前に確認する価値があります。

注:これはシリーズの最初の記事であり、フォローアップ投稿で他のユースケースを詳しく取り上げます。

📖 出典全文: HN LLM Tools

Ad

👀 See Also

オープンソースツールがローカルデータ分析でAIコーディングエージェントの自律性を測定
Tools

オープンソースツールがローカルデータ分析でAIコーディングエージェントの自律性を測定

Codelens-AIは、Claude Codeセッションファイルとgit履歴を分析して、Autopilot RatioやSelf-Heal Scoreなどの自律性メトリクスを計算するオープンソースのCLIツールです。このツールはnpx claude-roiを使用してゼロセットアップでローカルで実行され、すべてのデータはお使いのマシン上に保持されます。

OpenClawRadar
日本語訳: 新モデルアーキテクチャ「Interfaze」、決定論的タスクでGemini-3-FlashとGPT-5.4-Miniを凌駕
Tools

日本語訳: 新モデルアーキテクチャ「Interfaze」、決定論的タスクでGemini-3-FlashとGPT-5.4-Miniを凌駕

DNN/CNNとトランスフォーマーを組み合わせた新しいモデルアーキテクチャ「Interfaze」が、OCR、ビジョン、STT、構造化出力を含む9つのベンチマークで、Gemini-3-Flash、Claude-Sonnet-4.6、GPT-5.4-Mini、Grok-4.3を上回る性能を達成しました。

OpenClawRadar
スロットルメーター:macOS向けオープンソースのClaude Code使用量メーター
Tools

スロットルメーター:macOS向けオープンソースのClaude Code使用量メーター

オープンソースのmacOSメニューバーアプリ。ローカルのClaude Codeログを読み取り、リアルタイムの5時間および週間使用量を表示し、しきい値通知とトークン節約フックを提供します。Safari経由でclaude.aiの内部APIを読み取るExactモードを備えた19ユーロの商用版もあります。

OpenClawRadar
ブルンフェルド・エージェンティック・ワールド:行動プロンプトなしのマルチエージェント中世経済シミュレーション
Tools

ブルンフェルド・エージェンティック・ワールド:行動プロンプトなしのマルチエージェント中世経済シミュレーション

20体のLLMエージェントが行動指示、目標、取引戦略なしで中世の村の経済で自律的に取引を行うTypeScriptシミュレーション。各エージェントはティックごとに約200トークンの知覚を受け取り、物理、レシピ、市場メカニクスを処理する決定論的エンジンを通じて相互作用します。

OpenClawRadar