Netlifyが11のAIモデルをコーディング用にテスト:最適なのはどれ?
Netlifyは、新たにオープンソース化した評価ツールAXISを使用して、11のAIモデルに同一のコーディングプロンプトを実行した実世界での比較を公開しました。テストでは、コーヒーショップのサイト構築、ToDoアプリ、AIレシピアプリなどの一般的なWeb開発タスクをカバーし、モデルの品質とクレジットコストに関する具体的なデータを提供しています。
この比較は、NetlifyがOpenRouterと提携し、プロジェクトでAIゲートウェイを通じてOpenRouter上の任意のモデルを使用できるようにした直後に行われました。Agent Runners(Netlifyでプロジェクトを構築・反復するチャットプロンプトボックス)には、オープンソースのOpenCodeエージェントを追加し、Kimi K3、GLM 5.2、DeepSeek V4など、より幅広いモデルを駆動できるようにしました。
テスト内容
Netlifyは社内のAXISフレームワークを使用して、3つの単純なユースケースを実行しました:
- コーヒーショップサイト – シンプルな静的サイトに、席の予約機能を追加するフォローアップタスク。
- ToDoリストアプリ – 初期段階から共有データベースが必要で、後から写真アップロード機能を追加。
- 「何を作ろうか」アプリ – ユーザーが材料を入力すると、AIゲートウェイがレシピを生成。
評価は機能面(デザインではなく)に焦点を当て、データベースが必要なときに使用しているか、Netlify Databaseを適切に使用しているか、過剰なエンジニアリングを避けているかなどをチェックしました。チェックを一貫して満たさないモデルはAgent Runnersでは提供されません。
主な発見
完全なレポートはブログで公開されており、各モデルが生成したサイト、顕著な問題点、クレジットコストが示されています。この投稿では公式スコアは公開していませんが、結果に大きな違いがあることを強調しています。例えば、GPT 5.6 Solを低労力設定で実行し、Opusよりも経済的な代替案を提供しつつ「かなり良い結果」が得られると述べています。
また、同じタスクでもモデルによってクレジットコストが大幅に異なり、より良い出力を生み出さないモデルに割増料金を支払う可能性があることも指摘しています。
まとめ
自身のエージェントベースのプロジェクト用にコーディングモデルを選択する場合、これは有用なデータポイントです。テストは実際のWeb開発シナリオに焦点を当て、しばしば誇大広告されるオープンソースモデルも含まれています。結果は主観的ですが(彼らも認めています)、デフォルトモデルを決定したりクレジットを消費したりする前に確認する価値があります。
注:これはシリーズの最初の記事であり、フォローアップ投稿で他のユースケースを詳しく取り上げます。
📖 出典全文: HN LLM Tools
👀 See Also

Mnemos: 永続的なClaude CodeメモリのためのMCPサーバー
Mnemos は、Claude Code にセッションを超えた永続メモリを提供するオープンソースの MCP サーバーです。修正を構造化パターンとして記録し、起動時にランク付けされたコンテキストをプッシュします。シングル 15 MB の Go バイナリで、Docker もベクター DB も不要です。

オープンソース 記事12 EU AI法対応ロギングライブラリ
Vercel AI SDKを使用するNode.jsアプリ向けの無料オープンソースTypeScriptライブラリで、追記専用JSONLログによるEU AI法第12条のロギング要件を実装し、改ざん検出のためのSHA-256ハッシュ連鎖と180日間の保持期間強制を提供します。

Compass Chrome拡張機能がClaudeとChatGPTにナビゲーションツールを追加
開発者が、長い会話でのナビゲーション問題を解決するため、ClaudeとChatGPTのインターフェースにプロンプトミニマップ、固定スクロールヘッダー、セッションチェックリスト、プロンプトビルダーテンプレートを追加する無料のChrome拡張機能「Compass」を構築しました。

cstat: Claude Code用のネイティブRustステータスライン、2msのパフォーマンスを実現
cstatはネイティブのRustバイナリで、24回のサブプロセス起動を排除することで、claude-hudの62msステータスラインを2ms実装に置き換えます。モデル情報、レート制限、gitステータス、コンテキストウィンドウ使用量、アクティブツール、サブエージェント、タスク進捗を表示します。