RAGパイプラインのテストが示すのは、トークンあたりのコストがモデル選択の適切な指標ではないということです。

✍️ OpenClawRadar📅 公開日: March 2, 2026🔗 Source
RAGパイプラインのテストが示すのは、トークンあたりのコストがモデル選択の適切な指標ではないということです。
Ad

開発者が、SOC 2コンプライアンスに関する微妙な顧客クエリに答えるために、同一のRAGパイプラインを使用して3つのAIモデルの本番レベル比較を実施しました。このテストでは、Claude Haiku 4.5、Amazon Nova Pro、Amazon Nova Liteを同じセットアップで使用しました:2つのベクトルストア(製品ドキュメントとマーケティング/競合ドキュメント)、13のアーキテクチャ決定記録を基礎コンテキストとして、クエリごとに約49K入力トークンの取得コンテキスト、同一のシステムプロンプト、モデルIDのみ変更した同じBedrock APIコール構造です。

テスト設定と結果

クエリは次の通りでした:「顧客がSOC 2コンプライアンスについて質問してきました — どう応答すればよいですか?」すべてのモデルは、コピペ可能なメール、反論処理、競合ポジショニング、フレームワーク固有のコンプライアンス回答、言ってはいけないことのガードレールを含む完全なプレイブックを含む同じRAGコンテキストを受け取りました。

結果:

  • Nova Lite: 49,067入力トークン、244出力トークン、5.5秒応答時間、約$0.003コスト
  • Nova Pro: 49,067入力トークン、368出力トークン、13.5秒応答時間、約$0.040コスト
  • Haiku 4.5: 53,674入力トークン、1,534出力トークン、15.6秒応答時間、$0.049コスト
Ad

出力品質比較

同一のコンテキストにもかかわらず、モデルは劇的に異なる応答を生成しました:

  • Nova Lite: 4段落の一般的なメールを生成し、核心的事実(お客様のアカウントにデプロイ、別途SOC 2レポートなし)は正しく伝えましたが、反論処理、競合ポジショニング、コンテキストからのニュアンスは一切含まれていませんでした。ADRへの準拠に関するメタ解説で終了しました。
  • Nova Pro: データ所在地、認証、アクセス制御、監視、パッチ適用、シークレット管理、コンプライアンス範囲などの技術的側面をカバーする7つの番号付き箇条書きを生成しました。技術的には正確ですが、AWSドキュメントを貼り付けたような読み味で、同様のメタ解説を含んでいました。
  • Haiku 4.5: 平易な英語による説明、コピペ可能なメール、Terraformのアナロジーを用いた反論処理、HIPAA、PCI-DSS、SOX、FINRAのフレームワーク固有回答、「言ってはいけないこと」のガードレール、CRM対応のトーキングポイント、他のツールに対する競合ポジショニングを含む完全なプレイブックを提供しました。

主な発見

この差は利用可能な情報に関するものではありませんでした — すべてのモデルは完全なプレイブックを含む同じ約49K入力トークンを持っていました。違いは、各モデルが抽出・統合できる内容にありました。Nova Liteは1つの事実を抽出し、Nova Proは事実をリストに整理しましたが、Haikuはコンテキストを予測されるフォローアップを含む実用的なツールキットに統合しました。

Nova ProとHaikuのコスト差はクエリあたり$0.009(1セント未満)でしたが、出力品質の差は甚大でした。トークンあたり最も安価なモデルは、Haikuの単一パス出力に匹敵するために2〜3回のフォローアップクエリを必要とする応答を生成し、結局はRAGパイプラインの繰り返し使用によりより多くのコストがかかることになります。

📖 完全なソースを読む: r/ClaudeAI

Ad

👀 See Also

AIコーディングエージェントは近道を選ぶ:開発者が報告するClaudeとChatGPTの「最も簡単な道」選択事例
Use Cases

AIコーディングエージェントは近道を選ぶ:開発者が報告するClaudeとChatGPTの「最も簡単な道」選択事例

センサーフュージョンデバイスを開発していた開発者は、ClaudeとChatGPTの両方が、空間認識のためのビームフォーミングを実装する代わりに、デュアルマイク入力をモノラルに統合していることを発見しました。別のモデル学習タスクでは、AIは当初、年齢層ごとにグループ化せずに、異なるサイズの被験者を同じプールにまとめていました。

OpenClawRadar
非技術系ユーザーのOpenClaw体験:セットアップの煩わしさが自動化の利点を覆い隠す
Use Cases

非技術系ユーザーのOpenClaw体験:セットアップの煩わしさが自動化の利点を覆い隠す

一人のコンサルタントが繰り返し作業を自動化するためにOpenClawを試したが、VPSの管理、Dockerのデプロイ、ターミナルコマンドのデバッグが必要なセットアッププロセスに直面した。エージェントのGmail連携とテキスト入力フローは良好に機能したが、API制限と技術的な複雑さにより、作業が削減されるのではなく移行する結果となった。

OpenClawRadar
OpenClawをSIPおよび音声APIを介してダイヤル式電話に接続する
Use Cases

OpenClawをSIPおよび音声APIを介してダイヤル式電話に接続する

開発者は、Grandstream HT801 v2 ATA、Twilio SIP、音声認識にDeepgram、音声合成にElevenLabsを使用し、WebSocketとngrokを介したオーディオストリーミングで、Benotekのダイヤル式電話をOpenClawに接続しました。

OpenClawRadar
自律型OpenClawエージェントがAPIキーを使用して24時間体制でコールドアウトリーチを実行します。
Use Cases

自律型OpenClawエージェントがAPIキーを使用して24時間体制でコールドアウトリーチを実行します。

ある開発者が、OpenClawエージェントに完全な読み書きアクセス権を与え、人間の介入なしで24時間コールドアウトリーチを実行する実験を行いました。このセットアップでは、自律的な推論にOpenClaw、統合にZapier MCP、調査にBrave Search API、大量のコンテキスト処理にGemini/OpenRouterを使用しました。

OpenClawRadar