Spec27: Spec駆動型AIエージェント検証 – 内部アクセス不要のAPIレベルテスト

Safe Intelligenceは、AIエージェント向けの仕様駆動型検証ツール「Spec27」を発表しました。従来のLLM評価フレームワークが一般的なモデル動作をスコアリングするのに対し、Spec27ではチームがエージェントの果たすべき特定ミッションに対して再利用可能な仕様を定義できます。テストはその仕様から自動生成され、エージェントの主要インターフェースのみに対して実行されます。内部スタックの仮定は不要で、SDKやゲートウェイも必要ありません。
主な機能
- 外部からのテスト: すべてのテストはエージェントの公開APIまたはUIに対して実行されます。エージェント内部を計測する必要がなく、スタックを制御できないベンダープラットフォーム上で構築されたエージェントにとって重要です。
- 仕様駆動のテスト生成: 期待される動作(例:「Xを尋ねられたら、Yを実行し、Zは実行しないこと」)の観点で仕様を定義します。Spec27は自動的に攻撃テストとロバストネスチェックを生成し、モデル、プロンプト、ツールが変更された際の感度や回帰を表面化します。
- 早期アクセス: 現時点では、シングルターンのエージェントおよびアプリケーション検証に最も強力です。マルチターン対話と、よりリッチなテレメトリ/ツール呼び出し統合はロードマップに含まれています。
対象ユーザー
内部エージェント、ベンダーエージェント、またはベンチマークスコアよりも信頼性が重要なAIシステムを導入しているチーム。内部を公開していないプラットフォーム上のエージェントをテストする場合、Spec27のブラックボックスアプローチはそのギャップに直接対応します。
始め方
Spec27はHN読者が試せるよう公開されています。ローンチサイトでは、設定不要で試せるサンプルフローを提供しています。spec27.ai/launchからサインアップしてください。
📖 出典: HN AI Agents
👀 See Also

Opendesk: Claude CodeによるAIデスクトップ制御のためのMCP + SOMアルゴリズム
Opendeskは、カスタムSOMアルゴリズムを使用して、AIエージェントにデスクトップへの“目”と“手”を与えるMCPサーバーです。Claude Codeや任意のエージェントハーネスと統合し、マウス/キーボード制御、学習、再生、スケジューリングを実現します。

PhAILベンチマークは、実際の倉庫ロボットタスクでVLAモデルをテストします
PhAILは、Franka FR3ロボットを使用したビン間のオーダーピッキングにおいて、4つの視覚言語行動モデルをテストする実ロボットベンチマークです。最高のモデルは1時間あたり64ユニットを達成しましたが、人間による遠隔操作では330UPH、人間による手作業では1,300+ UPHでした。

Selfware:PDVRアーキテクチャを採用したRustベースのローカルAIエージェントフレームワーク
Selfwareは、ローカル推論用に構築されたオープンソースのAIエージェントフレームワークで、PDVR認知サイクルを実装し、54の組み込みツールを備え、コンシューマーハードウェアでの長時間実行タスク向けに設計されています。

Stagent: ローカルガバナンスとワークフローオーケストレーションを備えたClaude Agent SDK向けオープンソース運用レイヤー
Stagentは、Claude Agent SDKとClaude API上に構築されたオープンソースのローカルファースト調整ワークスペースで、AIエージェントのためのワークフローオーケストレーション、予算ガードレール、ヒューマンインザループガバナンスを提供します。15のプロダクトサーフェス、6つのワークフローパターン、52以上の再利用可能なエージェントプロファイルを含み、SQLiteを使用して完全にローカルで動作します。