Spec27: Spec駆動型AIエージェント検証 – 内部アクセス不要のAPIレベルテスト

Safe Intelligenceは、AIエージェント向けの仕様駆動型検証ツール「Spec27」を発表しました。従来のLLM評価フレームワークが一般的なモデル動作をスコアリングするのに対し、Spec27ではチームがエージェントの果たすべき特定ミッションに対して再利用可能な仕様を定義できます。テストはその仕様から自動生成され、エージェントの主要インターフェースのみに対して実行されます。内部スタックの仮定は不要で、SDKやゲートウェイも必要ありません。
主な機能
- 外部からのテスト: すべてのテストはエージェントの公開APIまたはUIに対して実行されます。エージェント内部を計測する必要がなく、スタックを制御できないベンダープラットフォーム上で構築されたエージェントにとって重要です。
- 仕様駆動のテスト生成: 期待される動作(例:「Xを尋ねられたら、Yを実行し、Zは実行しないこと」)の観点で仕様を定義します。Spec27は自動的に攻撃テストとロバストネスチェックを生成し、モデル、プロンプト、ツールが変更された際の感度や回帰を表面化します。
- 早期アクセス: 現時点では、シングルターンのエージェントおよびアプリケーション検証に最も強力です。マルチターン対話と、よりリッチなテレメトリ/ツール呼び出し統合はロードマップに含まれています。
対象ユーザー
内部エージェント、ベンダーエージェント、またはベンチマークスコアよりも信頼性が重要なAIシステムを導入しているチーム。内部を公開していないプラットフォーム上のエージェントをテストする場合、Spec27のブラックボックスアプローチはそのギャップに直接対応します。
始め方
Spec27はHN読者が試せるよう公開されています。ローンチサイトでは、設定不要で試せるサンプルフローを提供しています。spec27.ai/launchからサインアップしてください。
📖 出典: HN AI Agents
👀 See Also

コーディングエージェント向けローカルコードインデックス:言語サーバーなしでインポートを解決
Basemindは、MITライセンスのRust製ツールで、ローカルコードをインデックス化し、言語サーバーなしでインポートを解決します。JS/TS、Python、Javaの実解決をサポートします。

Anthropicのサブスクリプションモードの習得:俳句、ソネット、オーパス
Antropicの革新的なサブスクリプションモード「Haiku」「Sonnet」「Opus」を探索しましょう。これらのモードは、あなたのAIコーディング体験を、特化した機能と価格設定で向上させるために設計されています。

オープンソースのキュレーションされたオープンクローリソースコレクションが公開されました
AI開発とコラボレーションを強化するためにコミュニティによってキュレーションされた、新しいオープンソースのOpenClawリソースコレクションを発見してください。

skill-depot: MCP互換AIエージェント向けのローカルファーストメモリおよびスキルシステム
skill-depotは、エージェントの知識をMarkdownファイルとして保存し、ベクトル埋め込みを使用して意味的に検索し、関連するコンテンツのみを選択的に読み込む検索システムです。100%ローカルで動作し、APIキーは不要で、MCP互換のあらゆるエージェントと連携でき、npx skill-depot initでセットアップできます。