TREX: コードを実行するGreptileのAIコードレビューア

GreptileがTREX(Test, Run, Execute)をリリースしました。これはAI駆動のコードレビュー中にコードを実行するレイヤーです。TREXは差分を読むだけでなく、変更されたコードを実際に実行し、静的解析ではキャッチできないUIリグレッション、状態依存のロジックエラー、競合状態などのランタイムバグを表面化させます。
アーキテクチャ:オーケストレーター+問題別サブエージェント
初期バージョンでは、個別のエージェントまたは単一の統合エージェントを試みました。どちらも失敗しました。個別エージェントは共有コンテキストがなく作業が重複し、単一エージェントはセットアップ、スクリーンショット、テストの管理で過負荷になりました。解決策は、差分を読み、疑わしい問題を特定し、問題ごとに専用のTREXサブエージェントを起動するオーケストレーターエージェント(メインのGreptileレビュアー)で、これらはすべて並行して動作します。各サブエージェントはオーケストレーターのコンテキストを継承し、独自の調査にスコープされた独自のコンテキストウィンドウを持ちます。
例:認証ゲートの背後にあるUI機能。サブエージェントが自律的に環境をセットアップし、認証を処理し、機能フラグを切り替え、レンダリングされた機能のスクリーンショットを返します。
マルチモーダル成果物 vs 箇条書き
初期のTREX出力は箇条書きの要約でしたが、箇条書きでは幻覚を許し(例:テストが実際には失敗しているのに合格したと主張)、検証方法がありませんでした。修正策:各TREXの発見には、マルチモーダル成果物(スクリーンショット、実行ログ、APIトレース、実行スクリプト)のセットがバックアップとして付随します。各モダリティがストーリーの一部を語り、実際に何が起こったかを正確にトレースできます。チームを最初に感動させた成果物は、アニメーション変更の動画キャプチャでした。実際の実行時効果を示しています。
キャッチするもの
TREXはコード差分に現れないバグを狙います:特定の状態シーケンスが必要なロジックエラー、ページロード後のUIリグレッション、実際のリクエストを必要とする競合状態。テストを生成して実行しますが、焦点はバグを見つけることであり、単にテストを書くことではありません。サブエージェントはセットアップを自律的に行います。
TREXの背後にあるエンジニア、Shlok Mehrotra氏が言うように:「差分を完璧に読んでも、これらのタイプのバグを完全に見逃す可能性があります。」
📖 全文ソースはこちら: HN AI Agents
👀 See Also

GitHubのSpec-KitとClaude Codeを2ヶ月使ってみて: 有効な点、改善が必要な点
開発者がGitHubのSpec-Driven DevelopmentツールキットをClaude Codeで使用した実践的なノートを共有。5フェーズのワークフロー、ドリフト問題、オーバーヘッドのトレードオフ、セットアップのコツをカバー。

Oodle.ai、エージェントの可観測性を100万トレースあたり10ドルで提供開始
Oodle.aiは、エージェントトレースを100万スパンあたり10ドルで提供し、サブ秒のP99クエリレイテンシを実現。サンプリングなしで全トレースをS3ベースのカラムナストレージに保存します。

オープンソース 記事12 EU AI法対応ロギングライブラリ
Vercel AI SDKを使用するNode.jsアプリ向けの無料オープンソースTypeScriptライブラリで、追記専用JSONLログによるEU AI法第12条のロギング要件を実装し、改ざん検出のためのSHA-256ハッシュ連鎖と180日間の保持期間強制を提供します。

ソースコード: Claude向けに大規模なJava/Springモノレポを圧縮するオープンソースのCLI
sourcecode CLIは、約4kファイルのJava/Springモノレポを、約300万トークンから1.7kトークン(コンパクトモード)に削減します。現在は、コンテキスト圧縮、gitホットスポット検出、シンボル検索に焦点を当てています。