サムゲートは、AI安全性のために清華大学の自然言語エージェント制御パターンを実装しています

✍️ OpenClawRadar📅 公開日: April 5, 2026🔗 Source
サムゲートは、AI安全性のために清華大学の自然言語エージェント制御パターンを実装しています
Ad

NLAHパターンのThumbGate実装

清華大学の論文(arxiv 2603.25723)のNatural-Language Agent Harness(NLAH)パターンは、AIエージェントの安全レイヤーを特定のコンポーネントを持つ第一級オブジェクトとして扱うことを形式化しています。オープンソースツールThumbGateは、このパターンを実装し、実運用システムへの具体的なマッピングを提供します。

コンポーネントマッピング

ThumbGateは4つのNLAHコンポーネントを実用的な実装にマッピングします:

  • 契約 → サムズダウンフィードバックから自動生成される予防ルール
  • 検証ゲート → すべてのツール呼び出しを実行前にインターセプトするPreToolUseフック
  • 永続状態 → セッションをまたいで永続化するSQLite+FTS5レッスンデータベース
  • アダプター → Claude Code、Cursor、Codex、Gemini、Amp向けのMCPサーバーアダプター

主要な実装の洞察

開発者は、プロンプトルールは静かに失敗する(エージェントが推論で回避できる)一方、検証ゲートは明示的に失敗する(エージェントがブロック応答を受け取り、適応する必要がある)ことを発見しました。彼らは不確実な深刻度レベルを扱うためにトンプソンサンプリングを使用し、新しいルールは警告として開始され、フィードバックに基づいてハードブロックに昇格します。

完全な実装の詳細とマッピングは、彼らの詳細なドキュメントで利用可能です。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

CC-Canary: ローカルJSONL分析によるClaude Codeの回帰検出
Tools

CC-Canary: ローカルJSONL分析によるClaude Codeの回帰検出

CC-CanaryはClaude Codeのセッションログを読み取り、モデルのドリフトに関するフォレンジックレポートを生成します。これには、読み取り:編集比率、推論ループ、コスト傾向、自動検出された変曲点が含まれます。

OpenClawRadar
Claude-Control: Claudeコードセッション用モバイルリモートコントロール
Tools

Claude-Control: Claudeコードセッション用モバイルリモートコントロール

Claude-controlは、HTTPSとWebSocketを介してスマートフォンからClaude Codeセッションを管理できるオープンソースツールです。tmux内で実際のPTYでClaude Codeを実行し、許可プロンプトを検出して、許可/拒否ボタン付きのプッシュ通知を送信します。

OpenClawRadar
Audacity-MCP:ローカル音声編集のためのClaude AI統合、131のツールを搭載
Tools

Audacity-MCP:ローカル音声編集のためのClaude AI統合、131のツールを搭載

Audacity-MCPはパイプインターフェースを介してClaudeとAudacityを接続し、音声制御によるオーディオ編集を可能にします。131のツール、9つの自動化パイプライン、クラウド依存なしのローカルWhisper文字起こし機能を備えています。

OpenClawRadar
ClawCall:AI電話通話のためのOpenClawスキル、ブリッジモード対応
Tools

ClawCall:AI電話通話のためのOpenClawスキル、ブリッジモード対応

ClawCallは、AIエージェントが実際の電話をかけ、メニューを操作し、保留状態を待ち、会話を行うことを可能にするOpenClawスキルです。人間が応答したときに通話を橋渡しするブリッジモードも含まれています。

OpenClawRadar