ThumbGate met en œuvre le modèle de harnais d'agent en langage naturel de Tsinghua pour la sécurité de l'IA

✍️ OpenClawRadar📅 Publié: April 5, 2026🔗 Source
ThumbGate met en œuvre le modèle de harnais d'agent en langage naturel de Tsinghua pour la sécurité de l'IA
Ad

Implémentation de ThumbGate du schéma NLAH

Le schéma Natural-Language Agent Harness (NLAH) du document de Tsinghua (arxiv 2603.25723) formalise le traitement des couches de sécurité des agents d'IA comme des objets de première classe avec des composants spécifiques. L'outil open-source ThumbGate implémente ce schéma avec des associations concrètes aux systèmes de production.

Associations des composants

ThumbGate associe les quatre composants NLAH à des implémentations pratiques :

  • Contrats → Règles de prévention générées automatiquement à partir des retours négatifs
  • Portes de vérification → Crochets PreToolUse qui interceptent chaque appel d'outil avant exécution
  • État durable → Base de données de leçons SQLite+FTS5 qui persiste entre les sessions
  • Adaptateurs → Adaptateurs de serveur MCP pour Claude Code, Cursor, Codex, Gemini, Amp
Ad

Principales observations d'implémentation

Les développeurs ont constaté que les règles d'invite échouent silencieusement (les agents peuvent raisonner autour d'elles), tandis que les portes de vérification échouent bruyamment (les agents reçoivent des réponses de blocage et doivent s'adapter). Ils utilisent l'échantillonnage de Thompson pour gérer les niveaux de gravité incertains, où les nouvelles règles commencent comme des avertissements et sont promues en blocages durs en fonction des retours.

Les détails complets d'implémentation et d'association sont disponibles dans leur documentation approfondie.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

log-context-mcp : L'outil MCP réduit de 96% l'utilisation des tokens de journal pour le débogage de Claude
Tools

log-context-mcp : L'outil MCP réduit de 96% l'utilisation des tokens de journal pour le débogage de Claude

log-context-mcp est un outil MCP qui prétraite les fichiers journaux avant qu'ils n'atteignent le contexte de Claude, en dédupliquant les lignes, en regroupant les traces de pile et en éliminant le bruit pour réduire l'utilisation de tokens. Des tests sur un journal Apache de 2000 lignes ont montré une réduction de 96,5 % tout en identifiant correctement les causes racines.

OpenClawRadar
ConnectSafely AI MCP Server Relie LinkedIn à Claude pour un Contrôle Direct
Tools

ConnectSafely AI MCP Server Relie LinkedIn à Claude pour un Contrôle Direct

ConnectSafely AI propose un serveur MCP qui connecte LinkedIn directement à Claude, permettant aux utilisateurs d'envoyer des messages, de rechercher des personnes, de vérifier les visiteurs de profil et de suivre les conversations via des invites sans changer d'onglet.

OpenClawRadar
EsoLang-Bench : Un benchmark de codage utilisant des langages ésotériques pour tester le raisonnement des LLM
Tools

EsoLang-Bench : Un benchmark de codage utilisant des langages ésotériques pour tester le raisonnement des LLM

Des chercheurs ont créé EsoLang-Bench, un benchmark de codage utilisant des langages de programmation ésotériques comme Brainfuck et Whitespace pour tester si les LLM peuvent raisonner ou simplement faire du pattern-matching. Le meilleur résultat parmi GPT-5.2, O4-mini, Gemini, Qwen et Kimi était de 11,2 %.

OpenClawRadar
120 modèles de prompts testés : 8 fonctionnent vraiment pour Claude Code
Tools

120 modèles de prompts testés : 8 fonctionnent vraiment pour Claude Code

Un test empirique de 3 mois sur 120 modèles de prompt pour Claude Code donne 8 commandes exploitables et 5 prompts de validation. Modèles clés : L99 (réduit les hésitations), /ghost (supprime la voix IA), OODA (raisonnement structuré), ULTRATHINK (raisonnement profond), HARDMODE (débogage par contraintes).

OpenClawRadar