ThumbGate Implementa o Padrão de Controle de Agente de Linguagem Natural da Tsinghua para Segurança de IA

✍️ OpenClawRadar📅 Publicado: April 5, 2026🔗 Source
ThumbGate Implementa o Padrão de Controle de Agente de Linguagem Natural da Tsinghua para Segurança de IA
Ad

Implementação ThumbGate do Padrão NLAH

O padrão Natural-Language Agent Harness (NLAH) do artigo da Tsinghua (arxiv 2603.25723) formaliza o tratamento de camadas de segurança de agentes de IA como objetos de primeira classe com componentes específicos. A ferramenta de código aberto ThumbGate implementa esse padrão com mapeamentos concretos para sistemas de produção.

Mapeamentos de Componentes

O ThumbGate mapeia os quatro componentes NLAH para implementações práticas:

  • Contratos → Regras de prevenção geradas automaticamente a partir de feedback negativo
  • Portas de Verificação → Ganchos PreToolUse que interceptam cada chamada de ferramenta antes da execução
  • Estado Durável → Banco de dados de lições SQLite+FTS5 que persiste entre sessões
  • Adaptadores → Adaptadores de servidor MCP para Claude Code, Cursor, Codex, Gemini, Amp
Ad

Principais Insights de Implementação

Os desenvolvedores descobriram que regras de prompt falham silenciosamente (agentes podem contorná-las com raciocínio), enquanto portas de verificação falham ruidosamente (agentes recebem respostas de bloqueio e devem se adaptar). Eles usam Thompson Sampling para lidar com níveis de severidade incertos, onde novas regras começam como avisos e são promovidas a bloqueios rígidos com base no feedback.

Os detalhes completos da implementação e mapeamento estão disponíveis em sua documentação detalhada.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Portable Mind Format (PMF): Especificação de Agente Independente de Provedor com 15 Agentes de Código Aberto
Tools

Portable Mind Format (PMF): Especificação de Agente Independente de Provedor com 15 Agentes de Código Aberto

O Portable Mind Format (PMF) é uma especificação baseada em JSON para definir identidades de agentes de IA que podem ser executados em vários modelos e provedores, incluindo Claude, GPT-4, Gemini, DeepSeek e modelos locais via Ollama. Inclui 15 agentes de produção com licença MIT e conversores para Claude Code, Cursor, GitHub Copilot e Gemini CLI.

OpenClawRadar
Visão Comparativa da Inferência Rápida de LLMs pela Anthropic e OpenAI
Tools

Visão Comparativa da Inferência Rápida de LLMs pela Anthropic e OpenAI

Anthropic e OpenAI lançaram recursos distintos de 'modo rápido' para inferência mais rápida de LLM, com a OpenAI utilizando chips Cerebras para maior velocidade

OpenClawRadar
Faça Acontecer: Sistema de Meta-Prompting para Agentes de IA de Programação
Tools

Faça Acontecer: Sistema de Meta-Prompting para Agentes de IA de Programação

Get Shit Done é um sistema de meta-prompting, engenharia de contexto e desenvolvimento orientado a especificações que funciona com Claude Code, OpenCode, Gemini CLI, Codex, Copilot e Antigravity. Ele aborda a deterioração do contexto fornecendo prompts estruturados e fluxos de trabalho de verificação.

OpenClawRadar
agentmemory V4 atinge 96,2% no benchmark LongMemEval, superando sistemas comerciais de memória de IA
Tools

agentmemory V4 atinge 96,2% no benchmark LongMemEval, superando sistemas comerciais de memória de IA

O agentmemory V4 obteve 96,2% no LongMemEval, superando várias empresas de memória de IA financiadas, incluindo PwC Chronos (95,6%), Mastra (94,87%) e OMEGA (93,2%). O sistema foi desenvolvido por uma única pessoa em 16 dias em um PC gamer de médio porte com um orçamento de US$ 1.000.

OpenClawRadar