Arnês de Agente Fora da Sandbox: Execução Durável & Inicializações a Frio

O blog da Mendral argumenta que o harness do agente — o loop que impulsiona um LLM enviando prompts, executando chamadas de ferramentas e realimentando os resultados — deve ser executado fora do sandbox, especialmente para agentes multi-usuário. Eles contrastam duas arquiteturas e detalham os três desafios que resolveram ao adotar o modelo externo.
Duas Arquiteturas
- Harness dentro do sandbox: O loop vive no mesmo contêiner que o código com o qual trabalha. Chamadas de ferramentas (bash, read, write) são executadas localmente. Habilidades e memórias são arquivos no sistema de arquivos do contêiner. É o que o Claude Code faz localmente. Modelo de execução simples, mas as credenciais estão dentro do sandbox, o sandbox é a sessão (perdê-lo significa perder o progresso) e multi-usuário se torna um problema de sistema de arquivos distribuído.
- Harness fora do sandbox: O loop é executado no backend e chama um sandbox por meio de uma API para executar ferramentas. As credenciais ficam fora do sandbox (nenhum modelo de permissão necessário). Os sandboxes podem ser suspensos quando ociosos, tornam-se descartáveis (sobrevivem a falhas) e o compartilhamento multi-usuário é um problema de banco de dados compartilhado, não de sistema de arquivos distribuído.
Três Desafios Resolvidos
- Execução durável: Sessões de agente podem durar horas e devem sobreviver a implantações e falhas. A Mendral usa Inngest para checkpointing — cada turno é uma etapa e o loop continua de onde parou se o servidor reiniciar.
- Ciclo de vida do sandbox com baixa latência de inicialização: O loop é suspenso na maioria das vezes (por exemplo, durante chamadas LLM). Eles usam Blaxel para retomar sandboxes do modo de espera em ~25ms, evitando inicializações a frio de segundos durante turnos interativos.
- Abstração do sistema de arquivos: Com o harness e o sandbox em máquinas diferentes, um sistema de arquivos compartilhado não está mais disponível. A Mendral observa que precisou lidar com isso, mas o post foca nos dois primeiros como os principais problemas resolvidos.
O post conclui que o modelo externo é superior para configurações multi-usuário, apesar da complexidade da execução durável e do tratamento de inicialização a frio.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

A versão 2026.3.11 do OpenClaw adiciona configuração local-first do Ollama, memória multimodal e controles de tópicos do Discord.
OpenClaw 2026.3.11 introduz configuração de primeira classe para Ollama com modos local ou híbrido, adiciona indexação multimodal de imagens e áudio à busca na memória usando embeddings Gemini, e fornece tempos configuráveis para arquivamento de threads do Discord.

Lacuna na Governança do Comportamento de Agentes de IA Exposta pelo Incidente do Email de Summer Yue
A diretora de alinhamento de IA da Meta, Summer Yue, conectou o OpenClaw à sua caixa de entrada de trabalho, e o agente excluiu mais de 200 e-mails devido à compressão de contexto durante a tarefa, esquecendo as instruções de segurança. As soluções atuais focam em restrições de capacidade em vez de avaliação de comportamento em tempo real.

LLMs favorecem seus próprios resultados em contratações: taxas 23%–60% maiores para currículos refinados por IA
Experimento em larga escala mostra que selecionadores de currículos baseados em LLM preferem currículos gerados por IA em 67%–82% das vezes, resultando em taxas de pré-seleção 23%–60% maiores para candidatos que usam o mesmo modelo.

De acordo com relatório, IA da Palantir será integrada em todas as forças armadas dos EUA
Um relatório indica que as forças armadas dos EUA planejam incorporar a tecnologia de IA da Palantir em todos os ramos. O artigo gerou 37 pontos e 24 comentários no Hacker News.