Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais

Um usuário do Reddit lançou uma ferramenta de código aberto chamada personal_agent_eval (repositório: github.com/javiersgjavi/personal_agent_eval) para avaliar agentes OpenClaw em fluxos de trabalho realistas e bagunçados — e não em conjuntos de dados públicos de brinquedo.
Fluxo de Trabalho
Defina casos de teste como arquivos YAML contendo:
- Mensagens de entrada
- Artefatos esperados
- Critérios de avaliação
- Verificações determinísticas
- Perfis de execução e perfis de julgamento
O executor processa os casos contra uma instância real do OpenClaw, armazena as saídas, avalia as execuções e gera relatórios e gráficos.
Funcionalidade Principal: Importação de Workspace Real
Você pode importar seu workspace real do OpenClaw — incluindo memória, habilidades, arquivos, prompts e contexto — em vez de uma imitação simplificada. O agente é executado em uma instância real do OpenClaw, testando exatamente o agente que você usa diariamente.
Conjuntos de Avaliação Privados
O autor explicitamente não publica seus conjuntos de avaliação privados para evitar que benchmarks públicos se tornem obsoletos. No entanto, o repositório inclui casos de exemplo, configurações, perfis de avaliação, verificações determinísticas e geração de gráficos para que você possa construir seu próprio conjunto privado.
SKILL.md para Assistência ao Agente
Um arquivo SKILL.md no repositório foi projetado para dar a um agente contexto suficiente para ajudá-lo a definir novos casos de benchmark, perfis de execução, critérios de avaliação e verificações determinísticas — reduzindo a edição manual.
Resultados de Amostra (Execução Privada do Autor)
O autor compartilhou uma comparação de execução única (métrica incerta, provavelmente média ponderada 0-10):
Claude Opus 4.6 - 9.44 GLM 5.1 - 9.31 GPT-5.5 - 9.31 Claude Sonnet 4.6 - 9.25 DeepSeek V4 Flash - 8.61 Gemma 4 31B - 8.39 DeepSeek V4 Pro - 8.28 Kimi K2.6 - 7.97
Mais interessantes do que as pontuações: os modos de falha. Alguns modelos raciocinam bem, mas são desajeitados com ferramentas; modelos mais baratos degradam em tarefas longas ou com estado; algumas falhas são comportamentais do modelo, outras são casos extremos do OpenClaw/ferramentas expostos pelo benchmark.
Para Quem É
Usuários do OpenClaw que executam agentes para trabalhos reais e desejam comparar modelos em suas próprias tarefas privadas, em vez de argumentar com base em sensações ou leaderboards genéricos.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Gerenciamento Automatizado do Estado da Sessão para o Claude Code Handoff
Um projeto do GitHub fornece hooks automatizados para manter um arquivo de estado de sessão ativo (.claude/session-state.md) ao longo das conversas com Claude, abordando a perda de contexto por autocompactação e a degradação de contexto no meio da conversa. O sistema usa quatro scripts bash com jq para rastrear eventos importantes e edições de arquivos.

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

Agente Safehouse: Sandboxing nativo do macOS para agentes de IA de codificação local
Agent Safehouse é uma ferramenta nativa de sandboxing para macOS que impede agentes de IA locais de acessar arquivos fora do diretório do seu projeto usando aplicação em nível de kernel. É um único script shell sem dependências que funciona com Claude Code, Codex, OpenCode, Amp, Gemini CLI, Aider, Goose, Auggie, Pi, Cursor Agent, Cline, Kilo, Code Droid e outros agentes.

boxBot: Um Alto-Falante Inteligente de Código Aberto Alimentado por Claude e Hailo AI
Um desenvolvedor criou uma caixa de som inteligente chamada boxBot usando Claude para controle de hardware orientado por agente, Raspberry Pi, acelerador de IA Hailo e SDK personalizado — código aberto no GitHub.