Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais

✍️ OpenClawRadar📅 Publicado: May 14, 2026🔗 Source
Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais
Ad

Um usuário do Reddit lançou uma ferramenta de código aberto chamada personal_agent_eval (repositório: github.com/javiersgjavi/personal_agent_eval) para avaliar agentes OpenClaw em fluxos de trabalho realistas e bagunçados — e não em conjuntos de dados públicos de brinquedo.

Fluxo de Trabalho

Defina casos de teste como arquivos YAML contendo:

  • Mensagens de entrada
  • Artefatos esperados
  • Critérios de avaliação
  • Verificações determinísticas
  • Perfis de execução e perfis de julgamento

O executor processa os casos contra uma instância real do OpenClaw, armazena as saídas, avalia as execuções e gera relatórios e gráficos.

Funcionalidade Principal: Importação de Workspace Real

Você pode importar seu workspace real do OpenClaw — incluindo memória, habilidades, arquivos, prompts e contexto — em vez de uma imitação simplificada. O agente é executado em uma instância real do OpenClaw, testando exatamente o agente que você usa diariamente.

Conjuntos de Avaliação Privados

O autor explicitamente não publica seus conjuntos de avaliação privados para evitar que benchmarks públicos se tornem obsoletos. No entanto, o repositório inclui casos de exemplo, configurações, perfis de avaliação, verificações determinísticas e geração de gráficos para que você possa construir seu próprio conjunto privado.

Ad

SKILL.md para Assistência ao Agente

Um arquivo SKILL.md no repositório foi projetado para dar a um agente contexto suficiente para ajudá-lo a definir novos casos de benchmark, perfis de execução, critérios de avaliação e verificações determinísticas — reduzindo a edição manual.

Resultados de Amostra (Execução Privada do Autor)

O autor compartilhou uma comparação de execução única (métrica incerta, provavelmente média ponderada 0-10):

Claude Opus 4.6 - 9.44
GLM 5.1 - 9.31
GPT-5.5 - 9.31
Claude Sonnet 4.6 - 9.25
DeepSeek V4 Flash - 8.61
Gemma 4 31B - 8.39
DeepSeek V4 Pro - 8.28
Kimi K2.6 - 7.97

Mais interessantes do que as pontuações: os modos de falha. Alguns modelos raciocinam bem, mas são desajeitados com ferramentas; modelos mais baratos degradam em tarefas longas ou com estado; algumas falhas são comportamentais do modelo, outras são casos extremos do OpenClaw/ferramentas expostos pelo benchmark.

Para Quem É

Usuários do OpenClaw que executam agentes para trabalhos reais e desejam comparar modelos em suas próprias tarefas privadas, em vez de argumentar com base em sensações ou leaderboards genéricos.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Gerenciamento Automatizado do Estado da Sessão para o Claude Code Handoff
Tools

Gerenciamento Automatizado do Estado da Sessão para o Claude Code Handoff

Um projeto do GitHub fornece hooks automatizados para manter um arquivo de estado de sessão ativo (.claude/session-state.md) ao longo das conversas com Claude, abordando a perda de contexto por autocompactação e a degradação de contexto no meio da conversa. O sistema usa quatro scripts bash com jq para rastrear eventos importantes e edições de arquivos.

OpenClawRadar
Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Tools

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens

Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

OpenClawRadar
Agente Safehouse: Sandboxing nativo do macOS para agentes de IA de codificação local
Tools

Agente Safehouse: Sandboxing nativo do macOS para agentes de IA de codificação local

Agent Safehouse é uma ferramenta nativa de sandboxing para macOS que impede agentes de IA locais de acessar arquivos fora do diretório do seu projeto usando aplicação em nível de kernel. É um único script shell sem dependências que funciona com Claude Code, Codex, OpenCode, Amp, Gemini CLI, Aider, Goose, Auggie, Pi, Cursor Agent, Cline, Kilo, Code Droid e outros agentes.

OpenClawRadar
boxBot: Um Alto-Falante Inteligente de Código Aberto Alimentado por Claude e Hailo AI
Tools

boxBot: Um Alto-Falante Inteligente de Código Aberto Alimentado por Claude e Hailo AI

Um desenvolvedor criou uma caixa de som inteligente chamada boxBot usando Claude para controle de hardware orientado por agente, Raspberry Pi, acelerador de IA Hailo e SDK personalizado — código aberto no GitHub.

OpenClawRadar