Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais

✍️ OpenClawRadar📅 Publicado: May 14, 2026🔗 Source
Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais
Ad

Um usuário do Reddit lançou uma ferramenta de código aberto chamada personal_agent_eval (repositório: github.com/javiersgjavi/personal_agent_eval) para avaliar agentes OpenClaw em fluxos de trabalho realistas e bagunçados — e não em conjuntos de dados públicos de brinquedo.

Fluxo de Trabalho

Defina casos de teste como arquivos YAML contendo:

  • Mensagens de entrada
  • Artefatos esperados
  • Critérios de avaliação
  • Verificações determinísticas
  • Perfis de execução e perfis de julgamento

O executor processa os casos contra uma instância real do OpenClaw, armazena as saídas, avalia as execuções e gera relatórios e gráficos.

Funcionalidade Principal: Importação de Workspace Real

Você pode importar seu workspace real do OpenClaw — incluindo memória, habilidades, arquivos, prompts e contexto — em vez de uma imitação simplificada. O agente é executado em uma instância real do OpenClaw, testando exatamente o agente que você usa diariamente.

Conjuntos de Avaliação Privados

O autor explicitamente não publica seus conjuntos de avaliação privados para evitar que benchmarks públicos se tornem obsoletos. No entanto, o repositório inclui casos de exemplo, configurações, perfis de avaliação, verificações determinísticas e geração de gráficos para que você possa construir seu próprio conjunto privado.

Ad

SKILL.md para Assistência ao Agente

Um arquivo SKILL.md no repositório foi projetado para dar a um agente contexto suficiente para ajudá-lo a definir novos casos de benchmark, perfis de execução, critérios de avaliação e verificações determinísticas — reduzindo a edição manual.

Resultados de Amostra (Execução Privada do Autor)

O autor compartilhou uma comparação de execução única (métrica incerta, provavelmente média ponderada 0-10):

Claude Opus 4.6 - 9.44
GLM 5.1 - 9.31
GPT-5.5 - 9.31
Claude Sonnet 4.6 - 9.25
DeepSeek V4 Flash - 8.61
Gemma 4 31B - 8.39
DeepSeek V4 Pro - 8.28
Kimi K2.6 - 7.97

Mais interessantes do que as pontuações: os modos de falha. Alguns modelos raciocinam bem, mas são desajeitados com ferramentas; modelos mais baratos degradam em tarefas longas ou com estado; algumas falhas são comportamentais do modelo, outras são casos extremos do OpenClaw/ferramentas expostos pelo benchmark.

Para Quem É

Usuários do OpenClaw que executam agentes para trabalhos reais e desejam comparar modelos em suas próprias tarefas privadas, em vez de argumentar com base em sensações ou leaderboards genéricos.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

osu-mcp: Um Servidor MCP que Permite ao Claude Analisar suas Estatísticas do osu! em Inglês Simples
Tools

osu-mcp: Um Servidor MCP que Permite ao Claude Analisar suas Estatísticas do osu! em Inglês Simples

osu-mcp é um servidor MCP para a API v2 do osu!, agora no Registro MCP oficial. Ele expõe 12 ferramentas para perfis de jogadores, histórico de pontuações, busca de beatmaps, rankings e mais. Uma demonstração mostrou Claude calculando eficiência pp por jogada em contas para revelar que o volume, não a precisão, era o gargalo.

OpenClawRadar
Sistema de Anticorpos: Watchdog Fora de Banda para Agentes OpenClaw
Tools

Sistema de Anticorpos: Watchdog Fora de Banda para Agentes OpenClaw

O Sistema Anticorpo é um watchdog de código aberto que opera em uma máquina separada e monitora agentes OpenClaw via SSH, implementando respostas escalonadas desde a detecção até a recuperação do serviço. Ele foi projetado para sobreviver a falhas que derrubam o agente principal.

OpenClawRadar
Holisto Seed: Um Framework LLM Local com Identidade Persistente e Consolidação de Memória Consensual
Tools

Holisto Seed: Um Framework LLM Local com Identidade Persistente e Consolidação de Memória Consensual

Holisto Seed é um Framework de Individuação Relacional que dá aos agentes LLM identidade persistente, memória biográfica e relacionamentos coevolutivos com os usuários. Ele roda totalmente local com um sistema de versionamento baseado em Git e possui um ciclo de sono consensual para consolidação de memória.

OpenClawRadar
Agentes Alternativos de IA para Codificação Após a Remoção do Plano do Claude
Tools

Agentes Alternativos de IA para Codificação Após a Remoção do Plano do Claude

Um usuário do Reddit testou várias alternativas de agentes de IA para programação após a descontinuação do plano de programação do Claude, incluindo Kimi (US$ 20/mês), Minimax (US$ 10/mês), Z.AI GLM (US$ 10/mês), Stepfun (US$ 6-10/mês), Mistral (US$ 15/mês) e Arcee Trinity (baseado em API).

OpenClawRadar