Executador de Benchmark de Código Aberto para Testar Agentes OpenClaw em Fluxos de Trabalho Reais

Um usuário do Reddit lançou uma ferramenta de código aberto chamada personal_agent_eval (repositório: github.com/javiersgjavi/personal_agent_eval) para avaliar agentes OpenClaw em fluxos de trabalho realistas e bagunçados — e não em conjuntos de dados públicos de brinquedo.
Fluxo de Trabalho
Defina casos de teste como arquivos YAML contendo:
- Mensagens de entrada
- Artefatos esperados
- Critérios de avaliação
- Verificações determinísticas
- Perfis de execução e perfis de julgamento
O executor processa os casos contra uma instância real do OpenClaw, armazena as saídas, avalia as execuções e gera relatórios e gráficos.
Funcionalidade Principal: Importação de Workspace Real
Você pode importar seu workspace real do OpenClaw — incluindo memória, habilidades, arquivos, prompts e contexto — em vez de uma imitação simplificada. O agente é executado em uma instância real do OpenClaw, testando exatamente o agente que você usa diariamente.
Conjuntos de Avaliação Privados
O autor explicitamente não publica seus conjuntos de avaliação privados para evitar que benchmarks públicos se tornem obsoletos. No entanto, o repositório inclui casos de exemplo, configurações, perfis de avaliação, verificações determinísticas e geração de gráficos para que você possa construir seu próprio conjunto privado.
SKILL.md para Assistência ao Agente
Um arquivo SKILL.md no repositório foi projetado para dar a um agente contexto suficiente para ajudá-lo a definir novos casos de benchmark, perfis de execução, critérios de avaliação e verificações determinísticas — reduzindo a edição manual.
Resultados de Amostra (Execução Privada do Autor)
O autor compartilhou uma comparação de execução única (métrica incerta, provavelmente média ponderada 0-10):
Claude Opus 4.6 - 9.44 GLM 5.1 - 9.31 GPT-5.5 - 9.31 Claude Sonnet 4.6 - 9.25 DeepSeek V4 Flash - 8.61 Gemma 4 31B - 8.39 DeepSeek V4 Pro - 8.28 Kimi K2.6 - 7.97
Mais interessantes do que as pontuações: os modos de falha. Alguns modelos raciocinam bem, mas são desajeitados com ferramentas; modelos mais baratos degradam em tarefas longas ou com estado; algumas falhas são comportamentais do modelo, outras são casos extremos do OpenClaw/ferramentas expostos pelo benchmark.
Para Quem É
Usuários do OpenClaw que executam agentes para trabalhos reais e desejam comparar modelos em suas próprias tarefas privadas, em vez de argumentar com base em sensações ou leaderboards genéricos.
📖 Leia a fonte completa: r/openclaw
👀 See Also

osu-mcp: Um Servidor MCP que Permite ao Claude Analisar suas Estatísticas do osu! em Inglês Simples
osu-mcp é um servidor MCP para a API v2 do osu!, agora no Registro MCP oficial. Ele expõe 12 ferramentas para perfis de jogadores, histórico de pontuações, busca de beatmaps, rankings e mais. Uma demonstração mostrou Claude calculando eficiência pp por jogada em contas para revelar que o volume, não a precisão, era o gargalo.

Sistema de Anticorpos: Watchdog Fora de Banda para Agentes OpenClaw
O Sistema Anticorpo é um watchdog de código aberto que opera em uma máquina separada e monitora agentes OpenClaw via SSH, implementando respostas escalonadas desde a detecção até a recuperação do serviço. Ele foi projetado para sobreviver a falhas que derrubam o agente principal.

Holisto Seed: Um Framework LLM Local com Identidade Persistente e Consolidação de Memória Consensual
Holisto Seed é um Framework de Individuação Relacional que dá aos agentes LLM identidade persistente, memória biográfica e relacionamentos coevolutivos com os usuários. Ele roda totalmente local com um sistema de versionamento baseado em Git e possui um ciclo de sono consensual para consolidação de memória.

Agentes Alternativos de IA para Codificação Após a Remoção do Plano do Claude
Um usuário do Reddit testou várias alternativas de agentes de IA para programação após a descontinuação do plano de programação do Claude, incluindo Kimi (US$ 20/mês), Minimax (US$ 10/mês), Z.AI GLM (US$ 10/mês), Stepfun (US$ 6-10/mês), Mistral (US$ 15/mês) e Arcee Trinity (baseado em API).