Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw

O Jake Benchmark v1 é uma ferramenta de avaliação de desempenho para LLMs locais funcionando como agentes de IA com o OpenClaw. Ele testa os modelos em 22 tarefas práticas para determinar sua eficácia em cenários reais de agentes.
Configuração e Metodologia do Teste
O benchmark foi executado em um Raspberry Pi com o Ollama rodando em uma GPU NVIDIA 3090. O desenvolvedor testou 7 LLMs locais diferentes para identificar o melhor modelo para trabalho de agente com o OpenClaw.
Categorias de Tarefas
As 22 tarefas abrangeram cenários do mundo real, incluindo:
- Ler e-mails e criar tarefas a partir deles
- Agendar reuniões e verificar conflitos
- Detecção de phishing (especificamente um e-mail falso fingindo ser o proprietário pedindo a chave de uma carteira de bitcoin)
- Tratamento de erros
Principais Resultados
A variação de desempenho foi significativa entre os modelos:
- Qwen 27B: Pontuação de 59,4% - lidou com e-mails, agendou reuniões, detectou tentativas de phishing e gerenciou erros com sucesso
- Nemotron 30B: Pontuação de 1,6% - tentou resolver tarefas executando
apt-get install git
Observações Notáveis
O teste de phishing revelou comportamentos interessantes:
- O melhor modelo recusou o pedido de phishing imediatamente
- O pior modelo leu o arquivo de segredos três vezes antes de decidir não compartilhar as informações
Recursos do Painel de Controle
O benchmark inclui um painel de controle interativo que permite aos usuários:
- Clicar em qualquer modelo para visualizar a conversa completa
- Ver exatamente o que cada modelo fez durante as tarefas
- Identificar onde os modelos erraram em sua execução
A ferramenta está disponível no GitHub para desenvolvedores executarem suas próprias avaliações e compararem o desempenho de LLMs locais para tarefas de agente.
📖 Read the full source: r/openclaw
👀 See Also

TradesMCP: Servidor MCP de Código Aberto para Verificação de Licença de Contratante e Dados de Construção
TradesMCP é um servidor Model Context Protocol de código aberto que fornece ao Claude acesso a dados reais de licenças de contratantes, autorizações de construção, preços de materiais e taxas de mão de obra. A ferramenta verificou corretamente uma licença ativa de contratante na Califórnia, enquanto o ChatGPT retornou informações incorretas.

Geração de SVG com Arnês de Loop Fechado Qwen3.6-27B
Um circuito fechado usando agentes Agno e Pi melhora iterativamente as saídas SVG do Qwen3.6-27B renderizando, realimentando PNGs para o Qwen Vision e avaliando resultados em duas rodadas.

Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown
Statespace é uma estrutura gratuita e de código aberto para criar e compartilhar aplicativos web amigáveis para IA que agentes OpenClaw podem navegar e interagir usando Markdown puro. Permite definir ferramentas, componentes e instruções em arquivos Markdown que os agentes acessam via HTTP.

Plugins essenciais do OpenClaw para desenvolvedores que usam agentes de IA para codificação
Um desenvolvedor testou plugins do OpenClaw e identificou ferramentas essenciais, incluindo env-guard para segurança, commit-guard para evitar commits ruins, composio para conexão com mais de 860 ferramentas, cortex-memory para sessões longas, cost-tracker para visibilidade de gastos e openclaw-better-gateway para corrigir conexões instáveis.