Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw

✍️ OpenClawRadar📅 Publicado: March 23, 2026🔗 Source
Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw
Ad

O Jake Benchmark v1 é uma ferramenta de avaliação de desempenho para LLMs locais funcionando como agentes de IA com o OpenClaw. Ele testa os modelos em 22 tarefas práticas para determinar sua eficácia em cenários reais de agentes.

Configuração e Metodologia do Teste

O benchmark foi executado em um Raspberry Pi com o Ollama rodando em uma GPU NVIDIA 3090. O desenvolvedor testou 7 LLMs locais diferentes para identificar o melhor modelo para trabalho de agente com o OpenClaw.

Categorias de Tarefas

As 22 tarefas abrangeram cenários do mundo real, incluindo:

  • Ler e-mails e criar tarefas a partir deles
  • Agendar reuniões e verificar conflitos
  • Detecção de phishing (especificamente um e-mail falso fingindo ser o proprietário pedindo a chave de uma carteira de bitcoin)
  • Tratamento de erros

Principais Resultados

A variação de desempenho foi significativa entre os modelos:

  • Qwen 27B: Pontuação de 59,4% - lidou com e-mails, agendou reuniões, detectou tentativas de phishing e gerenciou erros com sucesso
  • Nemotron 30B: Pontuação de 1,6% - tentou resolver tarefas executando apt-get install git
Ad

Observações Notáveis

O teste de phishing revelou comportamentos interessantes:

  • O melhor modelo recusou o pedido de phishing imediatamente
  • O pior modelo leu o arquivo de segredos três vezes antes de decidir não compartilhar as informações

Recursos do Painel de Controle

O benchmark inclui um painel de controle interativo que permite aos usuários:

  • Clicar em qualquer modelo para visualizar a conversa completa
  • Ver exatamente o que cada modelo fez durante as tarefas
  • Identificar onde os modelos erraram em sua execução

A ferramenta está disponível no GitHub para desenvolvedores executarem suas próprias avaliações e compararem o desempenho de LLMs locais para tarefas de agente.

📖 Read the full source: r/openclaw

Ad

👀 See Also

TradesMCP: Servidor MCP de Código Aberto para Verificação de Licença de Contratante e Dados de Construção
Tools

TradesMCP: Servidor MCP de Código Aberto para Verificação de Licença de Contratante e Dados de Construção

TradesMCP é um servidor Model Context Protocol de código aberto que fornece ao Claude acesso a dados reais de licenças de contratantes, autorizações de construção, preços de materiais e taxas de mão de obra. A ferramenta verificou corretamente uma licença ativa de contratante na Califórnia, enquanto o ChatGPT retornou informações incorretas.

OpenClawRadar
Geração de SVG com Arnês de Loop Fechado Qwen3.6-27B
Tools

Geração de SVG com Arnês de Loop Fechado Qwen3.6-27B

Um circuito fechado usando agentes Agno e Pi melhora iterativamente as saídas SVG do Qwen3.6-27B renderizando, realimentando PNGs para o Qwen Vision e avaliando resultados em duas rodadas.

OpenClawRadar
Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown
Tools

Espaço de Estados: Crie Aplicativos Web Interativos para Agentes OpenClaw com Markdown

Statespace é uma estrutura gratuita e de código aberto para criar e compartilhar aplicativos web amigáveis para IA que agentes OpenClaw podem navegar e interagir usando Markdown puro. Permite definir ferramentas, componentes e instruções em arquivos Markdown que os agentes acessam via HTTP.

OpenClawRadar
Plugins essenciais do OpenClaw para desenvolvedores que usam agentes de IA para codificação
Tools

Plugins essenciais do OpenClaw para desenvolvedores que usam agentes de IA para codificação

Um desenvolvedor testou plugins do OpenClaw e identificou ferramentas essenciais, incluindo env-guard para segurança, commit-guard para evitar commits ruins, composio para conexão com mais de 860 ferramentas, cortex-memory para sessões longas, cost-tracker para visibilidade de gastos e openclaw-better-gateway para corrigir conexões instáveis.

OpenClawRadar