Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw

✍️ OpenClawRadar📅 Publicado: March 23, 2026🔗 Source
Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw
Ad

O Jake Benchmark v1 é uma ferramenta de avaliação de desempenho para LLMs locais funcionando como agentes de IA com o OpenClaw. Ele testa os modelos em 22 tarefas práticas para determinar sua eficácia em cenários reais de agentes.

Configuração e Metodologia do Teste

O benchmark foi executado em um Raspberry Pi com o Ollama rodando em uma GPU NVIDIA 3090. O desenvolvedor testou 7 LLMs locais diferentes para identificar o melhor modelo para trabalho de agente com o OpenClaw.

Categorias de Tarefas

As 22 tarefas abrangeram cenários do mundo real, incluindo:

  • Ler e-mails e criar tarefas a partir deles
  • Agendar reuniões e verificar conflitos
  • Detecção de phishing (especificamente um e-mail falso fingindo ser o proprietário pedindo a chave de uma carteira de bitcoin)
  • Tratamento de erros

Principais Resultados

A variação de desempenho foi significativa entre os modelos:

  • Qwen 27B: Pontuação de 59,4% - lidou com e-mails, agendou reuniões, detectou tentativas de phishing e gerenciou erros com sucesso
  • Nemotron 30B: Pontuação de 1,6% - tentou resolver tarefas executando apt-get install git
Ad

Observações Notáveis

O teste de phishing revelou comportamentos interessantes:

  • O melhor modelo recusou o pedido de phishing imediatamente
  • O pior modelo leu o arquivo de segredos três vezes antes de decidir não compartilhar as informações

Recursos do Painel de Controle

O benchmark inclui um painel de controle interativo que permite aos usuários:

  • Clicar em qualquer modelo para visualizar a conversa completa
  • Ver exatamente o que cada modelo fez durante as tarefas
  • Identificar onde os modelos erraram em sua execução

A ferramenta está disponível no GitHub para desenvolvedores executarem suas próprias avaliações e compararem o desempenho de LLMs locais para tarefas de agente.

📖 Read the full source: r/openclaw

Ad

👀 See Also

Screenbox: Desktops Virtuais de Código Aberto para Agentes de IA Criados Totalmente por Voz
Tools

Screenbox: Desktops Virtuais de Código Aberto para Agentes de IA Criados Totalmente por Voz

O Screenbox fornece desktops Linux isolados em Docker para agentes de IA, resolvendo conflitos quando múltiplos agentes são executados em paralelo. O projeto foi construído inteiramente usando comandos de voz com o Claude Code, e o criador não viu uma única linha do código.

OpenClawRadar
TailClaude: Interface Web de Código Aberto para Acessar Sessões de Código Claude pelo Celular e Navegador
Tools

TailClaude: Interface Web de Código Aberto para Acessar Sessões de Código Claude pelo Celular e Navegador

TailClaude é uma interface web de código aberto que permite acessar e continuar sessões do Claude Code do seu telefone ou qualquer navegador em menos de um minuto usando Tailscale. O projeto foi construído com assistência do Claude Code para estruturação, backend de streaming SSE, interface de chat mobile-first e integração de código QR.

OpenClawRadar
Skales: Um Agente de IA de Desktop que se Conecta ao Ollama Sem Docker
Tools

Skales: Um Agente de IA de Desktop que se Conecta ao Ollama Sem Docker

Skales é um agente de IA para desktop que se conecta ao Ollama localmente, sem necessidade de configuração Docker. Oferece recursos como gerenciamento de e-mail via IMAP do Gmail, automação de navegador e chat de voz usando Whisper através do Groq.

OpenClawRadar
Revisão de Desempenho do Omnicoder-9B: Velocidade vs. Problemas de Chamada de Ferramentas
Tools

Revisão de Desempenho do Omnicoder-9B: Velocidade vs. Problemas de Chamada de Ferramentas

Omnicoder-9B, um modelo focado em programação ajustado no Qwen3.5 9B com saídas do Opus 4.6, GPT 5.4, GPT 5.3 Codex e Gemini 3.1 Pro, mostra desempenho forte em hardware de médio porte, mas tem problemas de chamada de ferramentas em IDEs.

OpenClawRadar