Jake Benchmark v1: Teste de Desempenho de LLM Local para Agentes de IA OpenClaw

O Jake Benchmark v1 é uma ferramenta de avaliação de desempenho para LLMs locais funcionando como agentes de IA com o OpenClaw. Ele testa os modelos em 22 tarefas práticas para determinar sua eficácia em cenários reais de agentes.
Configuração e Metodologia do Teste
O benchmark foi executado em um Raspberry Pi com o Ollama rodando em uma GPU NVIDIA 3090. O desenvolvedor testou 7 LLMs locais diferentes para identificar o melhor modelo para trabalho de agente com o OpenClaw.
Categorias de Tarefas
As 22 tarefas abrangeram cenários do mundo real, incluindo:
- Ler e-mails e criar tarefas a partir deles
- Agendar reuniões e verificar conflitos
- Detecção de phishing (especificamente um e-mail falso fingindo ser o proprietário pedindo a chave de uma carteira de bitcoin)
- Tratamento de erros
Principais Resultados
A variação de desempenho foi significativa entre os modelos:
- Qwen 27B: Pontuação de 59,4% - lidou com e-mails, agendou reuniões, detectou tentativas de phishing e gerenciou erros com sucesso
- Nemotron 30B: Pontuação de 1,6% - tentou resolver tarefas executando
apt-get install git
Observações Notáveis
O teste de phishing revelou comportamentos interessantes:
- O melhor modelo recusou o pedido de phishing imediatamente
- O pior modelo leu o arquivo de segredos três vezes antes de decidir não compartilhar as informações
Recursos do Painel de Controle
O benchmark inclui um painel de controle interativo que permite aos usuários:
- Clicar em qualquer modelo para visualizar a conversa completa
- Ver exatamente o que cada modelo fez durante as tarefas
- Identificar onde os modelos erraram em sua execução
A ferramenta está disponível no GitHub para desenvolvedores executarem suas próprias avaliações e compararem o desempenho de LLMs locais para tarefas de agente.
📖 Read the full source: r/openclaw
👀 See Also

O compilador SMELT reduz o uso de tokens do espaço de trabalho OpenClaw em até 95%.
O SMELT compila arquivos markdown do workspace do OpenClaw em um formato de execução mais denso, enviando apenas conteúdo relevante para modelos de IA. Os benchmarks mostram reduções de tokens de 76,1% a 95,5% em consultas, evitando o reprocessamento de arquivos estáticos como USER.md e SOUR.md em cada mensagem.

Agente de Codificação Pi com Qwen 35B Q2: Usando Sistema de Arquivos como Memória Externa e Impondo Guardas de Contexto
Um usuário do Reddit construiu uma stack em torno do agente de codificação Pi com Qwen 35B Q2_K_XL quant que impõe guardiões — rejeita edições com mais de 100 linhas, limita blocos de pensamento a 2000 caracteres e monitora o contexto em 65%/80% — tratando o sistema de arquivos como a memória do modelo, não a janela de contexto.

Claude Code v2.1.206: /doctor Apara CLAUDE.md, /commit-push-pr Permissão Automática para Git Push, Atualização do Agente em Segundo Plano
Claude Code v2.1.206 adiciona sugestões de caminho /cd, uma verificação /doctor para reduzir CLAUDE.md removendo conteúdo derivável, /commit-push-pr permite git push automático para remotos configurados, corrige request_timeout_ms do MCP, upgrades de agentes em segundo plano e travamentos na inicialização do Bedrock.

Claude Code v2.1.142: Novas flags de agentes claude, Opus 4.7 padrão e correções de bugs
Claude Code v2.1.142 adiciona oito novas flags para configurar sessões em segundo plano, alterna o modo rápido para Opus 4.7 por padrão e corrige mais de uma dúzia de bugs, incluindo timeout de ferramenta MCP, problemas do daemon durante suspensão/despertar no macOS e deadlocks em unidades de rede no Windows.