O Benchmark OpenClaw Mostra que o Qwen3.5:27B Supera Outros LLMs Locais em Tarefas de Agente

✍️ OpenClawRadar📅 Publicado: March 28, 2026🔗 Source
O Benchmark OpenClaw Mostra que o Qwen3.5:27B Supera Outros LLMs Locais em Tarefas de Agente
Ad

Configuração e Resultados do Benchmark

Um usuário testou 7 modelos locais em 22 tarefas reais de agentes usando OpenClaw em um Raspberry Pi 5 com uma RTX 3090 executando Ollama. As tarefas incluíram ler e-mails, agendar reuniões, criar tarefas, detectar phishing, lidar com erros e automação de navegador.

O vencedor por uma margem enorme foi qwen3.5:27b-q4_K_M com 59,4%. O segundo colocado (qwen3.5:35b) marcou apenas 23,2%. Todos os outros modelos marcaram abaixo de 5%.

Ad

Principais Descobertas

  • O modelo quantizado de 27B superou a versão maior de 35B em 2,5x
  • Um modelo de 30B ficou em último lugar com 1,6%
  • O pensamento médio funcionou melhor - pensar demais na verdade prejudicou o desempenho
  • Nenhum modelo conseguiu completar tarefas de automação de navegador
  • O principal diferencial entre vencedores e perdedores foi se o modelo conseguia encontrar e usar ferramentas de linha de comando
  • A maioria dos modelos não conseguiu nem encontrar ferramentas básicas como a função de e-mail

Este benchmark fornece dados concretos sobre como diferentes LLMs locais se comportam como agentes de IA em cenários práticos. A diferença significativa de desempenho entre o modelo superior e os outros sugere que a capacidade de encontrar ferramentas é um gargalo crítico para agentes de LLM locais.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also