O Benchmark OpenClaw Mostra que o Qwen3.5:27B Supera Outros LLMs Locais em Tarefas de Agente

✍️ OpenClawRadar📅 Publicado: March 28, 2026🔗 Source
O Benchmark OpenClaw Mostra que o Qwen3.5:27B Supera Outros LLMs Locais em Tarefas de Agente
Ad

Configuração e Resultados do Benchmark

Um usuário testou 7 modelos locais em 22 tarefas reais de agentes usando OpenClaw em um Raspberry Pi 5 com uma RTX 3090 executando Ollama. As tarefas incluíram ler e-mails, agendar reuniões, criar tarefas, detectar phishing, lidar com erros e automação de navegador.

O vencedor por uma margem enorme foi qwen3.5:27b-q4_K_M com 59,4%. O segundo colocado (qwen3.5:35b) marcou apenas 23,2%. Todos os outros modelos marcaram abaixo de 5%.

Ad

Principais Descobertas

  • O modelo quantizado de 27B superou a versão maior de 35B em 2,5x
  • Um modelo de 30B ficou em último lugar com 1,6%
  • O pensamento médio funcionou melhor - pensar demais na verdade prejudicou o desempenho
  • Nenhum modelo conseguiu completar tarefas de automação de navegador
  • O principal diferencial entre vencedores e perdedores foi se o modelo conseguia encontrar e usar ferramentas de linha de comando
  • A maioria dos modelos não conseguiu nem encontrar ferramentas básicas como a função de e-mail

Este benchmark fornece dados concretos sobre como diferentes LLMs locais se comportam como agentes de IA em cenários práticos. A diferença significativa de desempenho entre o modelo superior e os outros sugere que a capacidade de encontrar ferramentas é um gargalo crítico para agentes de LLM locais.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Traduzir para pt: Atualizações do Prompt do Sistema Claude Code v2.1.76: Refinamentos do Monitor de Segurança e Novo Evento de Hook
Tools

Traduzir para pt: Atualizações do Prompt do Sistema Claude Code v2.1.76: Refinamentos do Monitor de Segurança e Novo Evento de Hook

Claude Code v2.1.76 inclui atualizações nos prompts do sistema com 43 novos tokens, apresentando refinamentos no monitor de segurança para agentes autônomos e a adição de um evento de hook PostCompact. As mudanças incluem detecção de dados sensíveis esclarecida, exemplos expandidos de desserialização de código e formatação aprimorada para orientações sobre destruição local irreversível.

OpenClawRadar
Resultados do PinchBench: Primeiro Benchmark Específico para Agentes de IA de Codificação OpenClaw
Tools

Resultados do PinchBench: Primeiro Benchmark Específico para Agentes de IA de Codificação OpenClaw

O primeiro benchmark específico do OpenClaw, PinchBench, classifica 32 modelos de IA por taxa de sucesso, custo e velocidade, com o Google Gemini-3-Flash-Preview liderando com 95,1% de sucesso por US$ 0,72.

OpenClawRadar
Graphify: Uma habilidade do Claude Code que construiu um grafo de conhecimento do seu repositório — 450 mil downloads, 40 mil estrelas em 26 dias
Tools

Graphify: Uma habilidade do Claude Code que construiu um grafo de conhecimento do seu repositório — 450 mil downloads, 40 mil estrelas em 26 dias

Graphify é uma habilidade do Claude Code que lê todos os arquivos do seu repositório, constrói um grafo de conhecimento com detecção de comunidades Leiden e o consulta usando 71x menos tokens do que arquivos brutos. Mais de 450 mil downloads no PyPI, ~40 mil estrelas no GitHub, #2 no ranking global na primeira semana.

OpenClawRadar
AgenteStore MCP: Kit de Ferramentas Python para Claude Desktop com 27 Ferramentas Locais
Tools

AgenteStore MCP: Kit de Ferramentas Python para Claude Desktop com 27 Ferramentas Locais

AgenticStore MCP é um kit de ferramentas Python de código aberto que substitui múltiplos servidores MCP por uma única instalação, fornecendo ao Claude Desktop 27 ferramentas locais, incluindo memória persistente, busca na web e auditoria de repositórios, sem exigir configuração de Docker ou Node.js.

OpenClawRadar