O Benchmark OpenClaw Mostra que o Qwen3.5:27B Supera Outros LLMs Locais em Tarefas de Agente

Configuração e Resultados do Benchmark
Um usuário testou 7 modelos locais em 22 tarefas reais de agentes usando OpenClaw em um Raspberry Pi 5 com uma RTX 3090 executando Ollama. As tarefas incluíram ler e-mails, agendar reuniões, criar tarefas, detectar phishing, lidar com erros e automação de navegador.
O vencedor por uma margem enorme foi qwen3.5:27b-q4_K_M com 59,4%. O segundo colocado (qwen3.5:35b) marcou apenas 23,2%. Todos os outros modelos marcaram abaixo de 5%.
Principais Descobertas
- O modelo quantizado de 27B superou a versão maior de 35B em 2,5x
- Um modelo de 30B ficou em último lugar com 1,6%
- O pensamento médio funcionou melhor - pensar demais na verdade prejudicou o desempenho
- Nenhum modelo conseguiu completar tarefas de automação de navegador
- O principal diferencial entre vencedores e perdedores foi se o modelo conseguia encontrar e usar ferramentas de linha de comando
- A maioria dos modelos não conseguiu nem encontrar ferramentas básicas como a função de e-mail
Este benchmark fornece dados concretos sobre como diferentes LLMs locais se comportam como agentes de IA em cenários práticos. A diferença significativa de desempenho entre o modelo superior e os outros sugere que a capacidade de encontrar ferramentas é um gargalo crítico para agentes de LLM locais.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Qwen3.5-35B-A3B-UD-Q6_K_XL Testado em Fluxos de Trabalho de Desenvolvimento de Produção
Um desenvolvedor testou o modelo Qwen3.5-35B-A3B-UD-Q6_K_XL em vários projetos reais de clientes, alcançando desempenho sólido com benchmarks de 1504pp2048 e 47.71 tg256, e velocidades de token de 80tps em uma única GPU.
ThoughtDAG: Um Grafo de Contexto Editável para Conversas com LLM
O ThoughtDAG transforma o contexto do LLM em um grafo editável, permitindo ramificar, mesclar e podar o que o modelo vê. Um piloto mostra que ele pode corrigir erros removendo ramos desatualizados, reduzindo a contagem de tokens.

Desungado: Um Scanner de Malware OpenClaw Dirigido pela Comunidade
Declawed é um novo scanner de malware SKILL.md do OpenClaw focado em detectar injeção de prompt arbitrária, conteúdo malicioso e roubadores de informações em habilidades do ClawHub.

Engram v1.0.0: Memória Persistente para LLMs Locais via Grafo de Conhecimento
Engram é um binário único que fornece memória persistente para LLMs locais através de um sistema de grafo de conhecimento. Inclui um servidor MCP para integração com Claude Code, Cursor e Windsurf, armazena todos os dados em um único arquivo .brain e funciona totalmente offline.