GLM-5-Turbo Apresenta Baixa Taxa de Erro em Chamadas de Ferramentas em Testes com Usuários

O modelo z-ai/glm-5-turbo está mostrando desempenho promissor para aplicações de chamada de ferramentas, de acordo com testes de usuários compartilhados no r/LocalLLaMA.
Resultados de Benchmark
Os testes indicam que o modelo alcança uma taxa de erro em chamadas de ferramentas muito baixa, de 0,57% em média. Isso representa uma melhoria significativa em relação ao modelo padrão GLM-5, que apresenta aproximadamente 3% de taxa de erro - tornando o GLM-5-turbo cerca de 6 vezes mais preciso para tarefas de chamada de ferramentas.
Quando comparado com modelos de outros provedores:
- Os modelos da Anthropic variam de 0,38% a 0,93%, com média de 0,67%
- Os modelos da Amazon Bedrock variam de 1,48% a 1,76%, com média de 1,63%
- Os modelos do Google Vertex variam de 0,99% a 2,62%, com média de 1,93%
Aplicação Prática
Um usuário testou o GLM-5-turbo com uma nova ferramenta CLI para escrever romances de fantasia e relatou melhorias substanciais em relação aos modelos anteriores. Com o GLM-5 padrão, a ferramenta era "um pouco instável quando se tratava de algo não inglês, e aleatoriamente não sabia qual comando usar corretamente em comparação com a solicitação do usuário".
Usando o GLM-5-turbo (plano Max), o usuário escreveu com sucesso 97.000 palavras com "sem instabilidade, sem travessões, capítulos conectados e as chamadas de ferramentas foram quase sempre feitas corretamente". O modelo suporta especificamente o OpenClaw bem, de acordo com a fonte.
Considerações de Uso
A fonte sugere que o GLM-5-turbo pode ser adequado para projetos paralelos que exigem assistência de codificação, mas alerta que para projetos de produção que requerem fatores mais estáveis, "parece não ser a escolha certa". O usuário também mencionou considerar o uso do NemoClaw com GLM-5-turbo em uma configuração de homelab em vez do OpenClaw.
Os dados iniciais de uso no Openrouter mostram bons números para os primeiros 100B tokens, embora métricas específicas não tenham sido fornecidas na fonte.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Gemma4 26B-A4B Oferece Desempenho Local Rápido com Suporte a Busca na Web e Imagens
O modelo gemma-4-26B-A4B alcança aproximadamente 145 tokens por segundo em uma RTX 4090 e inclui suporte a pesquisa na web MCP e imagens para aplicativos de chat. Um post de blog detalha a configuração e uso multiplataforma em Mac e iPhone.

SLayer: Uma Camada Semântica Open-Source para Agentes de IA que Aprende com Consultas
SLayer é uma camada semântica leve e incorporável que permite que agentes de IA consultem bancos de dados, gerenciem modelos e aprendam com interações via MCP, REST, CLI ou Python.
MTP + Memória Unificada Aumenta Inferência do llama.cpp em 30% na RTX 5090
Ativar a especulação MTP junto com GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 eleva o Qwen3.6-27B Q8_0 de 49 para 64 tok/seg em uma RTX 5090 com 128 GB de RAM do sistema.

Configurando OpenClaw com Aluguel de GPU VAST.AI para Prompts Ilimitados do Ollama
Um usuário descreve a combinação do aluguel de GPU da VAST.AI com Ollama e OpenClaw para contornar os limites de prompts, mas encontrou desafios de configuração que exigiram edição manual de JSON.