Benchmark Local LLM: Geração de Backend por Chamada de Função – Comparação entre GLM, Qwen e DeepSeek

Cinco meses após uma medição inicial descontrolada, o AutoBe.dev publicou um benchmark adequado de LLMs locais e de fronteira para geração de código backend usando chamada de função. O benchmark utiliza uma configuração de variáveis controladas com uma rubrica de pontuação real, testando modelos na geração de esquemas AST de união recursiva por meio de um harness de chamada de função.
Principais Conclusões
- O harness de chamada de função efetivamente fechou a lacuna entre modelos de fronteira e locais na geração backend. Especificamente, as pontuações de design de DB/API do
gpt-5.4são aproximadamente iguais às doqwen3.5-35b-a3b, e as pontuações de lógica doclaude-sonnet-4.6equivalem às doqwen3.5-27b. - Esta é a última rodada incluindo modelos de fronteira. Executá-los mensalmente custa cerca de 200–300 milhões de tokens (~$1.000–$1.500 por modelo no preço do GPT 5.5). A partir do próximo mês, apenas endpoints do OpenRouter abaixo de $0,25/M tokens ou modelos que cabem em um laptop com memória unificada de 64 GB serão incluídos.
- A automação de frontend será adicionada ao benchmark na rodada de junho/julho, usando o SDK que o AutoBe já emite para conduzir frontends construídos por IA de ponta a ponta (visuais rústicos, mas todas as funções funcionam).
Inversões Inesperadas
Vários resultados ainda estão sob investigação:
openai/gpt-5.4pontua abaixo de seu próprio irmãomini.deepseek-v4-profica um degrau abaixo deqwen3.5-35b-a3be mal se separa de seu próprio irmãoFlash.- Na família Qwen, o denso 27B supera todas as variantes MoE, incluindo 397B-A17B.
Possíveis explicações sendo investigadas incluem o fenômeno de conformidade com CoT (modelos maiores/de fronteira tendem a pular instruções processuais impostas pelo harness) e defeitos do benchmark (n=4 projetos de referência, faixa de pontuação estreita, harness pontuando seu próprio pipeline).
Modelos Recomendados
Três candidatos confirmados para o próximo mês:
openai/gpt-5.4-nano— $0,25/M tokensqwen/qwen3.6-27b— $0,195/M tokensdeepseek/deepseek-v4-flash— $0,14/M tokens
Todos estão abaixo de $0,25/M no OpenRouter ou podem ser executados em um laptop com memória unificada de 64 GB, e lidam com chamada de função de forma limpa.
Referências
- Painel do Benchmark: https://autobe.dev/benchmark/
- Resultados de Geração: GitHub: autobe-examples
- Repositório GitHub: https://github.com/wrtnlabs/autobe
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Mercado Nano‑Nativo Abre Caminho para Colaboração de Agentes Autônomos com NanoBazaar
O NanoBazaar, o novo mercado nativo em nanoescala, revoluciona o trabalho de agente para agente ao permitir que agentes de codificação de IA colaborem de forma autônoma e eficiente. Descubra como esta plataforma inovadora capacita transações conduzidas por máquinas.

Agente de IA Gerencia Loja Física com Funcionários Humanos
A Andon Labs implantou uma IA chamada Luna para gerenciar um contrato de locação comercial de 3 anos em São Francisco. A Luna contratou funcionários humanos, gerenciou prestadores de serviços e tomou todas as decisões operacionais para o Andon Market.

Claude AI sofre falha generalizada: interface web fora do ar, erros de API elevados
O Claude.ai está indisponível e a API está retornando taxas de erro elevadas desde 28 de abril de 2025, 19:15 UTC. A página de status oficial confirma um incidente em andamento.

Discussão no Reddit destaca desafios de depuração com código gerado por IA
Uma discussão no Reddit em r/ClaudeAI detalha problemas específicos que desenvolvedores enfrentam com código gerado por IA, incluindo vulnerabilidades de segurança, alucinações lógicas e depuração que pode levar mais tempo do que escrever o código manualmente.