Resultados de Benchmark para Modelos Locais Pequenos e do OpenRouter na Tarefa Agente de Texto para SQL

Um desenvolvedor publicou resultados de benchmark para modelos pequenos locais e do OpenRouter em uma tarefa de agente de texto para SQL. O benchmark pega consultas em inglês como "Mostre linhas de pedido, receita, unidades vendidas, receita por unidade (receita total ÷ unidades totais vendidas), preço médio de lista por produto na subcategoria, lucro bruto e porcentagem de margem para cada subcategoria de produto" e as converte para SQL que é testado contra tabelas de banco de dados.
Detalhes do Benchmark
O agente pode ver os resultados da consulta e modificar o SQL para corrigir problemas, com um limite de rodadas de depuração. O benchmark é deliberadamente curto com 25 perguntas e executa em muito menos de 5 minutos para a maioria dos modelos, tornando-o prático para testar diferentes configurações. Ele foi projetado para ser difícil o suficiente para separar os melhores modelos dos outros.
Principais Descobertas
- Os melhores modelos abertos identificados foram kimi-k2.5, Qwen 3.5 397B-A17B e Qwen 3.5 27B
- NVIDIA Nemotron-Cascade-2-30B-A3B supera Qwen 3.5-35B-A3B e iguala Codex 5.3
- Mimo v2 Flash foi descrito como "uma joia de modelo"
Opção de Auto-hospedagem
O benchmark agora inclui a capacidade de executá-lo você mesmo em seu próprio servidor usando a versão WASM do Llama.cpp. O desenvolvedor está buscando feedback sobre o que mudar para a versão 2 e quer ver as pontuações que outros obtêm com diferentes configurações.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

PocketBot: IA compila automações para JavaScript para agendamento determinístico e econômico
O PocketBot aborda problemas de custo de API e hardware compilando solicitações em linguagem natural em scripts JavaScript autônomos que são executados em agendamentos sem chamadas de LLM durante a execução. A ferramenta usa IA apenas uma vez para escrever o código, depois executa deterministicamente com mais de 20 integrações incluindo Google Suite, Slack e Notion.

Claude Code v2.1.176: Sessões com consciência de idioma, cache de credenciais do Bedrock e dezenas de correções
Títulos de sessão agora correspondem ao idioma da conversa; credenciais Bedrock armazenadas em cache até a expiração; correção de bypass na aplicação do modelo para /fast e variáveis de ambiente; correções no clipboard do tmux; correção de link simbólico no sandbox.

Analisando Ferramentas de Codificação com IA: Dissecando 3.177 Chamadas de API
Uma análise técnica de 3.177 chamadas de API revela como quatro ferramentas de codificação com IA gerenciam janelas de contexto, expondo ineficiências e variações.

Apresentando Aionic Anthology: Uma Estrutura para Organizar as Tarefas de IA do Claude
O framework Aionic Anthology organiza as tarefas de IA do Claude separando o contexto em categorias e adicionando um sistema de avaliação de risco para melhorar a execução das tarefas.