Resultados de Benchmark para Modelos Locais Pequenos e do OpenRouter na Tarefa Agente de Texto para SQL

Um desenvolvedor publicou resultados de benchmark para modelos pequenos locais e do OpenRouter em uma tarefa de agente de texto para SQL. O benchmark pega consultas em inglês como "Mostre linhas de pedido, receita, unidades vendidas, receita por unidade (receita total ÷ unidades totais vendidas), preço médio de lista por produto na subcategoria, lucro bruto e porcentagem de margem para cada subcategoria de produto" e as converte para SQL que é testado contra tabelas de banco de dados.
Detalhes do Benchmark
O agente pode ver os resultados da consulta e modificar o SQL para corrigir problemas, com um limite de rodadas de depuração. O benchmark é deliberadamente curto com 25 perguntas e executa em muito menos de 5 minutos para a maioria dos modelos, tornando-o prático para testar diferentes configurações. Ele foi projetado para ser difícil o suficiente para separar os melhores modelos dos outros.
Principais Descobertas
- Os melhores modelos abertos identificados foram kimi-k2.5, Qwen 3.5 397B-A17B e Qwen 3.5 27B
- NVIDIA Nemotron-Cascade-2-30B-A3B supera Qwen 3.5-35B-A3B e iguala Codex 5.3
- Mimo v2 Flash foi descrito como "uma joia de modelo"
Opção de Auto-hospedagem
O benchmark agora inclui a capacidade de executá-lo você mesmo em seu próprio servidor usando a versão WASM do Llama.cpp. O desenvolvedor está buscando feedback sobre o que mudar para a versão 2 e quer ver as pontuações que outros obtêm com diferentes configurações.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also
mcp-memory: SQLite FTS5 + OKF do Google para Memória Rápida de Agentes
mcp-memory é um servidor MCP que dá aos agentes de IA memória persistente usando o formato OKF do Google e SQLite FTS5 para consultas em menos de 20ms. Inclui quatro ferramentas: memory_store, memory_retrieve, memory_search e memory_get_last.

Mneme: Um Cliente de Chat Claude Gratuito, Local e com Memória Persistente
Mneme é um cliente de chat gratuito, de código aberto e focado em privacidade local para Claude, com memória em camadas, rastreamento de entidades, resumos diários e suporte ao Sonnet 4.5 via API da Anthropic.

Recurso de Memória de Sessão Introduzido no Claude Code
Claude Code agora inclui um recurso de 'Memória de Sessão', gerando e mantendo resumos de sessão em arquivos summary.md. Desbloqueie-o com tweakcc para sessões interativas que excedam limites específicos de tokens e chamadas de ferramentas.

Benchmark Flash-MOE no M5 Max: 12.99 tok/s com Qwen3.5-397B
Um benchmark do modelo Qwen3.5 de 397 bilhões de parâmetros executado localmente em um MacBook Pro M5 Max com 128GB de RAM alcançou 12,99 tokens por segundo usando quantização de 4 bits e cache-io-split 4, três vezes mais rápido que o benchmark original de 48GB.