Steelman R5: Modelo de 14B Ajustado Supera o Claude Opus na Geração de Código Ada

Detalhes do Modelo e Treinamento
O modelo Steelman R5 é uma versão ajustada do Qwen2.5-Coder-14B-Instruct especificamente otimizada para geração de código Ada. O treinamento utilizou QLoRA 4-bit via Unsloth com TRL SFTTrainer em um conjunto de dados de 3.430 pares de instruções Ada/SPARK, onde cada exemplo de treinamento passa pela compilação gnatmake -gnat2022 -gnatwa.
Configuração do treinamento: LoRA rank 32, alpha 64, visando projeções q/k/v/o/gate/up/down. O modelo foi totalmente retreinado a partir da base a cada rodada no conjunto de dados acumulado (a continuação do adaptador causou esquecimento catastrófico na R2). O treinamento rodou por 1 época com taxa de aprendizado 2e-5, programação constante, levando cerca de 49 minutos por rodada em um H100 alugado. Cinco rodadas no total (R1–R5), com R2 descartada.
Resultados do Benchmark
Benchmark Personalizado de Compilação Ada (1.000 prompts, primeira tentativa de compilação limpa):
- Steelman R5 (14B): 68,6% taxa de compilação
- Claude Opus 4.6: 42,1% taxa de compilação
- Claude Sonnet 4.6: 37,2% taxa de compilação
- Qwen2.5-Coder-14B (base, não ajustado): ~35% taxa de compilação
- Claude Sonnet 4: 27,5% taxa de compilação
MultiPL-E HumanEval-Ada (157 problemas, pass@1):
- Steelman R5: 47,1% pass@1, 74,5% taxa de compilação
- Qwen2.5-Coder-14B (base): 34,4% pass@1, 51,0% taxa de compilação
Estes são os primeiros resultados pass@1 em Ada no HumanEval publicados para qualquer modelo aberto.
Uso e Disponibilidade
Execute o modelo com: ollama run hf.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
A versão GGUF cabe em 12GB de VRAM com quantização Q4_K_M.
Limitações
- Compilação ≠ correção: 68,6% compilam, mas apenas 47,1% produzem saída correta no HumanEval
- A capacidade de correção de erros é fraca (5,1%) - não espere que ele depure código Ada
- Contratos SPARK compilam, mas não são verificados com gnatprove
- Dados de treinamento gerados sinteticamente - nenhum desenvolvedor humano de Ada escreveu esses exemplos
- Tamanho do modelo 14B significa que ele pode perder coisas que um modelo maior capturaria
Recursos
- Modelo: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1
- GGUF: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
- Conjunto de dados: https://huggingface.co/datasets/the-clanker-lover/steelman-sft-ada
📖 Read the full source: r/LocalLLaMA
👀 See Also
Netlify testa 11 modelos de IA para codificação: Qual é o melhor?
A Netlify executou prompts de codificação idênticos em 11 modelos de IA, revelando grandes diferenças nos resultados e custos de créditos. Veja o que descobriram antes de escolher seu próximo agente de codificação.

Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça
Freddy é um servidor MCP pessoal que conecta wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, além de WHOOP, Strava, Dexcom em beta) a clientes de IA como Claude Code, ChatGPT e Notion AI via OAuth. O novo login sem interface permite fluxos de trabalho agendados para agentes autônomos.

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

StarSteady: Respostas de Google Reviews e Solicitações de SMS Impulsionadas por IA para Empresas Locais
StarSteady é um SaaS criado por um único desenvolvedor que gera respostas com IA para avaliações do Google/Yelp e envia solicitações de avaliação por SMS para clientes, a partir de US$ 39/mês com teste gratuito de 5 respostas/5 SMS.