Steelman R5: Modelo de 14B Ajustado Supera o Claude Opus na Geração de Código Ada

✍️ OpenClawRadar📅 Publicado: March 13, 2026🔗 Source
Steelman R5: Modelo de 14B Ajustado Supera o Claude Opus na Geração de Código Ada
Ad

Detalhes do Modelo e Treinamento

O modelo Steelman R5 é uma versão ajustada do Qwen2.5-Coder-14B-Instruct especificamente otimizada para geração de código Ada. O treinamento utilizou QLoRA 4-bit via Unsloth com TRL SFTTrainer em um conjunto de dados de 3.430 pares de instruções Ada/SPARK, onde cada exemplo de treinamento passa pela compilação gnatmake -gnat2022 -gnatwa.

Configuração do treinamento: LoRA rank 32, alpha 64, visando projeções q/k/v/o/gate/up/down. O modelo foi totalmente retreinado a partir da base a cada rodada no conjunto de dados acumulado (a continuação do adaptador causou esquecimento catastrófico na R2). O treinamento rodou por 1 época com taxa de aprendizado 2e-5, programação constante, levando cerca de 49 minutos por rodada em um H100 alugado. Cinco rodadas no total (R1–R5), com R2 descartada.

Resultados do Benchmark

Benchmark Personalizado de Compilação Ada (1.000 prompts, primeira tentativa de compilação limpa):

  • Steelman R5 (14B): 68,6% taxa de compilação
  • Claude Opus 4.6: 42,1% taxa de compilação
  • Claude Sonnet 4.6: 37,2% taxa de compilação
  • Qwen2.5-Coder-14B (base, não ajustado): ~35% taxa de compilação
  • Claude Sonnet 4: 27,5% taxa de compilação

MultiPL-E HumanEval-Ada (157 problemas, pass@1):

  • Steelman R5: 47,1% pass@1, 74,5% taxa de compilação
  • Qwen2.5-Coder-14B (base): 34,4% pass@1, 51,0% taxa de compilação

Estes são os primeiros resultados pass@1 em Ada no HumanEval publicados para qualquer modelo aberto.

Ad

Uso e Disponibilidade

Execute o modelo com: ollama run hf.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF

A versão GGUF cabe em 12GB de VRAM com quantização Q4_K_M.

Limitações

  • Compilação ≠ correção: 68,6% compilam, mas apenas 47,1% produzem saída correta no HumanEval
  • A capacidade de correção de erros é fraca (5,1%) - não espere que ele depure código Ada
  • Contratos SPARK compilam, mas não são verificados com gnatprove
  • Dados de treinamento gerados sinteticamente - nenhum desenvolvedor humano de Ada escreveu esses exemplos
  • Tamanho do modelo 14B significa que ele pode perder coisas que um modelo maior capturaria

Recursos

  • Modelo: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1
  • GGUF: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
  • Conjunto de dados: https://huggingface.co/datasets/the-clanker-lover/steelman-sft-ada

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Netlify testa 11 modelos de IA para codificação: Qual é o melhor?

A Netlify executou prompts de codificação idênticos em 11 modelos de IA, revelando grandes diferenças nos resultados e custos de créditos. Veja o que descobriram antes de escolher seu próximo agente de codificação.

OpenClawRadar
Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça
Tools

Servidor MCP Freddy Conecta Wearables a Agentes de IA com Login Sem Cabeça

Freddy é um servidor MCP pessoal que conecta wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, além de WHOOP, Strava, Dexcom em beta) a clientes de IA como Claude Code, ChatGPT e Notion AI via OAuth. O novo login sem interface permite fluxos de trabalho agendados para agentes autônomos.

OpenClawRadar
Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Tools

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens

Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

OpenClawRadar
StarSteady: Respostas de Google Reviews e Solicitações de SMS Impulsionadas por IA para Empresas Locais
Tools

StarSteady: Respostas de Google Reviews e Solicitações de SMS Impulsionadas por IA para Empresas Locais

StarSteady é um SaaS criado por um único desenvolvedor que gera respostas com IA para avaliações do Google/Yelp e envia solicitações de avaliação por SMS para clientes, a partir de US$ 39/mês com teste gratuito de 5 respostas/5 SMS.

OpenClawRadar