Steelman R5: Feinabgestimmtes 14B-Modell übertrifft Claude Opus bei der Ada-Codegenerierung

✍️ OpenClawRadar📅 Veröffentlicht: 13. März 2026🔗 Source
Steelman R5: Feinabgestimmtes 14B-Modell übertrifft Claude Opus bei der Ada-Codegenerierung
Ad

Modell- und Trainingsdetails

Das Steelman-R5-Modell ist eine feinabgestimmte Version von Qwen2.5-Coder-14B-Instruct, die speziell für die Ada-Codegenerierung optimiert wurde. Das Training nutzte QLoRA 4-Bit über Unsloth mit TRL SFTTrainer auf einem Datensatz von 3.430 Ada/SPARK-Instruktionspaaren, wobei jedes Trainingsbeispiel die Kompilierung mit gnatmake -gnat2022 -gnatwa bestand.

Trainingskonfiguration: LoRA-Rang 32, Alpha 64, Zielprojektionen q/k/v/o/gate/up/down. Das Modell wurde in jeder Runde vollständig von der Basis aus auf dem akkumulierten Datensatz neu trainiert (Adapterfortsetzung verursachte katastrophales Vergessen bei R2). Das Training lief für 1 Epoche mit einer Lernrate von 2e-5 und konstantem Zeitplan und dauerte etwa 49 Minuten pro Runde auf einer gemieteten H100. Insgesamt fünf Runden (R1–R5), wobei R2 verworfen wurde.

Benchmark-Ergebnisse

Benutzerdefinierter Ada-Kompilierungs-Benchmark (1.000 Prompts, erstmalige saubere Kompilierung):

  • Steelman R5 (14B): 68,6 % Kompilierungsrate
  • Claude Opus 4.6: 42,1 % Kompilierungsrate
  • Claude Sonnet 4.6: 37,2 % Kompilierungsrate
  • Qwen2.5-Coder-14B (Basis, nicht abgestimmt): ~35 % Kompilierungsrate
  • Claude Sonnet 4: 27,5 % Kompilierungsrate

MultiPL-E HumanEval-Ada (157 Probleme, pass@1):

  • Steelman R5: 47,1 % pass@1, 74,5 % Kompilierungsrate
  • Qwen2.5-Coder-14B (Basis): 34,4 % pass@1, 51,0 % Kompilierungsrate

Dies sind die ersten veröffentlichten Ada-pass@1-Ergebnisse auf HumanEval für ein Open-Source-Modell.

Ad

Verwendung und Verfügbarkeit

Führen Sie das Modell aus mit: ollama run hf.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF

Die GGUF-Version benötigt mit Q4_K_M-Quantisierung 12 GB VRAM.

Einschränkungen

  • Kompilierung ≠ Korrektheit: 68,6 % kompilieren, aber nur 47,1 % erzeugen korrekte Ausgaben auf HumanEval
  • Fehlerbehebungsfähigkeit ist schwach (5,1 %) – erwarten Sie nicht, dass es Ada-Code debuggen kann
  • SPARK-Verträge kompilieren, werden aber nicht mit gnatprove verifiziert
  • Synthetisch generierte Trainingsdaten – keine menschlichen Ada-Entwickler haben diese Beispiele geschrieben
  • 14B-Modellgröße bedeutet, dass es Dinge übersehen könnte, die ein größeres Modell erfassen würde

Ressourcen

  • Modell: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1
  • GGUF: https://huggingface.co/the-clanker-lover/steelman-14b-ada-v0.1-GGUF
  • Datensatz: https://huggingface.co/datasets/the-clanker-lover/steelman-sft-ada

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

RTX 5060 Ti 16GB Lokale LLM-Benchmarks: 30B-Modelle liegen beim Programmieren immer noch vorn
Werkzeuge

RTX 5060 Ti 16GB Lokale LLM-Benchmarks: 30B-Modelle liegen beim Programmieren immer noch vorn

Benchmarks auf einer RTX 5060 Ti 16GB zeigen, dass Unsloth Qwen3-Coder-30B UD-Q3_K_XL unter Ubuntu 76,3 Tok/s bei einer Qualitätsbewertung von 8,14 erreicht, was es zum empfohlenen Standard-Codemodell macht. Das Unsloth Qwen3.5-35B UD-Q2_K_XL erreicht 80,1 Tok/s, jedoch mit niedrigeren Qualitätsbewertungen.

OpenClawRadar
Linki v2: Open-Source KI-SDR für LinkedIn + Kaltmails mit selbst gehostetem Agenten
Werkzeuge

Linki v2: Open-Source KI-SDR für LinkedIn + Kaltmails mit selbst gehostetem Agenten

Linki v2 ist ein selbst gehostetes Tool zur LinkedIn-Automatisierung und Kaltakquise per E-Mail mit einem KI-Agenten, der personalisierte Nachrichten für jeden Lead verfasst. Keine Pro-Platz-Lizenzgebühren, Ihre Daten bleiben lokal.

OpenClawRadar
Vibeyard IDE fügt eingebetteten Browser für direkte Web-UI-Bearbeitung mit KI-Agenten hinzu.
Werkzeuge

Vibeyard IDE fügt eingebetteten Browser für direkte Web-UI-Bearbeitung mit KI-Agenten hinzu.

Vibeyard, eine Open-Source-IDE für KI-Coding-Agenten, enthält jetzt einen Browser-Tab-Session-Typ, mit dem Benutzer Elemente in einer Web-UI anklicken und einen KI-Agenten anweisen können, sie direkt zu bearbeiten, wodurch das Raten von Selektoren und die Suche nach Komponenten entfällt.

OpenClawRadar
OpenClaws AWS-Bereitstellung: Ein Fokus auf Automatisierung
Werkzeuge

OpenClaws AWS-Bereitstellung: Ein Fokus auf Automatisierung

Das Tool von OpenClaw ermöglicht eine Ein-Klick-Bereitstellung auf AWS und vereinfacht die Cloud-Operationen für Entwickler, die KI-Coding-Agenten nutzen.

OpenClawRadar