Selbstüberwachtes Feintuning an eigenen Fehlern steigert kleine Modelle auf 80 % bei HumanEval

✍️ OpenClawRadar📅 Veröffentlicht: 15. Mai 2026🔗 Source
Selbstüberwachtes Feintuning an eigenen Fehlern steigert kleine Modelle auf 80 % bei HumanEval
Ad

Ein Entwickler auf r/LocalLLaMA implementierte eine selbstüberwachte Trainingsschleife, bei der ein kleines Sprachmodell eigene Codierungsprobleme generiert, Lösungen versucht und auf den Paaren feinabstimmt, bei denen der Interpreter die Korrektheit bestätigt. Die entscheidende Erkenntnis aus dem DeepSeek-R1-Papier – dass Modelle sich durch überprüfbare Belohnungen verbessern können – wurde ohne menschlich gekennzeichnete Daten angewendet.

Methode

Das Basismodell (ausgehend von Qwen 2.5 7B) wurde aufgefordert, ein Codierungsproblem und ein paar kleine Tests zu erfinden. Anschließend löste es dasselbe Problem mehrmals. Der Python-Interpreter fungierte als einziger Richter: Paare aus (fehlgeschlagener Versuch, funktionierender Versuch) wurden gespeichert. Die Feinabstimmung erfolgte auf diesen selbstermittelten Korrekturen. Es wurde kein von Menschen geschriebener Code im Training verwendet.

Ergebnisse

  • Qwen 2.5 7B Basis: 25 → 112 auf HumanEval (+87 Probleme) nach der Behebung eines Grader-Fehlers, der Funktionsausgaben abschnitt.
  • Qwen 2.5 14B: 100 Paare abgebaut, in 95 Minuten auf einer H100 trainiert (3,50 $ an Credits). Erreichte innerhalb von 4 Punkten der RLHF-Version desselben Unternehmens.
  • Llama 3.2 3B: 32 Paare → 39 → 43 auf HumanEval. Bestätigt Übertragbarkeit über Architekturen hinweg.
  • Qwen 2.5 Coder 7B: Bereits auf Code spezialisiert, dennoch verbessert: HumanEval 83 → 87, MBPP 122 → 124.
  • Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Ad

Kontrollexperiment

Um zu überprüfen, ob das Signal nicht aus generischem Training stammte, erstellte der Autor gefälschte Paare mit zufälligem Müllcode, der keine Tests bestand. Das Training darauf ergab keine Steigerung (25/164, wie die Basis). Die Verbesserung stammt spezifisch aus dem Lernen an selbstgenerierten Fehlern und Korrekturen.

Praktische Details

Der erste Versuch schlug fehl, weil der Grader früh stoppte und die Modellausgaben halbierte. Die Behebung des Graders war entscheidend. Der gesamte Aufbau lief auf einem 24GB MacBook und einem RunPod-Konto. Der Code und die Trainingsskripte wurden vermutlich im Reddit-Beitrag geteilt.

Für wen es gedacht ist

Entwickler und Forscher, die mit kleinen Sprachmodellen arbeiten und Code-Reasoning ohne menschliche Annotationen bootstrappen möchten.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Qwen3.6-27B passt auf eine einzelne 24-GB-GPU, schlägt das frühere 397B MoE auf SWE-bench
Nachrichten

Qwen3.6-27B passt auf eine einzelne 24-GB-GPU, schlägt das frühere 397B MoE auf SWE-bench

Qwen3.6-27B (Apache 2.0, 262K Kontext) läuft mit Q4_K_M in ~16,8 GB und erreicht SWE-bench Verified 77,2 – übertrifft das Qwen3.5-397B-A17B MoE (76,2). Verwendet Gated DeltaNet lineare Aufmerksamkeit mit Thinking Preservation für Agenten-Workflows.

OpenClawRadar
Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken
Nachrichten

Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken

Qwen 3.6 27B (FP8, BF16 KV-Cache, 262k Kontext) erreichte 2% bei DeepSWE in 70 Stunden. Die Ausgabetoken betrugen durchschnittlich 44k pro Aufgabe – vergleichbar mit größeren Modellen wie Qwen 3.6 Plus. Ausgeführt auf 1x RTX6000 Pro Blackwell über RunPod.

OpenClawRadar
KV-Cache-Architektur-Evolution: Von GPT-2 bis Mamba
Nachrichten

KV-Cache-Architektur-Evolution: Von GPT-2 bis Mamba

Eine Analyse der KV-Cache-Speicherkosten zeigt, dass GPT-2 300 KiB/Token verwendete, Llama 3 sie mit gruppierter Abfrage-Aufmerksamkeit auf 128 KiB/Token reduzierte und DeepSeek V3 mit latenter Multi-Head-Aufmerksamkeit 68,6 KiB/Token erreichte. Mamba/SSMs eliminieren den KV-Cache vollständig durch feste Hidden States.

OpenClawRadar
Amazon-Mitarbeiter erfinden Beschäftigungstherapie, um KI-Nutzungsquoten zu erfüllen
Nachrichten

Amazon-Mitarbeiter erfinden Beschäftigungstherapie, um KI-Nutzungsquoten zu erfüllen

Um interne Vorgaben zur Einführung von KI-Tools zu erfüllen, erfinden Amazon-Mitarbeiter Aufgaben, blähen Nutzungsstatistiken auf und manipulieren Metriken – ein Zeichen für eine fehlerhafte Umsetzung von KI-Einführungsrichtlinien.

OpenClawRadar