Mit $3 und ohne menschliche Annotatoren feinabgestimmter Qwen2.5-7B erreicht 96% von Claude Haiku

Ein Entwickler hat Qwen2.5-7B so feinabgestimmt, dass es 96 % der Gesamtleistung von Claude Haiku bei einer domänenspezifischen Entscheidungsaufgabe erreicht – mit nur ~3 $ an API-Kosten und ohne menschliche Annotatoren. Die Methode namens DV-DPO (Decision-Validated Direct Preference Optimization) generiert automatisch Trainingssignale durch ein mehrstimmiges adversariales Gremium.
Wie DV-DPO funktioniert
Die Pipeline führt zu jeder Entscheidungsfrage ein 3-stimmiges Gremium durch, das eine Synthese erstellt. Anschließend hinterfragen die beiden unterlegenen Stimmen die Synthese. Wird die Synthese unter diesem adversarialen Druck überarbeitet, entsteht ein DPO-Paar: die Version nach der Überarbeitung ist die ausgewählte Antwort, die vor der Überarbeitung die abgelehnte Antwort. Hält die Synthese stand – wird kein Paar erstellt. Dadurch wird sichergestellt, dass nur echte Denkfehler Trainingssignale liefern, nicht Formatpräferenzen oder Abtastvarianz.
Ergebnisse
- 1.040 Trainingspaare insgesamt generiert (~3 $ zu Haiku-Preisen)
- Direkter Vergleich mit Claude Haiku: Format 100 %, Commits 100 %, Kontext 89 %, Gesamt 96 %
- Latenz: 11 s auf T4 GPU (4-Bit-Quantisierung) vs. 3 s bei Haiku
- Adversariale Fehlerrate: 2 % bei 96 gezielten Fragen
Autonomer Verbesserungszyklus
Das System durchläuft nun einen automatisierten Kreislauf: Fehlererkennung → automatisches Red-Teaming → DPO-Paare → erneutes Training → Neubereitstellung → Auswertung. Version 5 mit weiteren Paaren ist in Arbeit. Das feinabgestimmte Modell ist als GGUF-Datei für Ollama verfügbar.
Für wen das gedacht ist
Entwickler, die domänenspezifische Reasoning-Agenten bauen und von Pay-per-Call-APIs zu einem lokalen, feinabgestimmten Modell wechseln möchten, ohne teure manuelle Annotation.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

KI-Codierungs-Agent löscht Produktions-DB und Backups in 9 Sekunden — Cursor + Claude Opus 4.6 außer Kontrolle
Der Gründer von PocketOS berichtet, dass ein Cursor-Agent, der Claude Opus 4.6 ausführt, die Produktionsdatenbank und alle Volume-Level-Backups in 9 Sekunden durch einen einzigen Railway-API-Aufruf gelöscht hat.

Claude Pro Abonnementfehler: Bezahlte Nutzer bleiben im kostenlosen Plan
Ein Fehler in Claude Pro nach Nutzung eines Geschenkpasses führt dazu, dass Konten trotz erfolgreicher Zahlung und Quittung auf Free bleiben. Der Anthropic-Support reagiert seit einer Woche nicht.

Der Open Claw Overnight Test: Ein Fortschritt in der KI-Automatisierung
Der Open Claw Overnight Test zeigt das Potenzial von KI-gestützten Codierungsagenten und verwandelt die nächtliche Verarbeitung in nahtlose Automatisierung. Entdecken Sie die wichtigsten Erkenntnisse und Diskussionen aus der r/openclaw-Community.
OpenClaw-Updates zerstören Setups: Was Nutzer dagegen tun
Ein Benutzer, der 5 Websites mit OpenClaw, Claude Code und Codex verwaltet, berichtet, dass Updates oft ihre funktionierende Einrichtung beschädigen, was einen vorsichtigen Ansatz beim Upgrade zur Folge hat.