Feinabstimmung von Qwen 3:0.6B für Fragekategorisierung – Basislinie vs. verfeinerte Ergebnisse

Torgeir Helgevold hat eine praktische Anleitung zur Feinabstimmung von Qwen 3:0.6B zur Kategorisierung von Haushaltsfragen veröffentlicht. Ziel: den Vektorsuchraum durch Zuordnung von Fragen zu Kategorien wie hvac, pool und cooking vor dem RAG-Abruf zu verkleinern.
Baseline-Ergebnisse – Prompting ohne Feinabstimmung
Mit dem Standardmodell Qwen 3:0.6B und einem strengen Prompt („Nur den Kategorienamen aus der Liste zurückgeben“) wurden nur 13 von 131 Testfragen richtig beantwortet – 9,9 % Genauigkeit. Häufige Fehler: übermäßige Verwendung breiter Labels wie electric/appliances, Erfinden neuer Kategorien (z. B. apartments) und Rückgabe von null.
Einrichtung der Feinabstimmung
- Verwendete Modelle: Qwen 3:4B für allgemeine QA, Qwen 3:0.6B für Klassifikation
- Framework: Unsloth (Open Source, funktioniert mit Qwen und Llama)
- Datensatz: ~850 beschriftete Einträge – 70/15/15-Aufteilung für Training/Validierung/Test
- Beispieldaten:
{ "question": "Wann haben wir unsere Poolpumpe ausgetauscht?", "category": "pool" }, { "question": "Wer hat den Warmwasserbereiter für das Haus gewartet?", "category": "water heater" }
Wichtigste Erkenntnis
Ein 600-Millionen-Parameter-Modell kann mit ausreichend Trainingsdaten zu einem zuverlässigen Klassifikator für eine bestimmte Domäne feinabgestimmt werden. Der Beitrag deutet darauf hin, dass die Genauigkeit durch Feinabstimmung wahrscheinlich von 10 % auf 80-90 %+ steigt, was das winzige Modell als Vorverarbeitungsschritt für RAG-Systeme geeignet macht.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

100 Tipps zum Bau eines persönlichen KI-Agenten: Vom Cloud-Prototyp zur Produktion
Sechs Wochen Aufbau eines persistenten KI-Agenten – kein Chatbot-Wrapper –, der Aufgaben verwaltet, Deals verfolgt, E-Mails liest und Daten analysiert. Wichtige Lehren: Schreiben Sie eine Verfassung, keinen System-Prompt, verwenden Sie flache Markdown-Dateien für das Gedächtnis und versionieren Sie Ihre Identitätsdatei in Git.

Ihr LLM sollte nicht Ihr Codierungs-Agent-Workflow sein: Trennung der Zuständigkeiten in OpenClaw
Wenn Ihr Coding-Agent-Workflow stoppt, sobald Ihr LLM-Limit erreicht ist, übernimmt das LLM zu viel. Halten Sie Warteschlangen, Zustand, Wiederholungen und Verifikation deterministisch – rufen Sie das LLM nur für Urteilsvermögen auf.

Automatisierung der OAuth-Token-Aktualisierung für Bots mit Claude Code
Ein Reddit-Nutzer teilt eine Methode, um das Ablaufen von OAuth-Token zu verhindern, indem Claude Code so konfiguriert wird, dass die Token automatisch alle 8 Stunden aktualisiert werden. Dadurch laufen Bots kontinuierlich weiter, ohne dass manuell eingegriffen werden muss.

Claude Code Workflow Visual erklärt Speicherhierarchie und Fähigkeitensystem
Ein Reddit-Nutzer teilte ein visuelles Diagramm, das die Arbeitsablaufstruktur von Claude Code zeigt, einschließlich der Speicherschichtung mit CLAUDE.md-Dateien und wiederverwendbaren Fähigkeiten, die in .claude/skills/-Verzeichnissen definiert sind. Der Arbeitsablaufkreis schlägt vor, den Planmodus zu nutzen, Funktionen zu beschreiben, automatisch zu akzeptieren und häufig zu committen.