Lokale Feinabstimmung von Llama 3.2-1B zur Geheimniserkennung übertrifft Wizs Modell

Ein Entwickler hat seine erfolgreiche lokale Feinabstimmung von Llama 3.2-1B für die Geheimniserkennung in Code dokumentiert und dabei die Metriken eines ähnlichen Modells von Wiz übertroffen. Das Projekt wurde vollständig mit lokalen KI-Tools durchgeführt, ohne proprietäre APIs zu nutzen.
Wichtige Ergebnisse und Vorgehensweise
Der Entwickler wollte die Ergebnisse von Wiz von 86 % Präzision und 82 % Recall replizieren oder übertreffen. Nach einigen Wochenenden Arbeit erreichte er gleichzeitig 88 % Präzision und 84,4 % Recall mit einem feinabgestimmten Llama 3.2-1B-Modell. Er testete auch Qwen 3.5-2B- und 4B-Modelle, die das 1B-Modell übertrafen, jedoch mit höherem VRAM-Verbrauch und längeren Inferenzzeiten.
Datensatz und Trainingsprozess
Die Arbeit stützte sich ausschließlich auf öffentlich verfügbare Daten, die unzureichend waren, daher wurde prozedurale Generierung verwendet, um den Datensatz zu erweitern und zu verbessern. Alle Kennzeichnungen wurden lokal mit dem Qwen3-Coder-Next-Modell durchgeführt. Ein wichtiges Trainingsziel war, dass die Modelle strukturiertes JSON ausgeben. Anfangs erzielten ungeschulte Modelle (Llama & Qwen) 0 % bei der Schema-Konformität, aber nach dem Training verbesserte sich dies auf 98–100 %.
Herausforderungen und Erkenntnisse
Der Entwickler stieß während des Prozesses auf mehrere Probleme:
- Eine Klasse mit hoher Entropie, die dem Training schadete, wurde identifiziert und entfernt.
- Es wurde festgestellt, dass 4.500 der 'negativen' Beispiele im Datensatz tatsächlich reale Passwörter enthielten, was bedeutete, dass das Modell darauf trainiert wurde, Geheimnisse zu ignorieren. Die Behebung dieses Problems verbesserte den Recall bei Passwörtern.
Der Entwickler hat einen vollständigen technischen Bericht mit Trainingsstatistiken, Beispielen und einer schrittweisen Aufschlüsselung des Prozesses veröffentlicht.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lehren aus dem Betrieb von 14 KI-Agenten in der Produktion: Organisatorische Lücken, nicht technische Fehler
Eine digitale Marketingagentur, die 14 KI-Agenten für den täglichen Betrieb einsetzt, stellte fest, dass bei Ausfällen der Agenten das Problem fast nie bei den Agenten selbst liegt, sondern im organisatorischen Umfeld. Sie entwickelten ein Organisatorisches Betriebssystem (OOS) und ein Tool namens OTP, um strukturelle Lücken zu identifizieren, und verbesserten so ihren Koordinationswert von 68 auf 91 von 100 Punkten.

Warum KI Ihre Entwicklungsprozesse nicht beschleunigt – Fokus auf Engpässe
Frederick Vanbrabant argumentiert, dass KI Softwareprozesse nicht automatisch beschleunigt, solange man nicht vorgelagerte Engpässe wie vage Anforderungen behebt, veranschaulicht mit Gantt-Diagrammen und einem tiefen Einblick in 'The Goal' und 'The Toyota Way'.

Verwenden einer VM mit OpenClaw für direkten Dateizugriff und schnellere Iteration
Das Ausführen von OpenClaw in einer virtuellen Maschine ermöglicht es Entwicklern, Projektdateien wie AGENTS.md und HEARTBEAT.md direkt anzuzeigen, zu lesen und zu bearbeiten, anstatt ausschließlich über Chat-Oberflächen zu arbeiten. Dieser Ansatz beschleunigt Iterationszyklen erheblich.

Forge-Agent behebt GitHub-Fehler autonomos mit Claude AI
Ein Forge-Agent eines Entwicklers erkannte einen GitHub-Fehlerbericht, löste eine Pipeline aus, nutzte Claude AI zur Analyse und Behebung des Problems und eröffnete einen PR – alles ohne menschliches Eingreifen, während der Entwickler schlief.