Feinabstimmung von Qwen 14B für die Discord-Autovervollständigung

Ein Entwickler hat seine Erfahrungen geteilt, wie er das Qwen 14B Modell angepasst hat, um als Autocomplete-Tool zu fungieren, das auf seinen Discord-Nachrichten basiert. Diese Konfiguration ähnelt Tools wie GitHub Copilot, wo Vorschläge gemacht werden, während man tippt.
Der Entwickler verwendete etwa 250 Gespräche, die von Discord stammen und über ein Scraping-Tool gewonnen wurden, als Datensatz. Jedes Gespräch wurde als chat-ml Trainingsbeispiel formatiert, wobei der Schwerpunkt auf Nachrichten lag, in denen der Benutzer zuletzt etwas gesagt hat, ohne Code-Blöcke oder Links. Diese Wahl zeigt eine Fokus auf einen konversationellen Ton anstelle von technischem Inhalt.
Das Qwen 14B Modell wurde auf der unsloth.ai Plattform und QLoRA auf einem Kaggle-GPU feinabgestimmt, wobei der gesamte Trainingsprozess aufgrund der kleinen Datensatzgröße etwa 15 Minuten dauerte. Anschließend wurde das angepasste Modell in ein .gguf Format für die lokale Nutzung über ollama.com zusammengeführt.
Das Frontend dieses Autocomplete-Tools ist als Chrome-Erweiterung implementiert. Es erfasst die letzten paar Nachrichten und die laufende Eingabe des Benutzers, um einen chat-ml Prompt mit dem angemessenen Kontext zu erstellen, der dann verwendet wird, um eine Vervollständigung vom bereitgestellten Modell von Ollama zu generieren. Ein Null-Breite-Unicode-Zeichen wird clever verwendet, um anzuzeigen, wo der Vorschlag beginnt, während das Drücken von shift+tab den Vorschlag akzeptiert.
Die aktuelle Konfiguration ist auf Discord funktionsfähig, mit potenziellen zukünftigen Erweiterungen zur Unterstützung anderer Seiten. Der Entwickler schlägt auch vor, mit verschiedenen Modellgrößen zu experimentieren, da das derzeitige 14B Modell den verfügbaren Speicher fast maximal nutzt. Er schlägt vor, dass 4B oder 8B Modelle praktikable Alternativen sein könnten, wenn auch mit möglichen Datenbeschränkungen.
Der Quellcode und weitere Details sind auf dem GitHub des Entwicklers unter github.com/b44ken/finetune verfügbar.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Alternative KI-Coding-Agenten nach der Entfernung von Claudes Plan
Ein Reddit-Nutzer testete mehrere KI-Coding-Agent-Alternativen, nachdem Claude seinen Coding-Plan eingestellt hatte, darunter Kimi (20 $/Monat), Minimax (10 $/Monat), Z.AI GLM (10 $/Monat), Stepfun (6-10 $/Monat), Mistral (15 $/Monat) und Arcee Trinity (API-basiert).

Parallele Coding-Agenten mit tmux und Markdown-Spezifikationen
Manuel Schipper beschreibt ein System zum Betrieb von 4-8 parallelen Coding-Agenten mit tmux, Markdown-Dateien, Bash-Aliases und sechs Slash-Befehlen. Das Setup nutzt Feature-Design (FD)-Markdown-Spezifikationen, die durch einen 8-stufigen Lebenszyklus verfolgt werden.

Die Super Claude-Browsererweiterung macht die Claude.ai-Benutzeroberfläche vollständig anpassbar.
Ein Entwickler hat eine Browsererweiterung erstellt, mit der Nutzer jeden Aspekt der Claude.ai-Oberfläche anpassen können – Farben, Schriftarten, Layout, plus Nutzungsverfolgung und Token-Zählung. Die Erweiterung funktioniert auf Chrome und Firefox und wurde mit Claude selbst entwickelt.

Fullerene: Open-Source-Persistenzspeicherschicht für Codierungsagenten reduziert Tokens um 64 % auf SWE-Bench
Fullerenes nutzt eine lokale SQLite-Wissensdatenbank, die über Tree-sitter aufgebaut wird, um KI-Coding-Agenten wie Claude Code einen persistenten Speicher zu geben. Dadurch wird der Tokenverbrauch bei SWE-bench um 64 % und bei internen Benchmarks um bis zu 96,6 % reduziert.