Affinage de Qwen 14B pour l'Autocomplétion Discord

Un développeur a partagé son expérience sur la façon dont il a affiné le modèle Qwen 14B pour qu'il fonctionne comme un outil de saisie automatique en utilisant ses messages Discord. Cette configuration ressemble étroitement à des outils comme GitHub Copilot, où des suggestions sont faites au fur et à mesure que vous tapez.
Le développeur a utilisé environ 250 conversations provenant de Discord, obtenues via un outil de scraping, comme jeu de données. Chaque conversation a été formatée en échantillons d'entraînement chat-ml, en se concentrant particulièrement sur les messages où l'utilisateur a dit quelque chose en dernier, sans blocs de code ni liens. Ce choix indique une focalisation sur le ton conversationnel plutôt que sur le contenu technique.
Le modèle Qwen 14B a été affiné en utilisant la plateforme unsloth.ai et QLoRA sur un GPU Kaggle, l'ensemble du processus d'entraînement ayant duré environ 15 minutes en raison de la petite taille du jeu de données. Ils ont ensuite fusionné le modèle affiné dans un format .gguf pour une utilisation locale via ollama.com.
L'interface de cet outil de saisie automatique est implémentée comme une extension Chrome. Elle capture les derniers messages et la saisie en cours de l'utilisateur pour construire une invite chat-ml avec le contexte approprié, qui est ensuite utilisée pour générer une complétion à partir du modèle fourni par Ollama. Un caractère Unicode de largeur nulle est astucieusement utilisé pour indiquer où commence la suggestion, tandis qu'appuyer sur shift+tab acceptera la suggestion.
La configuration actuelle est opérationnelle sur Discord, avec des extensions potentielles à l'avenir pour prendre en charge d'autres sites. Le développeur suggère également d'expérimenter avec différentes tailles de modèles, car le modèle actuel de 14B utilise presque au maximum la mémoire disponible. Ils proposent que les modèles de 4B ou 8B pourraient être des alternatives viables, bien qu'avec des limitations potentielles de données.
Le code source et d'autres détails sont disponibles sur le GitHub du développeur à github.com/b44ken/finetune.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Blindspot MCP : Un cerveau externe pour les agents d'IA de codage
Blindspot MCP est un outil qui indexe des bases de code complètes en utilisant tree-sitter et SQLite pour aider les agents d'IA de codage à comprendre les symboles, les dépendances et les relations entre les fichiers, empêchant ainsi les modifications qui cassent le code en dehors de leur contexte immédiat.

Compétence apple-music-play OpenClaw publiée sur ClawHub pour la recherche et la lecture Apple Music
La compétence apple-music-play publiée sur ClawHub permet de rechercher dans le catalogue en ligne d'Apple Music et de lire des morceaux directement dans l'application Musique de macOS, sans nécessiter que les chansons soient dans votre bibliothèque locale.

Système de mémoire persistante sans code pour Claude utilisant Notion et MCP
Un radiologue a construit un 'Hub Cognitif' dans Notion que Claude lit et écrit via MCP, créant une base de connaissances structurée avec une table de routage pour charger uniquement les informations pertinentes par conversation. Le système a atteint plus de 70 pages après un mois d'utilisation quotidienne.
Expérientiel : Passerelle de modèles open source avec routage intelligent
Experiential est une passerelle open source qui unifie les modèles hébergés, BYOK et locaux. Elle route le trafic en fonction du coût/qualité à l'aide de déploiements simulés et de traces OTel, avec un surcoût de moins de 1 ms pour les requêtes BYOK.