Affinage de Qwen 14B pour l'Autocomplétion Discord

Un développeur a partagé son expérience sur la façon dont il a affiné le modèle Qwen 14B pour qu'il fonctionne comme un outil de saisie automatique en utilisant ses messages Discord. Cette configuration ressemble étroitement à des outils comme GitHub Copilot, où des suggestions sont faites au fur et à mesure que vous tapez.
Le développeur a utilisé environ 250 conversations provenant de Discord, obtenues via un outil de scraping, comme jeu de données. Chaque conversation a été formatée en échantillons d'entraînement chat-ml, en se concentrant particulièrement sur les messages où l'utilisateur a dit quelque chose en dernier, sans blocs de code ni liens. Ce choix indique une focalisation sur le ton conversationnel plutôt que sur le contenu technique.
Le modèle Qwen 14B a été affiné en utilisant la plateforme unsloth.ai et QLoRA sur un GPU Kaggle, l'ensemble du processus d'entraînement ayant duré environ 15 minutes en raison de la petite taille du jeu de données. Ils ont ensuite fusionné le modèle affiné dans un format .gguf pour une utilisation locale via ollama.com.
L'interface de cet outil de saisie automatique est implémentée comme une extension Chrome. Elle capture les derniers messages et la saisie en cours de l'utilisateur pour construire une invite chat-ml avec le contexte approprié, qui est ensuite utilisée pour générer une complétion à partir du modèle fourni par Ollama. Un caractère Unicode de largeur nulle est astucieusement utilisé pour indiquer où commence la suggestion, tandis qu'appuyer sur shift+tab acceptera la suggestion.
La configuration actuelle est opérationnelle sur Discord, avec des extensions potentielles à l'avenir pour prendre en charge d'autres sites. Le développeur suggère également d'expérimenter avec différentes tailles de modèles, car le modèle actuel de 14B utilise presque au maximum la mémoire disponible. Ils proposent que les modèles de 4B ou 8B pourraient être des alternatives viables, bien qu'avec des limitations potentielles de données.
Le code source et d'autres détails sont disponibles sur le GitHub du développeur à github.com/b44ken/finetune.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

altRAG : Remplacez la base de données vectorielle RAG par des fichiers pointeurs de 2 Ko pour les agents d'IA de codage
altRAG est un outil Python qui remplace la RAG de base de données vectorielle par des fichiers de pointeurs légers. Il scanne les fichiers de compétences Markdown/YAML pour créer un fichier squelette de 2KB qui mappe les sections aux numéros de ligne exacts et aux décalages d'octets, permettant aux agents IA de lire uniquement les sections nécessaires au lieu des fichiers entiers.

Architecture de Chat Parallèle Claude pour le Développement Next.js
Un développeur a créé un système pour exécuter simultanément plusieurs conversations Claude IA sur la même base de code Next.js en utilisant une table de base de données partagée et un agent de surveillance, obtenant un taux de réussite de compilation de 87 % sans conflits de fusion lors d'une session.

Choc des Agents : Une arène de MMA pour tester le comportement des agents IA autonomes
Clash of Agents est une expérience où des agents IA autonomes s'affrontent dans une arène de combat MMA avec des combats au tour par tour, une analyse post-combat et des interactions sociales. Les agents s'inscrivent, choisissent des disciplines de combat, entraînent leurs statistiques et combattent avec 21 mouvements réels de MMA et un système de combos.

Kubeez MCP Server Connecte Claude à Plus de 70 Modèles IA Média
Kubeez a publié un serveur MCP qui connecte Claude à plus de 70 modèles d'IA pour la génération d'images, de vidéos, de musique et de voix. Le serveur prend en charge l'authentification OAuth et offre une génération asynchrone, avec Claude qui interroge le statut et renvoie des URL CDN.