Qwen2-0.5B Affiné pour l'Automatisation de Tâches Locales avec llama.cpp

Un développeur a affiné Qwen2-0.5B pour l'automatisation de tâches, créant un modèle qui s'exécute entièrement localement sur CPU sans nécessiter de GPU ni d'API cloud. Le projet, nommé ACE, est disponible sur GitHub.
Ce qu'il fait
- Prend des tâches en langage naturel (par exemple, "copier les journaux en sauvegarde")
- Détecte le type de tâche : atomique, répétitive ou de clarification
- Génère des plans d'exécution composés de commandes CLI et de raccourcis clavier
- S'exécute entièrement localement sur CPU (pas de GPU, pas d'API cloud)
Détails techniques
- Modèle de base : Qwen2-0.5B
- Entraînement : Affinage LoRA sur environ 1000 exemples de tâches personnalisées
- Quantification : Format GGUF Q4_K_M (taille de fichier 300 Mo)
- Inférence : llama.cpp
- Temps d'inférence : 3-10 secondes sur processeurs i3/i5
Principaux défis pendant l'entraînement
- Qualité des données : A dû régénérer le jeu de données 2-3 fois à cause d'exemples inutiles
- Sur-apprentissage : A pris plusieurs itérations pour stabiliser la perte de validation
- Gestion du token EOS : Le modèle ne s'arrêtait pas de générer jusqu'à ce que la configuration du tokenizer soit corrigée
- Conversion GGUF : Nécessitait le dtype BF16 + la quantification imatrix pour obtenir des sorties stables
Limitations (v0.1)
- Nécessite des chemins de fichiers complets (pas encore de recherche intelligente de fichiers)
- Inférence CPU uniquement (plus lent sur matériel ancien)
- Exécution basique (pas de compréhension visuelle)
Benchmarks de performance
- i5 (2018+) avec SSD : 3-5 secondes
- i3 (2015+) avec SSD : 5-10 secondes
- Matériel ancien (Pentium + HDD) : 30-90 secondes
Le développeur sollicite des retours sur les performances sur différents matériels, les cas limites qui font échouer le modèle, et les demandes de fonctionnalités pour la v0.2.
📖 Read the full source: r/LocalLLaMA
👀 See Also

ClawCall : Compétence OpenClaw pour les appels téléphoniques IA avec mode pont
ClawCall est une compétence OpenClaw qui permet aux agents IA de passer de véritables appels téléphoniques, de naviguer dans les menus, de patienter en attente et de mener des conversations. Elle inclut un mode pont qui vous met en ligne lorsqu'un humain décroche.

Utiliser un LLM local comme sous-agent de code Claude pour réduire l'utilisation du contexte
Un développeur partage une méthode pour utiliser Claude Code afin de déléguer des tâches à un LLM local via l'API de LM Studio, en gardant le contenu des fichiers hors du contexte de Claude. L'approche utilise un script Python d'environ 120 lignes avec des appels d'outils pour lire les fichiers localement et renvoyer des résumés.

Storybloq : un suivi de projet pour Claude Code avec application Mac, CLI et MCP
Storybloq est un tracker de projet gratuit et open-source qui réside dans .story/ à l'intérieur de votre dépôt. Il inclut une app Mac (App Store), un CLI, et un serveur MCP pour exposer les tickets, problèmes et transferts de session à Claude Code.

Mesure des dépenses de tokens hors tâche dans Claude Code : la métrique 'Intention non déclarée'
Un développeur a créé une métrique pour quantifier le calcul dépensé sur des chemins d'exécution non intentionnels dans des sessions Claude Code, constatant que 22,8 % des tokens étaient consacrés à un travail hors sujet.