Ce qui se casse quand on exécute des agents de codage sur de petits modèles locaux

✍️ OpenClawRadar📅 Publié: April 30, 2026🔗 Source
Ce qui se casse quand on exécute des agents de codage sur de petits modèles locaux
Ad

Après des semaines à exécuter de vraies tâches de codage multi-fichiers via de petits modèles locaux (moins de 7B) et de petits modèles cloud sur des offres gratuites, un utilisateur de Reddit a documenté des points de défaillance récurrents, au-delà du bruit habituel des benchmarks. Voici ce qui coince vraiment.

Les délimiteurs Markdown sont la panne la plus fréquente

Même avec "afficher uniquement du code brut, sans formatage markdown" dans le prompt système, la plupart des modèles encapsulent leurs réponses dans des triples backticks. Qwen3.5:9b et Gemma4:e4b suivent le mieux les instructions mais dérapent encore parfois. La solution n'est pas un meilleur prompt — c'est de supprimer les délimiteurs en post-traitement par défaut.

Les sorties structurées ne sont pas fiables en dessous de 7B

Lorsque les agents ont besoin de JSON pour des listes de tâches ou des types d'action, les petits modèles échouent bien plus souvent que ne le suggèrent les benchmarks. Les benchmarks testent du JSON valide ; l'usage réel ajoute des instructions complexes en plusieurs étapes avec des cas limites. Gemma4:e4b est le plus fiable parmi les modèles locaux ; Qwen3.5:9B suit de près. Codellama galère. Dans le cloud, Llama 3.3 70B sur Groq est très solide. Solution pratique : valider le JSON, réessayer une fois avec une instruction explicite, puis utiliser un analyseur permissif qui extrait le JSON du texte.

Les modèles modifient le mauvais fichier

Donnez à un petit modèle la tâche de renommer validateToken en verifyToken avec un plan de projet contenant des noms similaires, et il peut renommer validateUser ou modifier un fichier complètement différent. Le modèle traite le plan de projet comme des suggestions, pas des contraintes. Correction au niveau de l'orchestration : valider que les chemins de fichiers existent et que les noms de fonctions sont dans les fichiers déclarés. Renvoyer des erreurs en cas de divergence — les petits modèles mentent avec assurance.

Ad

Classification question vs action

Demander « combien de lignes fait utils.js » devrait être une opération en lecture seule. Mais si l'exécuteur n'a qu'un seul mode d'édition, il éditera le fichier pour y mettre la réponse. La solution : le planificateur doit classer les requêtes en types d'action avant exécution. Les requêtes en lecture seule sont dirigées vers un chemin de code séparé qui ne touche jamais au disque.

Ce qui fonctionne mieux que prévu

  • Respect du budget de tokens dans le code : Compter les tokens avant chaque appel ; les petits modèles n'ont pas conscience des limites de contexte et ne seront pas concis si on leur fait confiance.
  • Isolation par fichier : Envoyer un fichier à la fois est nettement plus fiable que deux — les modèles mélangent les corrections.
  • Mémoire synthétique : Stocker un résumé d'une phrase de ce que le modèle a fait, pas la liste complète des tâches. Fonctionne pour les annulations et les requêtes additives.

Encore à déterminer

Si un modèle local de moins de 7B est viable pour un rôle d'agent — l'auteur n'en a pas encore trouvé un qui n'échoue pas assez souvent sur les sorties structurées. Banc de test open source sur github.com/razvannec pour les contributions.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Configuration d'OpenClaw pour une Communication Fluide d'Agent à Agent
Guides

Configuration d'OpenClaw pour une Communication Fluide d'Agent à Agent

Un utilisateur de Reddit partage des paramètres de configuration spécifiques pour OpenClaw qui réduisent les délais d'attente dans la communication entre agents, incluant les paramètres de visibilité des outils, les directives de mémoire et des solutions de contournement pour la limitation ANNOUNCE_SKIP.

OpenClawRadar
DeepSeek-V4-Flash W4A16+FP8 avec auto-spéculation MTP : 85 tok/s sur 2x RTX PRO 6000 Max-Q
Guides

DeepSeek-V4-Flash W4A16+FP8 avec auto-spéculation MTP : 85 tok/s sur 2x RTX PRO 6000 Max-Q

DeepSeek-V4-Flash quantifié en W4A16+FP8 atteint 85,52 tok/s avec un contexte de 524k sur 2× RTX PRO 6000 Max-Q en utilisant un vLLM patché avec une tête MTP rétrofitée, contre 52,85 tok/s de référence.

OpenClawRadar
Structurer les Agents de Code Claude avec les Modèles CLAUDE.md et le Répertoire .claude/
Guides

Structurer les Agents de Code Claude avec les Modèles CLAUDE.md et le Répertoire .claude/

Un développeur partage son approche pour exécuter plusieurs agents IA avec Claude Code, chaque agent ayant son propre répertoire contenant un fichier CLAUDE.md et un répertoire .claude/ avec des règles et des compétences. L'idée clé est de séparer le contexte toujours actif des flux de travail à la demande pour optimiser l'utilisation des tokens et la qualité des réponses.

OpenClawRadar
Correction du ralentissement d’OpenClaw lors de longues sessions : continuation-skip d’injection de contexte pour le cache de llama.cpp
Guides

Correction du ralentissement d’OpenClaw lors de longues sessions : continuation-skip d’injection de contexte pour le cache de llama.cpp

Une solution concrète pour les sessions OpenClaw qui ralentissent avec le temps : définir contextInjection sur continuation-skip pour préserver le cache de prompt de llama.cpp, réduisant l'évaluation du prompt de 130s à 1,3s.

OpenClawRadar