SkillOpt : Optimisation des fichiers de compétences Markdown en tant que paramètres entraînables pour les agents IA

SkillOpt est un nouveau cadre d'optimisation qui traite les fichiers de compétences markdown comme des paramètres entraînables, en appliquant une véritable mécanique d'optimisation à l'édition ad hoc de compétences que de nombreux développeurs d'agents pratiquent déjà. L'article (arxiv.org/pdf/2605.23904) formalise un processus : un modèle de pointe propose des modifications limitées (ajout/suppression/remplacement) aux fichiers de compétences markdown, et chaque modification est validée par un ensemble de validation réservé. Seules les améliorations strictes sont acceptées ; les égalités sont rejetées, et les modifications rejetées deviennent un signal négatif pour les tours suivants.
Résultats Clés
- Convergence : Les meilleures compétences convergent avec 1 à 4 modifications acceptées parmi de nombreuses propositions. Un budget de 4 à 8 modifications par étape fonctionne le mieux ; supprimer le plafond entraîne un effondrement des performances.
- Taille des compétences : La compétence finale médiane fait environ 920 tokens.
- Transfert de modèle : Une compétence optimisée sur Codex transférée à Claude Code sans modification a gagné +59,7 sur SpreadsheetBench. GPT 4.1 Nano avec une compétence optimisée a approximativement égalé les modèles de pointe sur des benchmarks procéduraux.
Limitations
La validation nécessite un auto-correcteur avec des réponses correctes claires. Cela fonctionne pour le code et les feuilles de calcul, mais échoue pour tout ce qui est ouvert.
À Qui Cela S'Adresse
Développeurs construisant des agents de codage IA qui souhaitent optimiser systématiquement les fichiers de compétences plutôt que de se fier à l'itération manuelle ou à l'ingénierie de prompts ad hoc.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

DeepClaude remplace le backend Anthropic de Claude Code par DeepSeek V4 Pro à un coût 17 fois inférieur
Un script qui réécrit les variables d'environnement de Claude Code pour router tous les appels de la boucle agent via DeepSeek V4 Pro, OpenRouter ou Fireworks AI — même UX, 0,87 $/M tokens de sortie contre 15 $/M.

SDK Claude Code rétro-ingéniéré publié en quatre langues
Un développeur a rétro-conçu Claude Code et créé des SDKs en un seul fichier pour Node.js, Python, Go et Rust sans aucune dépendance. Ces outils offrent une boucle d'agent complète avec streaming et utilisation d'outils tout en utilisant les abonnements Claude Pro/Max existants.

Gemini 3.1 Pro dans les systèmes multi-agents : Haute qualité de conception, taux d'échec des appels d'outils de 20 %
Les développeurs de Bobr, un générateur de présentations IA avec une architecture multi-agents, rapportent que Gemini 3.1 Pro produit des résultats de conception impressionnants mais souffre d'un taux d'échec d'appel d'outils d'environ 20 % et d'une corruption de texte incohérente dans les pipelines de production.

Qwen 3.6 27B avec MTP sur V100 32GB : 54 t/s via la branche llama.cpp
La branche MTP d'am17an de llama.cc fait tourner Qwen 3.6 27B à 54 t/s sur V100 32GB via adaptateur PCIe, tombant à 29-30 t/s sans MTP.