SkillOpt : Optimisation des fichiers de compétences Markdown en tant que paramètres entraînables pour les agents IA

SkillOpt est un nouveau cadre d'optimisation qui traite les fichiers de compétences markdown comme des paramètres entraînables, en appliquant une véritable mécanique d'optimisation à l'édition ad hoc de compétences que de nombreux développeurs d'agents pratiquent déjà. L'article (arxiv.org/pdf/2605.23904) formalise un processus : un modèle de pointe propose des modifications limitées (ajout/suppression/remplacement) aux fichiers de compétences markdown, et chaque modification est validée par un ensemble de validation réservé. Seules les améliorations strictes sont acceptées ; les égalités sont rejetées, et les modifications rejetées deviennent un signal négatif pour les tours suivants.
Résultats Clés
- Convergence : Les meilleures compétences convergent avec 1 à 4 modifications acceptées parmi de nombreuses propositions. Un budget de 4 à 8 modifications par étape fonctionne le mieux ; supprimer le plafond entraîne un effondrement des performances.
- Taille des compétences : La compétence finale médiane fait environ 920 tokens.
- Transfert de modèle : Une compétence optimisée sur Codex transférée à Claude Code sans modification a gagné +59,7 sur SpreadsheetBench. GPT 4.1 Nano avec une compétence optimisée a approximativement égalé les modèles de pointe sur des benchmarks procéduraux.
Limitations
La validation nécessite un auto-correcteur avec des réponses correctes claires. Cela fonctionne pour le code et les feuilles de calcul, mais échoue pour tout ce qui est ouvert.
À Qui Cela S'Adresse
Développeurs construisant des agents de codage IA qui souhaitent optimiser systématiquement les fichiers de compétences plutôt que de se fier à l'itération manuelle ou à l'ingénierie de prompts ad hoc.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

OpenClaw Alexa Voice Proxy Permet une Interaction Vocale Bidirectionnelle
openclaw-alexa-voice est un proxy Node.js qui connecte une Alexa Custom Skill à la passerelle OpenClaw avec un système de réponse à trois niveaux pour les requêtes vocales. Il gère les réponses rapides en moins d'une seconde, les réponses d'agent en moins de 12 secondes, et les requêtes complexes différées traitées de manière asynchrone en moins de 2 minutes.
LTM : Un protocole JSON pour une mémoire d'agent portable entre modèles et machines
LTM est un protocole JSON (Core Memory Packet) plus une CLI/serveur pour persister le contexte de l'agent—impasses, contraintes, prochaines étapes—à travers les modèles, éditeurs et machines. Les paquets font 2-5 Ko, masquent les secrets et prennent en charge MCP.

SubQ : Un LLM sous-quadratique avec une fenêtre de contexte de 12 millions de tokens
SubQ est un LLM à attention creuse entièrement sous-quadratique offrant une fenêtre de contexte de 12 millions de tokens à 150 tokens/s, avec SWE-Bench Verified 81,8% et RULER @ 128K 95,0%. Il réduit le calcul de l'attention d'environ 1000× par rapport aux transformeurs.
Publier sur LinkedIn directement depuis Claude : Workflow complet
Un utilisateur de Reddit partage un workflow utilisant le connecteur MCP Contentdrips pour rédiger, concevoir et publier des posts LinkedIn directement depuis le chat Claude AI.