moine : Une compétence qui réduit au silence la narration de l'agent pour économiser le contexte et les jetons

✍️ OpenClawRadar📅 Publié: May 15, 2026🔗 Source
moine : Une compétence qui réduit au silence la narration de l'agent pour économiser le contexte et les jetons
Ad

Un utilisateur de Reddit a créé monk, une compétence qui fait fonctionner les agents IA en silence — supprimant les narrations, préambules, postambules et commentaires de progression des réponses, ne conservant que les résultats. L'effet est une réduction estimée à 54% des tokens de sortie par tour (47% en codage, 65% en chat, 54% en recherche) et des économies de contexte cumulatives qui augmentent avec la durée de la session.

Comment ça marche

monk supprime toute narration du type "Je suis en train de faire X...", les widgets de liste de tâches et les pings de statut. L'agent produit uniquement les résultats standard à la fin de chaque étape. La compétence est disponible sur GitHub : github.com/marpxxx/skillz/tree/main/monk.

Résultats des benchmarks

Les tests ont utilisé 30 tâches (10 par catégorie : codage, chat, recherche) avec une verbosité approximée via le tokenizer cl100k_base d'OpenAI. Chiffres clés :

  • Économies de sortie par tour : Codage 47%, Chat 65%, Recherche 54%, Global 54%.
  • Gain de capacité de contexte (cumulatif) : À ~20 tours (session typique), +13% (codage), +14% (chat), +20% (recherche). À 100 tours, +29% (codage), +36% (chat), +39% (recherche).
  • Coût API (Claude Sonnet 4.6, mise en cache des prompts) : ~19% d'économie de coût sur une session de 10 tours.

Le test n'a pas compté les tokens supprimés dans les widgets d'utilisation d'outils ou les pings de statut, donc les économies réelles pourraient être plus élevées.

Ad

Limitations

Les échantillons verbaux sont des approximations générées par IA. Un agent de base bien réglé peut déjà être plus concis ; un agent verbeux avec des compétences riches en narration peut en produire davantage. Le tokenizer est celui d'OpenAI (cl100k_base), pas celui d'Anthropic. L'hypothèse d'un prompt système de 8k est prudente (de nombreuses configurations ont 15-30k). Les résultats sont des estimations directionnelles, pas des benchmarks de production.

Pour les développeurs qui lisent rarement les sorties en temps réel de l'agent, cette compétence peut réduire le bruit et étendre considérablement la fenêtre de contexte.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

harshal-mcp-proxy désormais sur npm : un seul démon remplace 12 configurations de serveur MCP
Tools

harshal-mcp-proxy désormais sur npm : un seul démon remplace 12 configurations de serveur MCP

harshal-mcp-proxy est désormais disponible en tant que package npm de 54 kB. Installez-le globalement, exécutez-le en tant que démon, et remplacez 12 configurations de serveur MCP distinctes par 6 outils, économisant environ 2,7 Go de RAM et 50 000 tokens par session.

OpenClawRadar
Terminal CRM Local avec Serveur MCP Intégré pour l'Intégration Claude
Tools

Terminal CRM Local avec Serveur MCP Intégré pour l'Intégration Claude

Un développeur a créé un CRM personnel qui s'exécute dans le terminal avec un stockage SQLite local et inclut un serveur MCP intégré, donnant à Claude accès à 18 outils pour gérer les contacts, les transactions et les suivis.

OpenClawRadar
LLM-Memory.net : Système de mémoire open-source avec infrastructure multi-agent
Tools

LLM-Memory.net : Système de mémoire open-source avec infrastructure multi-agent

LLM-Memory.net est un système de mémoire auto-hébergeable pour agents IA qui offre un stockage de notes avec recherche sémantique, une communication en temps réel par chat/courriel entre agents, des discussions structurées avec vote et une intégration serveur MCP. Le code source complet est disponible sur GitHub avec un installateur et des playbooks Ansible.

OpenClawRadar
La réutilisation du cache KV pour les conversations longues sur Apple Silicon offre une accélération de 200x
Tools

La réutilisation du cache KV pour les conversations longues sur Apple Silicon offre une accélération de 200x

Un développeur a mis en œuvre la réutilisation du cache KV basé sur des sessions pour l'inférence LLM locale en utilisant le framework MLX d'Apple, obtenant une amélioration de 200x du temps jusqu'au premier token pour une longueur de contexte de 100K. L'approche conserve le cache KV en mémoire à travers les tours de conversation, ne traitant que les nouveaux tokens.

OpenClawRadar