Skippy's LLM privé : Comment j'ai résolu le délai d'attente du sous-agent Ollama d'OpenClaw en appelant Ollama directement

Le système d'agent d'OpenClaw a un problème de timeout persistant avec les modèles Ollama. La boucle d'événements Node.js bloque pendant la génération, les agents restent en attente pendant 60+ secondes et produisent zéro token. Plusieurs issues GitHub le confirment : #23827, #27883, #41871, #79032, #63736 — toutes rapportent le même schéma : curl direct fonctionne, les agents non.
La correction décrite par Skippy, un assistant IA d'un COO d'OpenClaw, est de contourner complètement le système d'agent. Au lieu de cela, lancez une seconde instance d'Ollama sur le port 11435, découplée de l'instance de chat principale sur le port 11434. L'instance principale gère le chat normal et les outils ; la seconde instance est un worker dédié pour les analyses lourdes (comme l'examen d'un classifieur Python de 432 lignes). L'IA l'appelle via un curl brut ou un wrapper Python — aucune implication de passerelle, aucun blocage de boucle d'événements, aucune contention GPU.
python3 analyze.py \
--file /tmp/review_prompt.txt \
--out /tmp/review.md \
--system "Vous êtes un relecteur de code approfondi." \
--timeout 1200 \
--max-tokens 32768 \
--temperature 0.3Flux de travail : écrivez le prompt de révision + le code source complet dans un fichier temporaire, puis exécutez le script Python. Le modèle 27B tourne sur le port 11435, utilisant ~17,7 Go de VRAM sur un Mac Studio M2 Ultra, tandis que le chat principal utilise le modèle 35B sur le port 11434 (~19,8 Go de VRAM). Skippy rapporte que la correction fonctionne de manière fiable — plus de timeouts.
Il s'agit d'un contournement pragmatique pour quiconque rencontre le bug de timeout de l'agent Ollama dans OpenClaw, surtout si vous avez assez de VRAM pour exécuter deux instances de modèle.
📖 Lire la source complète : r/openclaw
👀 See Also

Le bug du plugin Claude Code provoque le chargement en double des compétences, augmentant la compaction du contexte.
Un bug dans Claude Code provoque le chargement de chaque compétence deux fois en raison de répertoires de cache obsolètes et de la duplication de liens symboliques, augmentant considérablement la taille de l'invite système et déclenchant une compaction fréquente du contexte. La source fournit des scripts de vérification pour identifier le problème et des scripts de correction pour supprimer les versions obsolètes des plugins et les liens symboliques en double.

Un processus de travail en IA en deux étapes pour la modernisation du code hérité
Un post Reddit décrit une approche en deux étapes de 'rétro-ingénierie' pour utiliser l'IA avec du code hérité : d'abord extraire la logique métier dans un Document d'Exigences Métier indépendant de la technologie, puis utiliser un prompt 'Architecte en Chef' pour reconstruire à partir de zéro avec les meilleures pratiques modernes.

Trois goulots d'étranglement négligés dans les flux de travail des agents IA : ingestion, gestion du contexte et routage des modèles
Analyse approfondie des trois couches souvent négligées lors de l'optimisation des agents IA : l'ingestion propre des entrées, la gestion du contexte entre les étapes et le routage des modèles adapté à la tâche. Les solutions pratiques incluent l'utilisation d'un parsing structuré, de sorties d'étape résumées, de schémas typés et l'adaptation des modèles à la complexité de la tâche.

OpenClaw v2026.3.13 ajoute une configuration de cacheRetention par agent pour réaliser des économies sur les coûts des jetons OpenAI.
OpenClaw v2026.3.13 ajoute une configuration cacheRetention par agent qui permet la rétention du cache des prompts d'OpenAI pendant 24 heures, réduisant potentiellement les coûts des tokens d'entrée jusqu'à 90 % pour les agents dont les cycles de pulsation dépassent 10 minutes.