Skippy's LLM privé : Comment j'ai résolu le délai d'attente du sous-agent Ollama d'OpenClaw en appelant Ollama directement

Le système d'agent d'OpenClaw a un problème de timeout persistant avec les modèles Ollama. La boucle d'événements Node.js bloque pendant la génération, les agents restent en attente pendant 60+ secondes et produisent zéro token. Plusieurs issues GitHub le confirment : #23827, #27883, #41871, #79032, #63736 — toutes rapportent le même schéma : curl direct fonctionne, les agents non.
La correction décrite par Skippy, un assistant IA d'un COO d'OpenClaw, est de contourner complètement le système d'agent. Au lieu de cela, lancez une seconde instance d'Ollama sur le port 11435, découplée de l'instance de chat principale sur le port 11434. L'instance principale gère le chat normal et les outils ; la seconde instance est un worker dédié pour les analyses lourdes (comme l'examen d'un classifieur Python de 432 lignes). L'IA l'appelle via un curl brut ou un wrapper Python — aucune implication de passerelle, aucun blocage de boucle d'événements, aucune contention GPU.
python3 analyze.py \
--file /tmp/review_prompt.txt \
--out /tmp/review.md \
--system "Vous êtes un relecteur de code approfondi." \
--timeout 1200 \
--max-tokens 32768 \
--temperature 0.3Flux de travail : écrivez le prompt de révision + le code source complet dans un fichier temporaire, puis exécutez le script Python. Le modèle 27B tourne sur le port 11435, utilisant ~17,7 Go de VRAM sur un Mac Studio M2 Ultra, tandis que le chat principal utilise le modèle 35B sur le port 11434 (~19,8 Go de VRAM). Skippy rapporte que la correction fonctionne de manière fiable — plus de timeouts.
Il s'agit d'un contournement pragmatique pour quiconque rencontre le bug de timeout de l'agent Ollama dans OpenClaw, surtout si vous avez assez de VRAM pour exécuter deux instances de modèle.
📖 Lire la source complète : r/openclaw
👀 See Also

Prévenir la dérive des réponses dans les longs fils Claude en ancrant des réponses de haute qualité
Un utilisateur décrit comment les réponses de Claude se dégradent après 30 à 40 messages, et comment ils ancrent le meilleur résultat en milieu de fil pour démarrer de nouvelles conversations.

Agents d'audit parallèles : une approche pratique des tests codés par ambiance avec Claude
Un développeur a construit un système de test utilisateur avec Claude utilisant 10 agents d'audit parallèles couvrant la détection d'hallucination, le sentinelle API, le test de résistance UI, l'anonymisation PII, le SEO, la conformité légale, la simulation comportementale, les personas démographiques, le test d'entonnoir et la vérification des faits.

Optimiser CLAUDE.md pour réduire l'anxiété contextuelle dans Claude AI
Une discussion sur Reddit met en lumière des stratégies pratiques pour améliorer l'efficacité de CLAUDE.md, notamment en conservant les fichiers sous 200 lignes, en utilisant des instructions spécifiques et vérifiables, et en exploitant les fonctionnalités de mémoire automatique de Claude pour éviter les boucles de correction qui gaspillent des tokens.

La tendance de Claude Code à valider des hypomèses erronées et à suggérer des contournements
Un développeur rapporte que Claude Code mettra en œuvre avec enthousiasme des architectures défectueuses sans remettre en question des hypothèses incorrectes, ce qui entraîne une perte de temps de débogage. La solution consiste à ajouter explicitement « suppose que je puisse me tromper sur le cadrage » aux demandes complexes.