OpenClaw WhatsApp Réponse Automatique Peut Ignorer la Compréhension des Médias dans la Version 2026.4.2

Aperçu du problème
Un utilisateur a rencontré un problème où l'intégration WhatsApp d'OpenClaw n'a pas réussi à transcrire les notes vocales malgré une configuration correcte. Le problème se produit spécifiquement dans le flux de réponse automatique WhatsApp de la version 2026.4.2 d'OpenClaw.
Détails du problème
La configuration de l'utilisateur comprenait :
- Des messages entrants WhatsApp avec MediaPath et MediaType valides
- Des fichiers audio stockés correctement en .ogg
tools.media.audioactivé dans la configuration- Un backend de transcription externe (Groq STT) pour la reconnaissance vocale
Malgré que tout semble correct, l'agent a reçu des placeholders <media:audio> au lieu de transcriptions. Le processus de transcription ne s'est jamais déclenché.
Cause racine
Après avoir tracé le flux, l'utilisateur a découvert que le chemin de réponse automatique WhatsApp n'invoque pas toujours le pipeline standard de compréhension des médias avant d'envoyer les messages à l'agent. Cela signifie :
tools.media.audion'est jamais exécuté- Les CLI ou backends externes (comme Groq STT) ne fonctionnent jamais
- L'agent ne voit que le placeholder
<media:audio>
Ce problème est particulièrement visible lors de l'utilisation de modèles audio non natifs, car ceux-ci ne gèrent pas automatiquement l'audio de manière implicite.
Solution
La solution implique de forcer un appel à l'étape de compréhension des médias avant que la réponse ne soit envoyée à l'agent. L'utilisateur a corrigé le flux de réponse automatique WhatsApp entrant pour :
- Construire le contexte entrant WhatsApp
- Exécuter explicitement la même logique de compréhension des médias utilisée dans le pipeline de réponse standard
- Continuer avec l'envoi normal à l'agent
Après avoir implémenté cette correction :
- L'audio est correctement pris en charge
- Le CLI (Groq STT dans ce cas) s'exécute
- La transcription est injectée dans le message
- L'agent reçoit du texte au lieu de
<media:audio>
Personnes concernées
Ce problème affecte les utilisateurs qui dépendent de la transcription basée sur CLI, des API externes ou de tout modèle audio non natif. Ces configurations dépendent entièrement du déclenchement de la compréhension des médias, et si cette étape est contournée, rien en aval ne fonctionnera même avec une configuration correcte.
Point clé à retenir
Si vous rencontrez des problèmes où l'audio est reçu et stocké correctement, tools.media.audio est activé, mais la transcription ne se produit jamais, vérifiez si votre chemin de réponse automatique WhatsApp appelle réellement le pipeline de compréhension des médias avant l'envoi à l'agent.
📖 Read the full source: r/openclaw
👀 See Also
![[Mise à jour] Vous avez demandé un moyen sécurisé et "toujours actif" d'exécuter OpenClaw sans les tracas d'un VPS. Nous l'avons créé. La liste d'attente est ouverte.](/covers/article-139.jpg?v=3)
[Mise à jour] Vous avez demandé un moyen sécurisé et "toujours actif" d'exécuter OpenClaw sans les tracas d'un VPS. Nous l'avons créé. La liste d'attente est ouverte.
OpenClaw annonce une nouvelle fonctionnalité qui permet aux utilisateurs d'exécuter leur plateforme de manière sécurisée et continue sans les complexités des VPS. La liste d'attente est désormais ouverte pour un accès anticipé.

Opus sur les défaillances des agents IA : Les excuses ne sont pas des corrections, l'architecture l'est
Un utilisateur de Reddit raconte comment Claude Opus a transformé sa compréhension des échecs des IA : faire confiance aux excuses conduit à répéter les erreurs ; seules des barrières structurelles dans le code, la validation ou les limites d'exécution corrigent le mode d'échec.

Solution de contournement pour l'erreur de boucle de rétroaction du microphone de l'application mobile Claude
Un utilisateur de Reddit partage une solution de contournement fonctionnelle pour l'erreur de boucle de rétroaction du microphone dans l'application mobile Claude : installer la version web en tant qu'application web progressive autonome via Google Chrome, ce qui contourne le problème et permet d'accéder à différents modèles Claude.

Exécution de MiniMax M2.7 Q8_0 128K sur 2x3090 avec déchargement CPU – Benchmarks réels et configuration
Un utilisateur exécute avec succès MiniMax M2.7 en Q8_0 avec un contexte de 128K sur deux RTX 3090 et de la RAM DDR4, atteignant environ 50 tps en traitement de requête et environ 10 tps en génération de tokens, et partage ses paramètres llama-server.