OpenClaw WhatsApp自動返信は、2026.4.2でメディア理解をスキップする可能性があります。

問題の概要
ユーザーは、OpenClawのWhatsApp統合が正しく設定されているにもかかわらず、音声メモの文字起こしに失敗する問題に遭遇しました。この問題は、OpenClawバージョン2026.4.2のWhatsApp自動返信フローで特に発生します。
問題の詳細
ユーザーの設定には以下が含まれていました:
- 有効なMediaPathとMediaTypeを持つWhatsApp受信メッセージ
- オーディオファイルが正しく.oggファイルとして保存されている
- 設定で
tools.media.audioが有効化されている - 音声認識用の外部文字起こしバックエンド(Groq STT)
すべてが正しく見えるにもかかわらず、エージェントは文字起こしではなく<media:audio>プレースホルダーを受け取りました。文字起こしプロセスは決してトリガーされませんでした。
根本原因
フローをトレースした後、ユーザーはWhatsApp自動返信パスが、メッセージをエージェントにディスパッチする前に標準的なメディア理解パイプラインを常に呼び出さないことを発見しました。これは以下を意味します:
tools.media.audioが実行されない- CLIや外部バックエンド(Groq STTなど)が実行されない
- エージェントは
<media:audio>プレースホルダーのみを認識する
この問題は、非ネイティブのオーディオモデルを使用する場合に特に顕著です。なぜなら、それらのモデルはオーディオを暗黙的に自動処理しないためです。
解決策
修正方法としては、返信がエージェントにディスパッチされる前に、メディア理解ステップの呼び出しを強制することが含まれます。ユーザーはWhatsApp受信自動返信フローにパッチを適用し、以下を行いました:
- WhatsApp受信コンテキストを構築する
- 標準返信パイプラインで使用されるのと同じメディア理解ロジックを明示的に実行する
- 通常のエージェントディスパッチを続行する
この修正を実装した後:
- オーディオが正しく認識される
- CLI(この場合はGroq STT)が実行される
- 文字起こしがメッセージに挿入される
- エージェントは
<media:audio>ではなくテキストを受け取る
影響を受けるユーザー
この問題は、CLIベースの文字起こし、外部API、または非ネイティブのオーディオモデルに依存するユーザーに影響を与えます。これらの設定はメディア理解がトリガーされることに完全に依存しており、そのステップがスキップされると、正しい設定であっても下流の処理は一切機能しません。
重要なポイント
オーディオが正しく受信および保存され、tools.media.audioが有効化されているにもかかわらず、文字起こしが行われない問題が発生している場合は、WhatsApp自動返信パスがエージェントディスパッチ前に実際にメディア理解パイプラインを呼び出しているかどうかを確認してください。
📖 Read the full source: r/openclaw
👀 See Also

Ollama CloudモデルのmaxTokens修正:上限は16K、設定値ではない
OllamaクラウドはmaxTokens設定にかかわらず出力を16,384トークンで制限します。EOFエラーを避けるには14,000に設定してください。長い出力は再構成するか、負荷の大きいエージェントは直接プロバイダーにルーティングしましょう。

OpenClaw 経由で複数の ChatGPT アカウント間の未使用の Codex リセットクレジットを確認する
あるユーザーが、2つ目のOAuthアカウントでレート制限リセットクレジットの期限切れを発見。エージェントで両方をスキャンしたところ、合計6つの未使用クレジットを確認。1つを使用して1分以内にクールダウンを解除した。落とし穴として、未文書化エンドポイントやスキル発見の問題がある。

大規模なOpenClawプロジェクトにおけるメモリ管理のためのプロジェクトナラティブの活用
開発者が、主要なマイルストーンを達成するたびに、別のOpenClawワーカーを起動してコードベースを分析し、『プロジェクトナラティブ』文書を作成するプロセスを共有しています。これにより、メインワーカーが見落としがちな壊れたパイプライン、冗長性、欠落部分を特定するのに役立ちます。

グラフメモリ対マークダウン:なぜフラットファイルがスケール時にプロンプト負債になるのか
ある開発者が、AIエージェントのマークダウン方式のメモリシステムが80以上のファイル、500万文字にまで膨らみ、取得作業が推測に頼るものになってしまった経験を共有。解決策はグラフメモリで、ノードとエッジにより、タスクに関連するコンテキストのみをエージェントが描画するというもの。