古いノキア携帯で小さなAIエージェントをデバッグ:成功までの18回の試み

✍️ OpenClawRadar📅 公開日: March 1, 2026🔗 Source
古いノキア携帯で小さなAIエージェントをデバッグ:成功までの18回の試み
Ad

ある開発者が、Termuxを介して古いNokia Androidスマートフォン上でGoで書かれた約12MBの単一バイナリAIエージェント「Picobot」を実行しようと試みました。目標は、Telegram連携、ツールサポート(ウェブフェッチ、シェル)、メモリ機能を備え、継続コストを最小限に抑えた24時間稼働のポケットエージェントを実現することでした。

18回の失敗した試み

試み1〜4では、無料のOpenRouterモデル(Gemini flash-exp、Qwen 2.5 7B、Llama 3.3 70B、Llama 3.2 3B)を使用しましたが、すべて404「ツール使用をサポートするエンドポイントが見つかりません」または無効なモデルIDエラーで失敗しました。無料ティアのルーティングでは、ほとんどの小型モデルでツールが有効になりませんでした。

試み5〜8では、Groq直接接続(Llama 3.3 70B、Mixtral 8x7B、Llama 3.1 8B、Gemma 2 9B)を使用しました。モデルは廃止された(400エラー)か、無効なツール形式(XML <function>タグ)を幻覚生成し、400 tool_use_failedエラーや終わらない返信スパムループを引き起こしました。

試み9ではGLM-4.5-Air :freeを使用し、当初はジョークや天気情報で成功しましたが、AAPL株価クエリでコンテキストが爆発的に増加(約33万トークン)し、400オーバーフローエラーが発生しました。

試み10〜11では、さらに無料のOpenRouterモデル(Llama 3.1 70B、Qwen 3 8B)を試しましたが、同じ404ツールエンドポイントなし問題が発生しました。

試み12では、Groq Llama 3.1 8Bをtemperature=0.3で使用しましたが、依然としてタグの幻覚生成とループが発生しました。

試み13では、OpenRouterプロキシ経由でClaude 3.5 Sonnetを試しましたが、OpenRouter残高が$0のため402支払いが必要エラーとなりました。

試み14ではOpenRouterに$5を追加し、プロキシが認証され基本的な返信が可能になりました。

試み15では同じClaude 3.5モデルを使用しましたが、長いクエリでコンテキストオーバーフローが発生しました。

試み16ではSonnet 4.6(最新版)に切り替えましたが、モデル名の不一致により404エラーが発生しました。

試み17では、設定のタイプミス/新規オンボードリセットによりTelegramが無効化され、トークンが消去されました。

Ad

最終的な動作する解決策

試み18では、直接Google API経由のgemini-2.5-flashで成功しました。このセットアップは高速で信頼性が高く、クリーンな返信、切り詰め問題なし、開発者のニーズに十分なツール使用が可能です。

プロバイダー:直接Google Gemini API(個人APIキー使用)
モデル:gemini-2.5-flash
コスト:現在Googleの無料ティア(課金連携プロジェクトで1日500リクエスト)で無料
Telegram:ボットトークンとチャンネルが有効化され、クリーンなメッセージ処理が可能

なぜOpenRouterが当初のデフォルトだったのか

Picobotの作成者がOpenRouterを選んだ理由は、バイナリを小さくコードをシンプルに保つためです:1つのOpenAI互換エンドポイントが数十のモデル/プロバイダーにルーティングし、ユーザーはconfig.jsonの1行を変更するだけでモデルを切り替えられます。無料ティア+BYOKをサポートし、プロバイダー間でツール呼び出しを標準化し、オープンソースエージェントのユニバーサルルーターとしてコミュニティの勢いがあります。

しかし、開発者はOpenRouterで多くの制限に直面しました:ツールサポートのギャップ、廃止、レート制限、プロキシ費用、検証グリッチなどです。

トレードオフ

  • 無料ティアには制限があります(1日500リクエスト)- これを超えると最小限のコストが発生(約$0.01–$0.05/メッセージ)
  • 完全なローカル/プライベートではありません(クラウドモデル)が、高速でスマートでスマートフォンのハードウェア制限なし
  • 長期的にゼロ費用を目指すなら、Mac上のローカルOllamaが選択肢ですが、ツールに関しては遅く能力も低い

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

長持ちするOpenClaw設定:複雑さを減らし、信頼性を高める
Use Cases

長持ちするOpenClaw設定:複雑さを減らし、信頼性を高める

40〜50のOpenClawセットアップを分析した結果、持続可能な構成は、1つのエージェント、3〜5のスキル、Sonnetモデルを使用し、カレンダー管理やメールの仕分けなどの日常的なタスクに焦点を当てていることが分かりました。一方、20以上のスキルを持つ複雑なマルチエージェントシステムは、通常3週間以内に失敗します。

OpenClawRadar
🦀
Use Cases

OpenClawエージェントのプレーンなMEMORY.md設定が時間的テストでMemory Startupのランタイムを上回る

メモリスタートアップのランタイムは、一時的な意思決定テストで誤ったバージョンを返し、3つすべてが1.000の関連性で同点となった。ユーザーのOpenClawエージェントは、gitリポジトリ内のマークダウンとしてメモリを持ち、現在の決定を日付付きで返した。

OpenClawRadar
開発者がコーディングワークフローにおけるClaude AIを現代の電卓に例える
Use Cases

開発者がコーディングワークフローにおけるClaude AIを現代の電卓に例える

サーバーレスAngular/AWS SPA/PWAプロジェクトに18ヶ月携わっている開発者が、AI支援コーディングの90%にClaude AIを使用していると報告し、それを「21世紀版の電卓」と表現しています。時折発生する壊滅的な出力にもかかわらず、生産性が10倍向上したと述べています。

OpenClawRadar
Claude Codeの過小評価されている強み:コード生成よりもコードベースナビゲーション
Use Cases

Claude Codeの過小評価されている強み:コード生成よりもコードベースナビゲーション

ある開発者が報告するところによると、Claude Codeを主要な開発ツールとして数ヶ月間使用した結果、最大の生産性向上は、grepよりも高速にコードベース全体を読み取り、相互参照する能力からもたらされ、データフローの迅速な理解とデバッグを可能にしています。

OpenClawRadar