Qwen3.5 35B-A3B MoEは、中程度のハードウェア上で27ステップのエージェントワークフローをローカルで実行します。

ローカルエージェントワークフローの実演
r/LocalLLaMAで開発者が、Qwen3.5 35B-A3B MoEを使用して複雑なエージェントワークフローをローカルで正常に実行したと報告した。このモデルは、ミッドレンジハードウェア上で27ステップの動画処理チェーンを自律的に実行した。
ワークフローの詳細
タスクは、単一の自然言語プロンプトから動画を処理することだった:
- 動画をアップロード
- Whisperで文字起こし
- 字幕を編集
- カスタムスタイルで字幕を動画に焼き付け
ワークフローは27の連続したツール呼び出しで構成され、extract_audio、transcribe、read_file、edit_file、burn_subtitlesに加えて検証ステップを含んでいた。モデルは各ステップを計画、実行、検証し、必要に応じて自己修正を行った。
技術仕様
ハードウェア:
- Lenovo ThinkPad P53モバイルワークステーション
- Intel i7-9850Hプロセッサ
- Quadro RTX 3000(6GB VRAM)
- 48GB DDR4 2666MT/s RAM
ソフトウェアスタック:
- llama.cpp + whisper.cppによる完全ローカル実装
- クラウドAPIは使用せず
モデル設定:
- Q4_K_M量子化のQwen3.5 35B-A3B MoE
- トークンごとに約3Bのアクティブパラメータを持つMoEアーキテクチャ
- レイヤーをオフロードして6GB VRAMに収まり実行可能
- 完全な35Bパラメータの知識ベース
パフォーマンス結果
完全なワークフローは約10分で実行され、ほとんどの時間は推論に費やされた。開発者は、27ステップのチェーン中にエラーゼロ、人間の介入ゼロだったと指摘した。MoEアーキテクチャは、アクティブパラメータ数を低く保ちながら完全なモデル能力を維持することで、ミッドレンジハードウェアでの実行を可能にした。
これは、ローカルエージェントワークフローが、特に速度のためにアクティブパラメータ数と能力のために完全なパラメータ数のバランスを取るMoEモデルによって、コンシューマーグレードのハードウェアで実用的になりつつあることを示している。
📖 Read the full source: r/LocalLLaMA
👀 See Also

エンジニアリング担当副社長、Claude AIを活用して1週間で4つのアプリケーションを構築
あるエンジニアリング担当副社長がClaude AIを使用して、VPNアプリケーション、Goバックエンドを備えたiOSネイティブアプリ、Next.jsのランディングサイト、Reactの管理ダッシュボードを、直接コードを書かずに1週間で構築しました。ユーザーは1年前にClaudeでJiraの代替ツールを試みましたが、複雑なアプリケーションの制限に直面しました。

Claude Projects + Gamma Connector: $12K MRR SaaS創業者による12分の投資家向けアップデート
インドの家庭教師向けSaaSを運営する創業者(MRR 12,000ドル)が、Claude Projects(永続的コンテキスト)とGammaコネクタを使って、投資家向けアップデートの作成時間を3時間から12分に短縮した方法。

開発者が30日間の個人プロジェクトでClaude CodeとLinear、Discordをどのように活用したか
ある開発者が、Claude Codeをペアプログラマーとして活用し、Linearをチケット追跡に、Discordをビルド通知に統合して、30日間でフルスタックのポケモンVGCチームレポートツールを構築しました。ワークフローには、自動化されたチケット処理、型チェックゲート、一貫したAI指示のためのCLAUDE.mdファイルが含まれていました。

開発者は、フロントエンド開発とランディングページデザインにClaude AIを使用しています。
ある開発者がClaude AIを利用してランディングページのフロントエンドを改善し、デザイン提案、レスポンシブレイアウト、アクセシビリティ修正を反復的なフィードバックを通じて提供するペアプログラマーとして扱いました。