Qwen3.5-27B-FP8のパフォーマンスベンチマークをOpenClawエージェントで実施

✍️ OpenClawRadar📅 公開日: February 28, 2026🔗 Source
Qwen3.5-27B-FP8のパフォーマンスベンチマークをOpenClawエージェントで実施
Ad

コミュニティテストによるパフォーマンスベンチマーク

コミュニティテストは、48GB VRAMを搭載した単一の改造RTX 4090 GPUを使用して実施されました。公式のQwen3.5-35B-A3B-FP8およびQwen3.5-27B-FP8モデルが256Kのコンテキスト長でテストされました。

フレームワーク推奨事項

SGLangが推奨されます。これはプレフィックスキャッシュを完全にサポートする唯一のフレームワークであり、Qwen3.5のハイブリッドアテンションアーキテクチャに不可欠です。

  • 100Kコンテキストの場合:コールドスタートのプリフィルは約10秒かかります
  • キャッシュ使用時:プリフィルは200msに短縮されます
  • 結果:非常に低い初回トークン遅延と極めて高速な出力

モデルのパフォーマンス指標

  • Qwen3.5-35B-A3B-FP8: 120トークン/秒で開始し、80トークン/秒まで低下しました
  • Qwen3.5-27B-FP8: 20トークン/秒で開始し、わずかに18トークン/秒まで低下しました

OpenClawエージェントのスケーリング

OpenClawは6つのエージェントを同時に実行できるチームを構成でき、速度は120トークン/秒までスケールアップします。テスターはこのスケーリング動作に驚きを表明しました。

この構成での欠点として、シングルスレッドのパフォーマンスが遅いことが挙げられています。

MTP最適化に関する注意点

27B-FP8モデルでMTP(マルチトークン予測)を有効にすると、単一リクエストの生成速度を大幅に向上させることができます:

  • 単一のNVIDIA H100上:20Kコンテキストウィンドウで100トークン/秒を維持
  • 64Kトークンのプリフィル速度:1秒未満

重要な注意点:MTPはプレフィックスキャッシュと競合し、VRAM使用量が非常に大きくなります。RTX 4090ユーザーは、低いnum-steps設定から始めることをお勧めします。

📖 完全なソースを読む: r/openclaw

Ad

👀 See Also

Polsiaプラットフォーム、ライブファウンダー起業で繰り返されるSaaSパターンを提示
News

Polsiaプラットフォーム、ライブファウンダー起業で繰り返されるSaaSパターンを提示

Polsiaは、ユーザーがビジネスを説明し、支払いを行うことで、プラットフォームが自律的に実行する自律型ビジネスプラットフォームです。行動科学者が72時間にわたる創業者のライブ起動を観察し、AI SDR自動化ソリューションや十分に活用されていない国際市場などの反復パターンを特定しました。

OpenClawRadar
PrismMLのBonsai 1-bit Qwenモデルをテスト:8GB VRAMで107 t/sの生成速度を達成
News

PrismMLのBonsai 1-bit Qwenモデルをテスト:8GB VRAMで107 t/sの生成速度を達成

PrismMLのBonsaiモデルは、Qwen3 8B、4B、1.7Bの1ビット量子化バージョンで、RTX 4060(8GB VRAM)上で107トークン/秒の生成速度と>1114トークン/秒のプロンプト処理を実現し、メモリ要件を大幅に削減しています。

OpenClawRadar
Redditの議論は、チャットボットからローカル実行可能な自律エージェントへの移行を強調しています。
News

Redditの議論は、チャットボットからローカル実行可能な自律エージェントへの移行を強調しています。

Redditの投稿では、具体的な例を用いてチャットボットと自律エージェントを区別し、LLaMAなどのモデルがプライベートワークステーションで実行されるローカル実行へのトレンドに注目しています。

OpenClawRadar
OpenClaw 2026.3.11リリースでは、ローカルファーストのOllamaセットアップ、統合されたOpenCodeキー、およびマルチモーダルメモリが追加されました。
News

OpenClaw 2026.3.11リリースでは、ローカルファーストのOllamaセットアップ、統合されたOpenCodeキー、およびマルチモーダルメモリが追加されました。

OpenClaw 2026.3.11では、ローカル専用またはハイブリッドモードによるファーストクラスのOllamaセットアップ、ZenとGoモデルのための統一されたOpenCodeキー管理、Gemini埋め込みを用いたマルチモーダル画像/音声インデックス化を導入します。

OpenClawRadar