Qwen3.5-27B-FP8のパフォーマンスベンチマークをOpenClawエージェントで実施

✍️ OpenClawRadar📅 公開日: February 28, 2026🔗 Source
Qwen3.5-27B-FP8のパフォーマンスベンチマークをOpenClawエージェントで実施
Ad

コミュニティテストによるパフォーマンスベンチマーク

コミュニティテストは、48GB VRAMを搭載した単一の改造RTX 4090 GPUを使用して実施されました。公式のQwen3.5-35B-A3B-FP8およびQwen3.5-27B-FP8モデルが256Kのコンテキスト長でテストされました。

フレームワーク推奨事項

SGLangが推奨されます。これはプレフィックスキャッシュを完全にサポートする唯一のフレームワークであり、Qwen3.5のハイブリッドアテンションアーキテクチャに不可欠です。

  • 100Kコンテキストの場合:コールドスタートのプリフィルは約10秒かかります
  • キャッシュ使用時:プリフィルは200msに短縮されます
  • 結果:非常に低い初回トークン遅延と極めて高速な出力

モデルのパフォーマンス指標

  • Qwen3.5-35B-A3B-FP8: 120トークン/秒で開始し、80トークン/秒まで低下しました
  • Qwen3.5-27B-FP8: 20トークン/秒で開始し、わずかに18トークン/秒まで低下しました

OpenClawエージェントのスケーリング

OpenClawは6つのエージェントを同時に実行できるチームを構成でき、速度は120トークン/秒までスケールアップします。テスターはこのスケーリング動作に驚きを表明しました。

この構成での欠点として、シングルスレッドのパフォーマンスが遅いことが挙げられています。

MTP最適化に関する注意点

27B-FP8モデルでMTP(マルチトークン予測)を有効にすると、単一リクエストの生成速度を大幅に向上させることができます:

  • 単一のNVIDIA H100上:20Kコンテキストウィンドウで100トークン/秒を維持
  • 64Kトークンのプリフィル速度:1秒未満

重要な注意点:MTPはプレフィックスキャッシュと競合し、VRAM使用量が非常に大きくなります。RTX 4090ユーザーは、低いnum-steps設定から始めることをお勧めします。

📖 完全なソースを読む: r/openclaw

Ad

👀 See Also

Claude Code開発者は適応的思考の欠陥を認め、回避策を提供
News

Claude Code開発者は適応的思考の欠陥を認め、回避策を提供

Claude Codeの作成者であるBoris Charnyは、適応的思考機能にパフォーマンス低下を引き起こす欠陥があることを確認しました。effort=high設定でも問題が発生しているユーザーは、一時的な回避策としてCLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1を使用できます。

OpenClawRadar
ペンタゴン、アンソロピックにAI倫理規定の撤廃を金曜日までに要求
News

ペンタゴン、アンソロピックにAI倫理規定の撤廃を金曜日までに要求

ポリティコの報道によると、米国防総省はアンソロピックに対し、AI倫理規定を廃棄するよう金曜日までに期限を設けた。この記事はハッカーニュースで15ポイントと3コメントを獲得した。

OpenClawRadar
クロード・オーパス 4.7 分析:最高の知性を備えるが、コスト高で冗長
News

クロード・オーパス 4.7 分析:最高の知性を備えるが、コスト高で冗長

Claude Opus 4.7(適応推論、最大努力)は、Artificial Analysis知能指数で133モデル中1位を獲得し、スコア57を記録しましたが、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルのコストがかかり、平均よりも大幅に高価です。

OpenClawRadar
GitHub Copilot、モデルトレーニングのためのデータ利用ポリシーを更新
News

GitHub Copilot、モデルトレーニングのためのデータ利用ポリシーを更新

GitHubは、2026年4月24日から、ユーザーがオプトアウトしない限り、Copilot Free、Pro、Pro+ユーザーのインタラクションデータをAIモデルのトレーニングに使用します。Copilot BusinessおよびEnterpriseユーザーはこの変更の対象外です。

OpenClawRadar