RTX 4090におけるQwen3.5モデルの2Kから400Kコンテキストのベンチマーク結果

✍️ OpenClawRadar📅 公開日: March 7, 2026🔗 Source
RTX 4090におけるQwen3.5モデルの2Kから400Kコンテキストのベンチマーク結果
Ad

RTX 4090でのQwen3.5性能テスト

開発者がRTX 4090 GPUで実行したQwen3.5モデルのベンチマーク結果を共有し、2,048から400,000トークンまでのコンテキストウィンドウをテストしました。テストは当初262kコンテキストを計画していましたが、yarnやその他の方法を使用して400kまで拡張されました。

テストされたモデル

以下のQwen3.5モデルバリアントがベンチマークされました:

  • Qwen3.5-0.8B-Q4_K_M
  • Qwen3.5-0.8B-bf16
  • Qwen3.5-2B-Q4_K_M
  • Qwen3.5-2B-bf16
  • Qwen3.5-4B-Q4_K_M
  • Qwen3.5-4B-bf16
  • Qwen3.5-9B-Q4_K_M
  • Qwen3.5-9B-bf16
  • Qwen3.5-27B-Q4_K_M
  • Qwen3.5-35B-A3B-Q4_K_M

テストされたコンテキストウィンドウ

モデルは以下の特定のコンテキスト長で評価されました:2048、4096、8192、32768、65536、98304、131072、196608、262144、327680、360448、393216、および400000トークン。

Ad

テスト方法論

ベンチマークスクリプトは、8ビットおよび4ビットKVキャッシュを使用したNGL設定で可能な限り最高のトークン/秒速度を達成するように構成されました。開発者は、初回トークンまでの時間(TTFT)が最初は長く見えるものの、Warm TTFT Avg (s)列はKVキャッシュがロードされた後のより良い性能を示していると指摘しました。コンテキストは意図的に最初のインタラクションで完全にロードされました。

コンテキスト能力をテストするため、モデルにはログを要約する1文のプロンプトが与えられ、その後2kから400kトークンのログデータが続けられました。開発者はいくつかの不一致を報告しましたが、全体的には満足のいく性能でした。

現在の状況と次のステップ

3つのモデルがテスト中に失敗し、KVオフロードテストが進行中です:Qwen3.5-4B-bf16、Qwen3.5-27B-Q4_K_M、およびQwen3.5-35B-A3B-Q4_K_M。開発者はスクリプトの問題で24時間の実行時間が無駄になった後、これらのテストを再開する必要がありました。

VRAMオフロードテストが完了したら、開発者は結果を基盤モデルと比較する計画を立てており、分析のために出力を保存しています。開発者は特に9Bおよび27Bの高密度モデルの性能に驚きを表明しました。

開発者は、どのモデルと比較すべきか、および評価のための評価方法論についてコミュニティからの意見を求めています。

📖 完全なソースを読む: r/openclaw

Ad

👀 See Also

AIエージェントがW杯に賭ける:なぜ「複数の結果を考慮する」戦略が勝利するのか
News

AIエージェントがW杯に賭ける:なぜ「複数の結果を考慮する」戦略が勝利するのか

40以上のAIエージェントがPolymarketで実際の資金を使って賭けを行った実験では、利益を上げたエージェントが1試合で複数の結果に賭ける傾向が強いことが示された。その違いは信念と行動の分離にある。

OpenClawRadar
プロンプティングから仕様エンジニアリングへ:プランナー・ワーカーアーキテクチャの転換
News

プロンプティングから仕様エンジニアリングへ:プランナー・ワーカーアーキテクチャの転換

AI開発は、単純なチャットベースのプロンプトから、人間が仕様エンジニアとして機能するプランナー・ワーカーアーキテクチャへと移行しています。これには、自律型AIエージェントのための厳格な受入基準、制約アーキテクチャ、および分解パターンの定義が必要です。

OpenClawRadar
ユーザー報告:実用的なコーディングタスクにおいてSonnet 4.6がOpus 4.6を上回る
News

ユーザー報告:実用的なコーディングタスクにおいてSonnet 4.6がOpus 4.6を上回る

Claude AIモデルをテストした開発者は、Opus 4.6が過剰設計のソリューションを生成しパフォーマンスに問題がある一方、Sonnet 4.6はより慎重で効率的な修正を低いトークン使用量で提供したと報告しています。

OpenClawRadar
Claude Code v2.1.86:セッションヘッダー、メモリ修正、トークン最適化
News

Claude Code v2.1.86:セッションヘッダー、メモリ修正、トークン最適化

Claude Code v2.1.86は、プロキシ集約のためのX-Claude-Code-Session-Idヘッダーの追加、長時間セッションでのメモリ増加の修正、@を使用したファイル言及時のトークンオーバーヘッドの削減を実装しました。このリリースでは、Windowsでの設定ファイル破損やOAuth URLコピー問題を含む18の特定の問題に対処しています。

OpenClawRadar