RTX 4090におけるQwen3.5モデルの2Kから400Kコンテキストのベンチマーク結果

RTX 4090でのQwen3.5性能テスト
開発者がRTX 4090 GPUで実行したQwen3.5モデルのベンチマーク結果を共有し、2,048から400,000トークンまでのコンテキストウィンドウをテストしました。テストは当初262kコンテキストを計画していましたが、yarnやその他の方法を使用して400kまで拡張されました。
テストされたモデル
以下のQwen3.5モデルバリアントがベンチマークされました:
- Qwen3.5-0.8B-Q4_K_M
- Qwen3.5-0.8B-bf16
- Qwen3.5-2B-Q4_K_M
- Qwen3.5-2B-bf16
- Qwen3.5-4B-Q4_K_M
- Qwen3.5-4B-bf16
- Qwen3.5-9B-Q4_K_M
- Qwen3.5-9B-bf16
- Qwen3.5-27B-Q4_K_M
- Qwen3.5-35B-A3B-Q4_K_M
テストされたコンテキストウィンドウ
モデルは以下の特定のコンテキスト長で評価されました:2048、4096、8192、32768、65536、98304、131072、196608、262144、327680、360448、393216、および400000トークン。
テスト方法論
ベンチマークスクリプトは、8ビットおよび4ビットKVキャッシュを使用したNGL設定で可能な限り最高のトークン/秒速度を達成するように構成されました。開発者は、初回トークンまでの時間(TTFT)が最初は長く見えるものの、Warm TTFT Avg (s)列はKVキャッシュがロードされた後のより良い性能を示していると指摘しました。コンテキストは意図的に最初のインタラクションで完全にロードされました。
コンテキスト能力をテストするため、モデルにはログを要約する1文のプロンプトが与えられ、その後2kから400kトークンのログデータが続けられました。開発者はいくつかの不一致を報告しましたが、全体的には満足のいく性能でした。
現在の状況と次のステップ
3つのモデルがテスト中に失敗し、KVオフロードテストが進行中です:Qwen3.5-4B-bf16、Qwen3.5-27B-Q4_K_M、およびQwen3.5-35B-A3B-Q4_K_M。開発者はスクリプトの問題で24時間の実行時間が無駄になった後、これらのテストを再開する必要がありました。
VRAMオフロードテストが完了したら、開発者は結果を基盤モデルと比較する計画を立てており、分析のために出力を保存しています。開発者は特に9Bおよび27Bの高密度モデルの性能に驚きを表明しました。
開発者は、どのモデルと比較すべきか、および評価のための評価方法論についてコミュニティからの意見を求めています。
📖 完全なソースを読む: r/openclaw
👀 See Also

マーク・ザッカーバーグ、CEO補助のためのAIエージェントを開発中
ウォール・ストリート・ジャーナルの報道によると、マーク・ザッカーバーグはCEOの職務を支援するAIエージェントを構築しているとのことです。この記事はHacker Newsで37ポイント、30コメントを獲得して議論されました。

NVIDIAがOpenShellセキュリティ機能を備えたNemoClawを発表
NVIDIAはGTCでNemoClawを発表し、OpenClawを基盤として、AIエージェント向けにポリシーベースのプライバシーとセキュリティガードレールを実施するOpenShellを通じて、エンタープライズレベルのセキュリティを追加しました。

非営利団体がチームおよびエンタープライズプランでClaude Opus 4.6にアクセス可能に
チームおよびエンタープライズプランを利用している非営利団体は、Anthropicの最新AIモデル「Claude Opus 4.6」に追加費用なしでアクセスできるようになりました。

Anthropic、Claudeサブスクリプションからプログラム利用を分離:6月15日から新クレジットプール開始
6月15日より、Claudeのサブスクリプションにはプログラム使用(Agent SDK、claude -p、Claude Code GitHub Actions)専用の月間クレジット枠が設けられます。インタラクティブ用クレジットでプログラム呼び出しを補助することはなくなり、枠を使い切ると、ユーザーはAPIの全額料金を支払うことになります。