Qwen3.6 27B & 35B on vLLM: 単一Radeon R9700チューニング結果

✍️ OpenClawRadar📅 公開日: August 9, 2026🔗 Source
Ad

r/LocalLLaMAの投稿で、単一のRadeon AI Pro R9700上で、vLLM RadianceをPodman経由で使用し、Qwen3.6 27B(dense)と35B(MoE)を実行する方法が詳しく説明されています。著者は正確な設定とベンチマーク結果を共有しており、これは特にAMD GPUユーザーにとって有益です。

セットアップと主要な差分

彼らはstilldeadcode/vllm-radiance:0.5.8コンテナを使用しています。このコンテナには、デュアルR9700でテンソル並列処理(TP=2)を使用し、FP8ウェイト向けに調整された参照設定が同梱されています。単一カードでINT4ウェイトを使用する場合、以下の変更が必要です:

  • --tensor-parallel-size 1(2枚目のカードなし)
  • --gpu-memory-utilization 0.98(参照では0.90–0.97)
  • 27Bではnum_speculative_tokens=4 — 2/3/4/8をラダーテストし、4が全深度で8より17–48%高速でした。

ウェイトAvesed/Qwen3.6-{27B,35B}-INT4-W4A16(圧縮テンソル、group_size 32)です。35BをFP8で実行すると、32GBカードでは実用的なコンテキスト長で収まりません。

重要な修正: tokenizer.json

Avesed INT4リポジトリには、truncation.max_lengthが512に設定され、paddingFixed(512)になっているtokenizer.jsonが含まれています(おそらくキャリブレーション由来)。これにより、約672px以上のビジョンが壊れます。修正方法: 両方をnullに設定します。

Ad

ベンチマーク結果

35B-A3B MoE(KVプールトークン = 440,241)

深度プリフィル tok/sデコード tok/s
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B dense、MTP spec=4(KVプールトークン = 212,147)

深度プリフィル tok/sデコード tok/s平均受容長
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

注目すべき点: 35B MoEはプリフィルスループットがはるかに高い(最大7.8k tok/s vs 1.3k)一方、デコード速度は同等です。27BのMTP投機は、約4.5トークンの受容長を実現します。

これは、デュアルGPUを持たず、これらのモデルをローカルで実行したいAMDユーザーにとって実用的な構成です。著者は要求に応じて起動スクリプトを提供する用意があります。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

ClaudeMeter:リアルタイムClaude使用状況トラッキングのためのオープンソースmacOSメニューバーアプリ
Tools

ClaudeMeter:リアルタイムClaude使用状況トラッキングのためのオープンソースmacOSメニューバーアプリ

ClaudeMeterは、Claude Maxのサブスクライバー向けの無料でオープンソースのmacOSメニューバーアプリです。ワークフローを中断することなく、セッションと週間の使用率、リセットタイマー、ペースインジケーターを表示します。このアプリ全体は、Swiftコード、Supabaseバックエンド、Edge FunctionsのためにClaude(Claude Code/Opus)を使用して構築されました。

OpenClawRadar
NERFオープンソースAIセキュリティエンジニアリングプラットフォームがパブリックベータを開始
Tools

NERFオープンソースAIセキュリティエンジニアリングプラットフォームがパブリックベータを開始

NERFは、117のドメインにわたる攻撃的、防御的、プライバシー保護のセキュリティ技術をカバーするオープンソースのAIセキュリティエンジニアリングプラットフォームおよび自律コーディングエージェントです。9つの自動検出モード、26のLLMプロバイダーサポート、39のフレームワークに対するコンプライアンス自動化を特徴としています。

OpenClawRadar
オープンクローで持続可能なAI知識インフラを構築する
Tools

オープンクローで持続可能なAI知識インフラを構築する

開発者がAIセットアップで一般的なステートレス問題に対処するため、OpenClaw上に「Brain」という完全な知識インフラストラクチャシステムを構築しました。このシステムは、Ollama、Postgres、MongoDB、Qdrant、Memgraphを使用し、完全にローカルハードウェア上で動作します。

OpenClawRadar
Cowork Context Management KitがClaudeのファイル過負荷問題を解決
Tools

Cowork Context Management KitがClaudeのファイル過負荷問題を解決

Claude AIがプロジェクトフォルダ内の462ファイルすべてを読み込んでパフォーマンス問題と矛盾が生じた後、ある開発者がCowork向けのコンテキスト管理キットを構築しました。この解決策には、グローバル指示、マニフェストファイルシステム、関連文書を優先するCoworkスキルが含まれています。

OpenClawRadar