MTP受入率:50%閾値が投機的デコードの恩恵を決定づける

✍️ OpenClawRadar📅 公開日: May 9, 2026🔗 Source
MTP受入率:50%閾値が投機的デコードの恩恵を決定づける
Ad

Redditユーザーが、mlx-vlmを使用してGemma-4(26B、4ビット)でMTP(マルチトークン予測)をテストし、パフォーマンスが候補トークンの受け入れ率に完全に依存することを発見しました。M4 Max Studioでの測定により、具体的な閾値が明らかになりました。

ワークロードの結果

  • コード生成: 75 tok/s → 114.8 tok/s(1.53倍高速) — 受け入れ率:スロットの66%
  • 長文散文: 75 tok/s → 71.1 tok/s(0.95倍、ほぼ横ばい) — 受け入れ率:スロットの31%
  • JSON出力: 51.3 tok/s → 25.6 tok/s(0.50倍、低速化) — 受け入れ率:スロットの8%

閾値は約50%の受け入れ率であるようです。それ以下では、投機的デコードのオーバーヘッドが利得を上回ります。

テストの詳細:コードは「Xを行うPython関数をいくつか書く」、長文散文は「唐王朝の紙幣について800語のエッセイを書く」、JSON出力は、項目を類似性でグループ化して構造化出力を生成するものでした。

おまけのヒント:ユーザーは、GemmaのJSON構造指示のフォローはまずまずだが、構造化出力(json_schema)を有効にすると約20%のオーバーヘッドがかかると指摘しています。多少不正確なJSONを受け入れ、実行時に修正することを推奨しています。mlx-vlmは投機的デコード向けのjson_schemaをサポートしていません。

結論: MTPはローカルコーディングには優れていますが、受け入れ率が低い構造化タスクや散文タスクではパフォーマンスが低下する可能性があります。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claudeプロンプトコード再テスト:L99はよりシャープに、OODAはより狭く、ARTIFACTSは薄れ、そして使用すべき3つの新コード
Tips

Claudeプロンプトコード再テスト:L99はよりシャープに、OODAはより狭く、ARTIFACTSは薄れ、そして使用すべき3つの新コード

L99、OODA、ARTIFACTSのプロンプトコードをClaudeで6ヶ月ぶりに再テストした結果、L99はSonnet 4.6/Opus 4.7でより効果的、OODAは戦略的プロンプトで失敗、ARTIFACTSはコードに不要で、3つの新しいコード(/skeptic、/blindspots、/decompose)が日常的に使える。コードは2つまでに制限。

OpenClawRadar
Claudeコンパクションの回避策:Handoff.MDファイルの使用
Tips

Claudeコンパクションの回避策:Handoff.MDファイルの使用

RedditユーザーがClaudeの会話圧縮メッセージに対する実用的な回避策を共有しています:会話を要約した詳細なhandoff.mdファイルを作成し、そのファイルを使って新しいセッションを開始する方法です。投稿には、ChatGPTを使ってプロンプトを生成する具体的な手順や、指示書を使ったプロジェクト管理の方法が含まれています。

OpenClawRadar
ツールとメモリファイルのスリム化によりOpenClaw Boot Tokensを43%削減
Tips

ツールとメモリファイルのスリム化によりOpenClaw Boot Tokensを43%削減

TOOLS.mdをインデックス化し、ツールの詳細を別ファイルに移動し、段階的なメモリ昇格を実装することで、ブートトークンを約9,457から約5,400へ削減(43%減)。

OpenClawRadar
並列監査エージェント:ClaudeによるVibe Codingテストへの実践的アプローチ
Tips

並列監査エージェント:ClaudeによるVibe Codingテストへの実践的アプローチ

開発者がClaudeを使用して、幻覚検出、API監視、UIストレステスト、PII匿名化、SEO、法的コンプライアンス、行動シミュレーション、デモグラフィックペルソナ、ファネルテスト、事実確認をカバーする10の並列監査エージェントを備えたユーザーテストシステムを構築しました。

OpenClawRadar