Krasis: 大規模MoEモデルのためのハイブリッドCPU/GPUランタイム、RTX 5080で3,324 tok/sのプリフィルを達成

Krasisは、大規模なMixture-of-Experts(MoE)モデルに特化して設計されたハイブリッドCPU/GPUランタイムです。コアとなるアプローチは、計算コストの高いプリフィルフェーズをGPUで処理し、デコードをCPUで担当するもので、システムRAMが追加の容量を提供してパフォーマンスを最大化します。
ベンチマーク結果
RTX 5080構成:
- ハードウェア: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
- Qwen3-Coder-Next (80B) Q4: 3,324トークン/秒 プリフィル, 9.7秒 TTFT (35Kコンテキスト), 14.9トークン/秒 デコード
EPYC構成:
- ハードウェア: AMD EPYC 7742 (64コア), DDR4-2666 8チャネル, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
- Qwen3-Coder-Next (80B) Q4: 1,060トークン/秒 プリフィル, 18.9秒 TTFT, 15.8トークン/秒 デコード
- Qwen3-Coder-Next (80B) Q8: 873トークン/秒 プリフィル, 40.1秒 TTFT, 12.4トークン/秒 デコード
- Qwen3.5-35B-A3B Q4: 1,374トークン/秒 プリフィル, 14.6秒 TTFT, 15.0トークン/秒 デコード
- Qwen3-235B-A22B Q4: 289トークン/秒 プリフィル, 69.1秒 TTFT, 3.4トークン/秒 デコード
- DeepSeek V2-Lite (16B) Q4: 1,477トークン/秒 プリフィル, 13.6秒 TTFT, 20.2トークン/秒 デコード
- DeepSeek V2-Lite (16B) Q8: 1,317トークン/秒 プリフィル, 15.2秒 TTFT, 17.8トークン/秒 デコード
ベンチマークでは、プリフィルに10K〜50Kトークンのプロンプトを使用し(20K/35K/50Kの最良値を報告)、デコードには64トークンの生成を3回実行した平均値を使用しています。
仕組み
標準的なランタイムがGPUに数層のみをオフロードし、モデルの大部分をCPUで実行するのとは異なり、KrasisはGPUをストリーミングコンピュートエンジンとして扱います。VRAMを通じてモデルを可能な限り高速に処理し、転送を並行計算の下に隠蔽します。GPUが完全なプリフィルパスを処理した後、CPUがデコードを担当します。
トレードオフ
- RAMを大量に消費: 量子化されたモデルウェイトの約2.5倍のシステムRAMが必要(例: Qwen3-Coder-Next Q4で約100GB)
- NVIDIAカードのみ対応
- MoEモデルに特化(密なモデルではデコードが遅くなる)
- 初回実行は前処理とキャッシングにより遅い
- ディスクを大量に消費: 元のBF16 safetensorsファイルが必要で、キャッシュされたトランスコードモデルを保存(量子化モデルサイズの約2倍)
対応モデル
Qwen3-Coder-Next(最も徹底的にテスト済み)、Qwen3.5-35B-A3B、Qwen3-235B-A22B、DeepSeek V2-Lite。その他のモデルは近日対応予定。
技術詳細
- Rust + Pythonで記述(オーケストレーション用)
- OpenAI互換API(Cursor、OpenCodeなどで動作)
- 設定用のインタラクティブランチャー
- SSPLライセンス(無料で使用、改変、配布可能)
- GitHub: https://github.com/brontoguana/krasis
開発者は、次にどのモデルをサポートすべきか、トレードオフに関する意見、5シリーズカードとPCIe 5.0を搭載したユーザーからのベンチマークについてフィードバックを求めています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

コーディングフラッシュカード:Rust、SQLite、Godot、Wolfram言語向け800枚以上のAnkiカード
Rust、SQLite、Godot、Wolfram Languageを基本原理から学べる800枚以上のMarkdownフラッシュカード。AnkiデッキやPDFに変換するスクリプト付き。

SwiftUIとSwift 6.2を使用したiOS 26開発のための23のエージェントスキル
ある開発者が、iOS 26+とSwift 6.2を対象とした23のエージェントスキルを作成し、非推奨APIや古いパターンによる誤った生成(ハルシネーション)の問題に対処しました。これらのスキルは、SwiftUI、SwiftData、StoreKit 2、プッシュ通知、ネットワーキング、並行処理、アクセシビリティ、ローカライゼーション、WidgetKit、MapKitなどをカバーしています。

多段階LLMワークフローのための決定論的コンパイラアーキテクチャが強力なベンチマーク結果を示す
構造化されたLLMワークフローのための決定論的コンパイルアーキテクチャは、型付きノードレジストリ、パラメータ契約、静的検証を使用して、ワークフローグラフを事前にコンパイルします。ベンチマークでは、3〜12以上のノード深度にわたるワークフローで、GPT-4.1およびClaude Sonnet 4.6を上回る性能を示しています。

Prism MCP v5.1は、10倍のメモリ圧縮と修正からのエージェント学習を追加します。
Prism MCP v5.1は、TypeScriptに移植されたTurboQuantによる10倍のメモリ圧縮を導入し、ベクトルデータベースなしでラップトップ上に数百万のメモリを実現します。このアップデートでは、ユーザーの修正からエージェントが学習する機能と、視覚的なナレッジグラフインターフェースが追加されました。