Krasis: 大規模MoEモデルのためのハイブリッドCPU/GPUランタイム、RTX 5080で3,324 tok/sのプリフィルを達成

✍️ OpenClawRadar📅 公開日: February 27, 2026🔗 Source
Krasis: 大規模MoEモデルのためのハイブリッドCPU/GPUランタイム、RTX 5080で3,324 tok/sのプリフィルを達成
Ad

Krasisは、大規模なMixture-of-Experts(MoE)モデルに特化して設計されたハイブリッドCPU/GPUランタイムです。コアとなるアプローチは、計算コストの高いプリフィルフェーズをGPUで処理し、デコードをCPUで担当するもので、システムRAMが追加の容量を提供してパフォーマンスを最大化します。

ベンチマーク結果

RTX 5080構成:

  • ハードウェア: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
  • Qwen3-Coder-Next (80B) Q4: 3,324トークン/秒 プリフィル, 9.7秒 TTFT (35Kコンテキスト), 14.9トークン/秒 デコード

EPYC構成:

  • ハードウェア: AMD EPYC 7742 (64コア), DDR4-2666 8チャネル, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
  • Qwen3-Coder-Next (80B) Q4: 1,060トークン/秒 プリフィル, 18.9秒 TTFT, 15.8トークン/秒 デコード
  • Qwen3-Coder-Next (80B) Q8: 873トークン/秒 プリフィル, 40.1秒 TTFT, 12.4トークン/秒 デコード
  • Qwen3.5-35B-A3B Q4: 1,374トークン/秒 プリフィル, 14.6秒 TTFT, 15.0トークン/秒 デコード
  • Qwen3-235B-A22B Q4: 289トークン/秒 プリフィル, 69.1秒 TTFT, 3.4トークン/秒 デコード
  • DeepSeek V2-Lite (16B) Q4: 1,477トークン/秒 プリフィル, 13.6秒 TTFT, 20.2トークン/秒 デコード
  • DeepSeek V2-Lite (16B) Q8: 1,317トークン/秒 プリフィル, 15.2秒 TTFT, 17.8トークン/秒 デコード

ベンチマークでは、プリフィルに10K〜50Kトークンのプロンプトを使用し(20K/35K/50Kの最良値を報告)、デコードには64トークンの生成を3回実行した平均値を使用しています。

Ad

仕組み

標準的なランタイムがGPUに数層のみをオフロードし、モデルの大部分をCPUで実行するのとは異なり、KrasisはGPUをストリーミングコンピュートエンジンとして扱います。VRAMを通じてモデルを可能な限り高速に処理し、転送を並行計算の下に隠蔽します。GPUが完全なプリフィルパスを処理した後、CPUがデコードを担当します。

トレードオフ

  • RAMを大量に消費: 量子化されたモデルウェイトの約2.5倍のシステムRAMが必要(例: Qwen3-Coder-Next Q4で約100GB)
  • NVIDIAカードのみ対応
  • MoEモデルに特化(密なモデルではデコードが遅くなる)
  • 初回実行は前処理とキャッシングにより遅い
  • ディスクを大量に消費: 元のBF16 safetensorsファイルが必要で、キャッシュされたトランスコードモデルを保存(量子化モデルサイズの約2倍)

対応モデル

Qwen3-Coder-Next(最も徹底的にテスト済み)、Qwen3.5-35B-A3B、Qwen3-235B-A22B、DeepSeek V2-Lite。その他のモデルは近日対応予定。

技術詳細

  • Rust + Pythonで記述(オーケストレーション用)
  • OpenAI互換API(Cursor、OpenCodeなどで動作)
  • 設定用のインタラクティブランチャー
  • SSPLライセンス(無料で使用、改変、配布可能)
  • GitHub: https://github.com/brontoguana/krasis

開発者は、次にどのモデルをサポートすべきか、トレードオフに関する意見、5シリーズカードとPCIe 5.0を搭載したユーザーからのベンチマークについてフィードバックを求めています。

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

コーディングフラッシュカード:Rust、SQLite、Godot、Wolfram言語向け800枚以上のAnkiカード
Tools

コーディングフラッシュカード:Rust、SQLite、Godot、Wolfram言語向け800枚以上のAnkiカード

Rust、SQLite、Godot、Wolfram Languageを基本原理から学べる800枚以上のMarkdownフラッシュカード。AnkiデッキやPDFに変換するスクリプト付き。

OpenClawRadar
SwiftUIとSwift 6.2を使用したiOS 26開発のための23のエージェントスキル
Tools

SwiftUIとSwift 6.2を使用したiOS 26開発のための23のエージェントスキル

ある開発者が、iOS 26+とSwift 6.2を対象とした23のエージェントスキルを作成し、非推奨APIや古いパターンによる誤った生成(ハルシネーション)の問題に対処しました。これらのスキルは、SwiftUI、SwiftData、StoreKit 2、プッシュ通知、ネットワーキング、並行処理、アクセシビリティ、ローカライゼーション、WidgetKit、MapKitなどをカバーしています。

OpenClawRadar
多段階LLMワークフローのための決定論的コンパイラアーキテクチャが強力なベンチマーク結果を示す
Tools

多段階LLMワークフローのための決定論的コンパイラアーキテクチャが強力なベンチマーク結果を示す

構造化されたLLMワークフローのための決定論的コンパイルアーキテクチャは、型付きノードレジストリ、パラメータ契約、静的検証を使用して、ワークフローグラフを事前にコンパイルします。ベンチマークでは、3〜12以上のノード深度にわたるワークフローで、GPT-4.1およびClaude Sonnet 4.6を上回る性能を示しています。

OpenClawRadar
Prism MCP v5.1は、10倍のメモリ圧縮と修正からのエージェント学習を追加します。
Tools

Prism MCP v5.1は、10倍のメモリ圧縮と修正からのエージェント学習を追加します。

Prism MCP v5.1は、TypeScriptに移植されたTurboQuantによる10倍のメモリ圧縮を導入し、ベクトルデータベースなしでラップトップ上に数百万のメモリを実現します。このアップデートでは、ユーザーの修正からエージェントが学習する機能と、視覚的なナレッジグラフインターフェースが追加されました。

OpenClawRadar