Krasis LLMランタイム、Llama.cppと比較して8.9倍のプリフィル速度と4.7倍のデコード速度向上を実現

パフォーマンスベンチマーク
Krasisは、同等のハードウェアで実行した場合、llama.cppと比較して大幅なパフォーマンス向上を示しています。PCIE 4.0に制限された単一の5090 GPUでは、Krasisは以下の結果を示します:
- 8.9倍高速なプレフィル速度
- 4.7倍高速なデコード速度
Qwen3-Coder-Nextの具体的なベンチマーク結果では、単一の16GB 5080 GPUで実行したKrasisは以下の性能を達成しました:
- プレフィル:1801トークン/秒
- デコード:26.8トークン/秒
これは、レイヤーオフローディングを使用して32GB 5090 GPUで実行したllama.cppを上回る性能です。
アーキテクチャの変更
Krasisの最新バージョンでは、デュアルフォーマットシステムを廃止し、現在はプレフィルとデコードの両方をGPU上で完全に実行し、各フェーズに異なる最適化戦略を適用しています。このアーキテクチャ変更により、以下の結果が得られました:
- CPU要件の削減
- システムRAMメモリ速度への依存度の低下
- 全体的なシステムRAM使用量の削減(以前の2.5倍モデル要件と比較して、量子化モデルと若干のオーバーヘッドのみが必要)
サポートモデルとパフォーマンス
現在サポートされているモデルと、単一の5090 GPU(PCIE 4.0)でのパフォーマンスは以下の通りです:
- Qwen3.5-35B-A3B:プレフィル4475、デコード109.1
- Qwen3-Coder-Next:プレフィル3560、デコード70.3
- Qwen3.5-122B-A10B:プレフィル2897、デコード27.7
- Qwen3-235B-A22B:プレフィル2124、デコード9.3
将来の開発計画
開発者は以下の計画を持っています:
- Nvidia Nemotronモデルのサポート追加、特に5080などのコンシューマーGPU向けのNemotron Superを対象
- リリース時に、より大規模なNemotronモデルのサポートを検討
- OpencodeとAiderのためのIDEおよびツールサポートの拡張
現在の機能
Krasisは現在以下の機能を提供しています:
- OpenAI互換サーバー
- ワンラインインストール
- GitHubでの利用可能
📖 Read the full source: r/LocalLLaMA
👀 See Also

SWE-rebench-V2リリース:コードエージェントトレーニング向け最大規模のオープン多言語データセット
NebiusはSWE-rebench-V2をリリースしました。これは現在、コーディングエージェントのトレーニング用として最大のオープンデータセットであり、大規模な強化学習トレーニングに特化して設計された、RL環境の大規模抽出のための自動化パイプラインを備えています。

AIチームOS:Claudeコードのための自律型組織レイヤー
AI Team OSは、Claude Codeのためのオペレーティングシステム層で、ユーザーのプロンプトを待たずにシステムが自律的に動作し続ける自律ワークフローを作成します。22種類の専門エージェントテンプレート、40以上のMCPツールを含み、Claude Codeサブスクリプション内で完全に動作するため、外部APIコストはかかりません。

Claude Code v2.1.142: 新しいclaudeエージェントフラグ、Opus 4.7のデフォルト化、バグ修正
Claude Code v2.1.142 では、バックグラウンドセッションを設定するための8つの新しいフラグが追加され、高速モードのデフォルトがOpus 4.7に変更され、MCPツールのタイムアウト、macOSのスリープ/ウェイク時のデーモン問題、Windowsネットワークドライブのデッドロックなど、10以上のバグが修正されました。

civStation: 自然言語コマンドで『Civilization VI』をプレイするVLMシステム
civStationは、高水準の自然言語コマンドをゲーム内のアクションに変換することで『Civilization VI』をプレイするコンピューター利用のVLMハーネスです。このシステムは、戦略と実行を分離した3層アーキテクチャを採用し、人間による介入(ヒューマン・イン・ザ・ループ)をサポートしています。