Krasis: гибридная среда выполнения для больших моделей MoE на CPU/GPU демонстрирует скорость предзаполнения 3,324 ток/с на RTX 5080

Krasis — это гибридная среда выполнения CPU/GPU, специально разработанная для больших моделей типа Mixture-of-Experts (MoE). Основной подход заключается в использовании GPU для вычислительно затратной фазы предварительного заполнения, в то время как CPU обрабатывает декодирование, а оперативная память системы обеспечивает дополнительную ёмкость для максимальной производительности.
Результаты тестирования
Конфигурация RTX 5080:
- Оборудование: AMD 5900X, DDR4-3200, 1x RTX 5080 16GB, PCIe 4.0 x16
- Qwen3-Coder-Next (80B) Q4: 3324 ток/с предварительное заполнение, 9,7 с TTFT (контекст 35K), 14,9 ток/с декодирование
Конфигурация EPYC:
- Оборудование: AMD EPYC 7742 (64 ядра), DDR4-2666 8-канальная, 1x RTX 2000 Ada 16GB, PCIe 4.0 x8
- Qwen3-Coder-Next (80B) Q4: 1060 ток/с предварительное заполнение, 18,9 с TTFT, 15,8 ток/с декодирование
- Qwen3-Coder-Next (80B) Q8: 873 ток/с предварительное заполнение, 40,1 с TTFT, 12,4 ток/с декодирование
- Qwen3.5-35B-A3B Q4: 1374 ток/с предварительное заполнение, 14,6 с TTFT, 15,0 ток/с декодирование
- Qwen3-235B-A22B Q4: 289 ток/с предварительное заполнение, 69,1 с TTFT, 3,4 ток/с декодирование
- DeepSeek V2-Lite (16B) Q4: 1477 ток/с предварительное заполнение, 13,6 с TTFT, 20,2 ток/с декодирование
- DeepSeek V2-Lite (16B) Q8: 1317 ток/с предварительное заполнение, 15,2 с TTFT, 17,8 ток/с декодирование
Тестирование проводилось с промптами от 10K до 50K токенов для предварительного заполнения (лучшие результаты из 20K/35K/50K) и генерацией 64 токенов для декодирования (среднее из 3 запусков).
Как это работает
В отличие от стандартных сред выполнения, которые выгружают на GPU только несколько слоёв и запускают большую часть модели на CPU, Krasis рассматривает GPU как потоковый вычислительный движок. Он пропускает модель через видеопамять как можно быстрее, скрывая передачу данных под параллельными вычислениями. GPU обрабатывает полный проход предварительного заполнения, затем CPU занимается декодированием.
Компромиссы
- Требует много оперативной памяти: необходимо примерно в 2,5 раза больше оперативной памяти, чем весят квантованные веса модели (например, ~100 ГБ для Qwen3-Coder-Next в Q4)
- Только для карт NVIDIA
- Специально ориентирована на модели MoE (декодирование на плотных моделях будет медленным)
- Первый запуск медленный из-за предварительной обработки и кэширования
- Требует много места на диске: необходим исходный файл BF16 safetensors, а также хранятся кэшированные преобразованные модели (~2x размера квантованной модели)
Поддерживаемые модели
Qwen3-Coder-Next (наиболее тщательно протестирована), Qwen3.5-35B-A3B, Qwen3-235B-A22B и DeepSeek V2-Lite. Другие модели появятся в ближайшее время.
Технические детали
- Написана на Rust + Python (для оркестрации)
- Совместимый с OpenAI API (работает с Cursor, OpenCode и т.д.)
- Интерактивный лаунчер для настройки
- Лицензия SSPL (бесплатно для использования, изменения, распространения)
- GitHub: https://github.com/brontoguana/krasis
Разработчик ищет отзывы о том, какие модели поддерживать дальше, мнения о компромиссах и результаты тестирования от пользователей с картами 5-й серии и PCIe 5.0.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Детерминированная архитектура компилятора для многошаговых LLM-процессов демонстрирует высокие результаты в тестах.
Детерминированная архитектура компиляции для структурированных рабочих процессов LLM использует типизированные реестры узлов, контракты параметров и статическую валидацию для компиляции графов рабочих процессов заранее. Бенчмарки показывают, что она превосходит GPT-4.1 и Claude Sonnet 4.6 при глубине рабочих процессов от 3 до 12+ узлов.

Тестирование ИИ-агентов с реальными API с помощью d3 Labs
d3 labs предлагает 10 бесплатных производственных API, чтобы помочь разработчикам тестировать AI-агентов в реальных сценариях, а не полагаться на нереалистичные макеты.

Приложение Hyper iOS: Диктофон с транскрипцией в реальном времени и извлечением действий
Hyper — это голосовой диктофон для iOS, который транскрибирует разговоры в реальном времени, предоставляет сводки и задачи, а также позволяет задавать вопросы во время беседы с помощью обнаружения ключевого слова. Он предназначен для неструктурированных встреч, таких как личные беседы, кофе-брейки и стендапы.

Сервер Nakkas MCP Создает Анимированные SVG из Описаний ИИ
Nakkas — это MCP-сервер, в котором искусственный интеллект создаёт полные анимированные SVG-конфигурации по описаниям, генерируя чистые анимированные SVG с фигурами, градиентами, анимациями и фильтрами. Он поддерживает параметрические кривые, 15 пресетов фильтров, CSS @keyframes и SMIL-анимации, и работает везде, где рендерится SVG.