Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.

✍️ OpenClawRadar📅 Опубликовано: 17 марта 2026 г.🔗 Source
Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.
Ad

Тесты производительности

Krasis демонстрирует значительное улучшение производительности по сравнению с llama.cpp при работе на аналогичном оборудовании. На одном GPU 5090, ограниченном PCIE 4.0, Krasis показывает:

  • Предварительное заполнение в 8,9 раза быстрее
  • Декодирование в 4,7 раза быстрее

Конкретные результаты тестов для Qwen3-Coder-Next показывают, что Krasis на одном GPU 5080 с 16 ГБ достигает:

  • 1801 токенов/сек при предварительном заполнении
  • 26,8 токенов/сек при декодировании

Это превосходит llama.cpp, работающий на GPU 5090 с 32 ГБ с выгрузкой слоёв.

Изменения в архитектуре

Последняя версия Krasis отказалась от системы двойного формата и теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации для каждой фазы. Это архитектурное изменение приводит к:

  • Снижению требований к CPU
  • Меньшей зависимости от скорости оперативной памяти системы
  • Более низкому общему использованию оперативной памяти системы (теперь требуется только достаточно для квантованной модели плюс некоторый запас, по сравнению с предыдущим требованием в 2,5 раза больше модели)
Ad

Поддерживаемые модели и производительность

Текущие поддерживаемые модели с их производительностью на одном GPU 5090 (PCIE 4.0):

  • Qwen3.5-35B-A3B: 4475 предварительное заполнение, 109,1 декодирование
  • Qwen3-Coder-Next: 3560 предварительное заполнение, 70,3 декодирование
  • Qwen3.5-122B-A10B: 2897 предварительное заполнение, 27,7 декодирование
  • Qwen3-235B-A22B: 2124 предварительное заполнение, 9,3 декодирование

Планы будущей разработки

Разработчик планирует:

  • Добавить поддержку моделей Nvidia Nemotron, в частности нацелившись на Nemotron Super для потребительских GPU, таких как 5080
  • Возможно, поддержать более крупные модели Nemotron после их выпуска
  • Расширить поддержку IDE и инструментов для Opencode и Aider

Текущие возможности

В настоящее время Krasis предлагает:

  • Сервер, совместимый с OpenAI
  • Установку одной командой
  • Доступность на GitHub

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Автоматизируйте ежедневные брифинги в персонализированные подкасты Spotify с помощью OpenClaw и CLI Save to Spotify
Инструменты

Автоматизируйте ежедневные брифинги в персонализированные подкасты Spotify с помощью OpenClaw и CLI Save to Spotify

OpenClaw запускается ежедневно в 7 утра, собирает Slack-треды, уведомления GitHub и календарь, обобщает в mp3 и загружает как приватный эпизод через CLI Save to Spotify. Работает на Free и Premium.

OpenClawRadar
StartClaw: Инструмент для автоматизации безголовых браузеров, созданный на основе ZeroClaw с интеграцией Claude
Инструменты

StartClaw: Инструмент для автоматизации безголовых браузеров, созданный на основе ZeroClaw с интеграцией Claude

StartClaw — это инструмент для автоматизации браузера, созданный на основе Rust-реализации ZeroClaw с интеграцией Composio v3, предназначенный для работы в облаке без использования локального оборудования. Он использует исключительно Claude для обеспечения надёжности и включает встроенное сжатие контекста, которое сокращает использование токенов примерно в 5 раз.

OpenClawRadar
ClawVibe: Бесплатный голосовой ассистент для iOS для AI-агентов с STT/TTS на устройстве
Инструменты

ClawVibe: Бесплатный голосовой ассистент для iOS для AI-агентов с STT/TTS на устройстве

ClawVibe — это нативное iOS-приложение, обеспечивающее голосовое взаимодействие с AI-агентами без помощи рук во время поездок. Оно использует локальное распознавание речи и TTS, поддерживает CarPlay и применяет голосовую биометрию для фильтрации фонового шума. По сети передаётся только текст.

OpenClawRadar
OmniRecall Beta: Внедрение памяти на основе FAISS для облачных чатов с LLM.
Инструменты

OmniRecall Beta: Внедрение памяти на основе FAISS для облачных чатов с LLM.

OmniRecall — это локальный обход mitmproxy, который перехватывает трафик к облачным чат-интерфейсам, таким как DeepSeek, добавляя постоянный слой памяти с использованием индексации FAISS и sentence-transformers MiniLM-L6. В настоящее время находится в бета-версии, требует работы только на CPU и использует агрессивно ограничивающую лицензию с доступом к исходному коду.

OpenClawRadar