Среда выполнения Krasis LLM демонстрирует ускорение предзаполнения в 8,9 раза и ускорение декодирования в 4,7 раза по сравнению с Llama.cpp.

Тесты производительности
Krasis демонстрирует значительное улучшение производительности по сравнению с llama.cpp при работе на аналогичном оборудовании. На одном GPU 5090, ограниченном PCIE 4.0, Krasis показывает:
- Предварительное заполнение в 8,9 раза быстрее
- Декодирование в 4,7 раза быстрее
Конкретные результаты тестов для Qwen3-Coder-Next показывают, что Krasis на одном GPU 5080 с 16 ГБ достигает:
- 1801 токенов/сек при предварительном заполнении
- 26,8 токенов/сек при декодировании
Это превосходит llama.cpp, работающий на GPU 5090 с 32 ГБ с выгрузкой слоёв.
Изменения в архитектуре
Последняя версия Krasis отказалась от системы двойного формата и теперь полностью выполняет как предварительное заполнение, так и декодирование на GPU с различными стратегиями оптимизации для каждой фазы. Это архитектурное изменение приводит к:
- Снижению требований к CPU
- Меньшей зависимости от скорости оперативной памяти системы
- Более низкому общему использованию оперативной памяти системы (теперь требуется только достаточно для квантованной модели плюс некоторый запас, по сравнению с предыдущим требованием в 2,5 раза больше модели)
Поддерживаемые модели и производительность
Текущие поддерживаемые модели с их производительностью на одном GPU 5090 (PCIE 4.0):
- Qwen3.5-35B-A3B: 4475 предварительное заполнение, 109,1 декодирование
- Qwen3-Coder-Next: 3560 предварительное заполнение, 70,3 декодирование
- Qwen3.5-122B-A10B: 2897 предварительное заполнение, 27,7 декодирование
- Qwen3-235B-A22B: 2124 предварительное заполнение, 9,3 декодирование
Планы будущей разработки
Разработчик планирует:
- Добавить поддержку моделей Nvidia Nemotron, в частности нацелившись на Nemotron Super для потребительских GPU, таких как 5080
- Возможно, поддержать более крупные модели Nemotron после их выпуска
- Расширить поддержку IDE и инструментов для Opencode и Aider
Текущие возможности
В настоящее время Krasis предлагает:
- Сервер, совместимый с OpenAI
- Установку одной командой
- Доступность на GitHub
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

LetMeWatch: Python-плагин добавляет анализ видео в Claude через обнаружение сцен с помощью FFmpeg
Разработчик создал плагин на Python под названием LetMeWatch, который позволяет Клоду анализировать видео, используя FFmpeg для обнаружения сцен, извлекая только кадры, где меняется изображение, добавляя к ним временные метки и передавая их партиями в мультимодальное зрение Клода.

Claude для творческой работы: MCP-коннекторы для Blender, Adobe, Ableton и других
Anthropic выпустила набор MCP-коннекторов, позволяющих Claude взаимодействовать с творческими инструментами, включая Blender, Autodesk Fusion, Adobe Creative Cloud, Ableton Live и Splice, обеспечивая управление на естественном языке, скриптинг и автоматизацию пайплайнов.

Холодная архитектура валидации: система проверки кода с двумя агентами стала открытой
Система с открытым исходным кодом использует двух отдельных ИИ-агентов для проверки кода: один создаёт код, другой проверяет его, не имея никакого контекста о рассуждениях создателя. Проверяющий видит только план, изменения в коде и результаты тестов.

Анализ архитектуры Claude Code на основе утекших исходных карт
Анализ кодовой базы Claude Code на TypeScript объемом 512 000 строк выявил среду выполнения на основе Bun с CLI на React/Ink, более 100 команд, более 38 инструментов и координацию нескольких агентов. Система использует Zod для валидации, OpenTelemetry для телеметрии и включает механизмы сжатия контекста.