Krasis LLM Runtime présente des améliorations de vitesse de 8,9x en préremplissage et de 4,7x en décodage par rapport à Llama.cpp.

✍️ OpenClawRadar📅 Publié: March 17, 2026🔗 Source
Krasis LLM Runtime présente des améliorations de vitesse de 8,9x en préremplissage et de 4,7x en décodage par rapport à Llama.cpp.
Ad

Benchmarks de performance

Krasis démontre des améliorations significatives de performance par rapport à llama.cpp lors de l'exécution sur du matériel équivalent. Sur un seul GPU 5090 limité par PCIE 4.0, Krasis montre :

  • Une vitesse de préremplissage 8,9 fois plus rapide
  • Une vitesse de décodage 4,7 fois plus rapide

Les résultats de benchmark spécifiques pour Qwen3-Coder-Next montrent Krasis fonctionnant sur un seul GPU 5080 16GB atteignant :

  • 1801 tokens/sec en préremplissage
  • 26,8 tokens/sec en décodage

Cela surpasse llama.cpp fonctionnant sur un GPU 5090 32GB avec déchargement de couches.

Changements d'architecture

La dernière version de Krasis a abandonné le système à double format et exécute désormais entièrement le préremplissage et le décodage sur GPU avec différentes stratégies d'optimisation pour chaque phase. Ce changement architectural entraîne :

  • Des exigences CPU réduites
  • Moins de dépendance à la vitesse de la mémoire RAM système
  • Une utilisation globale de la RAM système plus faible (nécessite maintenant seulement assez pour le modèle quantifié plus une certaine marge, comparé à l'exigence précédente de 2,5x le modèle)
Ad

Modèles pris en charge et performance

Les modèles actuellement pris en charge avec leurs performances sur un seul GPU 5090 (PCIE 4.0) sont :

  • Qwen3.5-35B-A3B : 4475 préremplissage, 109,1 décodage
  • Qwen3-Coder-Next : 3560 préremplissage, 70,3 décodage
  • Qwen3.5-122B-A10B : 2897 préremplissage, 27,7 décodage
  • Qwen3-235B-A22B : 2124 préremplissage, 9,3 décodage

Plans de développement futurs

Le développeur prévoit de :

  • Ajouter la prise en charge des modèles Nvidia Nemotron, ciblant spécifiquement Nemotron Super pour les GPU grand public comme le 5080
  • Potentiellement prendre en charge des modèles Nemotron plus grands lorsqu'ils seront publiés
  • Élargir la prise en charge des IDE et des outils pour Opencode et Aider

Fonctionnalités actuelles

Krasis propose actuellement :

  • Un serveur compatible OpenAI
  • Une installation en une seule ligne
  • Disponibilité sur GitHub

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Le Plugin OpenClaw Connecte les Agents IA au Réseau Radio Meshtastic pour un Fonctionnement Hors Réseau
Tools

Le Plugin OpenClaw Connecte les Agents IA au Réseau Radio Meshtastic pour un Fonctionnement Hors Réseau

Un nouveau plugin open source fait le pont entre le framework OpenClaw et le réseau maillé radio LoRa de Meshtastic, permettant des conversations IA, des requêtes API et le contrôle d'appareils sans connexion internet ou cellulaire.

OpenClawRadar
Intégration d'Agents LLM Locaux avec ComfyUI pour la Génération d'Images par Lots en Langage Naturel
Tools

Intégration d'Agents LLM Locaux avec ComfyUI pour la Génération d'Images par Lots en Langage Naturel

Un développeur explique comment il a connecté son agent OpenClaw local à ComfyUI, permettant des commandes en langage naturel pour des flux de travail de génération d'images par lots. L'intégration utilise une compétence d'agent personnalisée qui traduit les requêtes en anglais en JSON de flux de travail ComfyUI et gère la communication API.

OpenClawRadar
Cinq plugins OpenClaw qui traitent des problèmes de production essentiels
Tools

Cinq plugins OpenClaw qui traitent des problèmes de production essentiels

Un utilisateur de Reddit identifie cinq plugins OpenClaw qui résolvent des problèmes courants en production : Manifest pour le routage des modèles, Composio pour la gestion des intégrations, Hyperspell pour la mémoire, Foundry pour l'automatisation des workflows, et Opik pour le traçage.

OpenClawRadar
CLI open-source utilise Claude Haiku pour automatiser l'audit des dépenses Xero
Tools

CLI open-source utilise Claude Haiku pour automatiser l'audit des dépenses Xero

Un développeur a publié un outil CLI Python open-source qui utilise Claude Haiku 4.5 pour automatiser l'audit des dépenses Xero. L'outil suit une approche 'code déterministe d'abord, puis IA pour combler les lacunes', limitant les coûts à quelques centimes par exécution d'audit.

OpenClawRadar