Krasis LLM Runtime Muestra Mejoras de Velocidad de 8.9x en Prellenado y 4.7x en Decodificación en Comparación con Llama.cpp

✍️ OpenClawRadar📅 Publicado: 17 de marzo de 2026🔗 Source
Krasis LLM Runtime Muestra Mejoras de Velocidad de 8.9x en Prellenado y 4.7x en Decodificación en Comparación con Llama.cpp
Ad

Benchmarks de Rendimiento

Krasis demuestra mejoras significativas de rendimiento sobre llama.cpp cuando se ejecuta en hardware equivalente. En una sola GPU 5090 limitada por PCIE 4.0, Krasis muestra:

  • Velocidad de prellenado 8.9 veces más rápida
  • Velocidad de decodificación 4.7 veces más rápida

Los resultados específicos de benchmark para Qwen3-Coder-Next muestran a Krasis ejecutándose en una sola GPU 5080 de 16GB logrando:

  • 1801 tokens/seg prellenado
  • 26.8 tokens/seg decodificación

Esto supera a llama.cpp ejecutándose en una GPU 5090 de 32GB con descarga de capas.

Cambios Arquitectónicos

La última versión de Krasis ha eliminado el sistema de doble formato y ahora ejecuta tanto el prellenado como la decodificación completamente en GPU con diferentes estrategias de optimización para cada fase. Este cambio arquitectónico resulta en:

  • Requisitos reducidos de CPU
  • Menor dependencia de la velocidad de memoria RAM del sistema
  • Menor uso general de RAM del sistema (ahora necesita solo suficiente para el modelo cuantizado más algo de sobrecarga, en comparación con el requisito previo de 2.5x del modelo)
Ad

Modelos Soportados y Rendimiento

Los modelos actualmente soportados con su rendimiento en una sola GPU 5090 (PCIE 4.0) son:

  • Qwen3.5-35B-A3B: 4475 prellenado, 109.1 decodificación
  • Qwen3-Coder-Next: 3560 prellenado, 70.3 decodificación
  • Qwen3.5-122B-A10B: 2897 prellenado, 27.7 decodificación
  • Qwen3-235B-A22B: 2124 prellenado, 9.3 decodificación

Planes de Desarrollo Futuro

El desarrollador planea:

  • Agregar soporte para modelos Nvidia Nemotron, específicamente apuntando a Nemotron Super para GPUs de consumo como la 5080
  • Posiblemente soportar modelos Nemotron más grandes cuando sean lanzados
  • Expandir el soporte de IDE y herramientas para Opencode y Aider

Características Actuales

Krasis actualmente ofrece:

  • Servidor compatible con OpenAI
  • Instalación de una sola línea
  • Disponibilidad en GitHub

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Tocket CLI: Un Marco de Ingeniería de Contexto para Agentes de Codificación de IA
Herramientas

Tocket CLI: Un Marco de Ingeniería de Contexto para Agentes de Codificación de IA

Tocket es una herramienta CLI que crea una carpeta .context/ con archivos markdown para que los agentes de IA mantengan la memoria del proyecto entre sesiones. Detecta automáticamente las tecnologías del package.json y genera un archivo .cursorrules preconfigurado.

OpenClawRadar
Utilizando un servidor MCP para optimizar aplicaciones de React Native con Claude Code.
Herramientas

Utilizando un servidor MCP para optimizar aplicaciones de React Native con Claude Code.

Un servidor MCP transmite datos de ejecución en vivo desde una aplicación de React Native a Claude Code, identificando problemas de rendimiento como el thrashing en el almacén de Zustand y re-renderizados innecesarios.

OpenClawRadar
Heddle: Aplicación de Confianza y Registro de Auditoría para Conexiones MCP de Claude Desktop
Herramientas

Heddle: Aplicación de Confianza y Registro de Auditoría para Conexiones MCP de Claude Desktop

Heddle es una herramienta de código abierto que añade niveles de confianza, controles de acceso y registro de auditoría a las conexiones MCP de Claude Desktop, permitiendo la gestión segura de múltiples servicios a través de una única interfaz con seis paquetes iniciales incluidos.

OpenClawRadar
Tablero de Silos: Interfaz de usuario web de código abierto para gestionar agentes de OpenClaw
Herramientas

Tablero de Silos: Interfaz de usuario web de código abierto para gestionar agentes de OpenClaw

Silos Dashboard es una interfaz web con licencia MIT para gestionar agentes OpenClaw, que reemplaza archivos de configuración y CLI con una única interfaz. Ofrece gestión de agentes, chat en vivo con streaming, instalación de habilidades, tableros de tareas, integraciones de canales y análisis.

OpenClawRadar