Configuración de Qwen3.5-27B Localmente: Comparación entre vLLM y llama.cpp

✍️ OpenClawRadar📅 Publicado: 15 de marzo de 2026🔗 Source
Configuración de Qwen3.5-27B Localmente: Comparación entre vLLM y llama.cpp
Ad

Rendimiento y Capacidades de Qwen3.5-27B

El modelo Qwen3.5-27B demuestra un rendimiento sólido en varios benchmarks según la fuente: MMLU-Pro: 85.3, MMLU-Redux: 93.3, C-Eval: 90.2, puntuación general de inteligencia: 42.1 (mejor que el 91% de los modelos comparados), e índice de codificación: 34.9 (supera al 88% en capacidades de codificación). El modelo presenta una arquitectura densa con un contexto nativo de 262k que es extensible a más de 1M de tokens.

Comparación de Backends: llama.cpp vs vLLM

La fuente compara dos enfoques principales para el despliegue local:

Opción 1: llama.cpp

  • Ventajas: Baja huella de memoria, configuración sencilla, admite caché q4 KV para un uso razonable de VRAM
  • Desventajas: Problema importante con la caché KV que se borra aleatoriamente, lo que obliga a reprocesar el prompt completo a mitad de sesión. La decodificación especulativa mediante MTP no funciona. Error conocido sin soluciones sólidas aún.

Opción 2: vLLM

  • Ventajas: Sesiones estables, sin borrados de KV, admite decodificación especulativa con MTP para generaciones más rápidas
  • Desventajas: No admite caché q4 KV, por lo que la VRAM alcanza picos con contexto de 256k. El análisis de llamadas a herramientas es defectuoso para Qwen3.5 en v0.17.1, con correcciones en PRs abiertos de GitHub pero aún no fusionadas. Esto interrumpe flujos de codificación agentica con salidas JSON malformadas.
Ad

Configuración Recomendada de vLLM

La fuente proporciona recomendaciones de configuración específicas para ejecuciones estables y de alta velocidad utilizando el modelo de HF: osoleve/Qwen3.5-27B-Text-NVFP4-MTP:

  • Utilice el backend flashinfer cutlass para un rendimiento optimizado
  • Establezca la ventana de contexto en 128k (equilibra VRAM y usabilidad; aumente a 256k si tiene el hardware)
  • Limite la utilización de GPU a 0.82 para evitar fallos por falta de memoria
  • Establezca max-num-seq en 2 (maneja una sola sesión bien sin sobrecargar)
  • Habilite la decodificación especulativa MTP para mejoras de velocidad
  • Parchee vLLM con las correcciones de análisis de llamadas a herramientas de Qwen de los PRs abiertos
  • Utilice Claude code cli - el código abierto aún tiene problemas de análisis de llamadas a herramientas que no aparecen en Claude code después del parche

Resultados de Rendimiento

Según la fuente, el rendimiento varía según el hardware:

  • En una RTX 5090 (32GB VRAM): ~50 TPS
  • En una RTX Pro 6000 (96GB VRAM): 70 TPS con contexto completo de 256k

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Solución para el Problema del Servicio de VM del Espacio de Trabajo de Claude Desktop en Windows 11 Home
Guías

Solución para el Problema del Servicio de VM del Espacio de Trabajo de Claude Desktop en Windows 11 Home

Una solución desarrollada por la comunidad aborda el error 'servicio de VM no está en ejecución' en la función de espacio de trabajo de Claude Desktop en Windows 11 Home, con comandos manuales de PowerShell y una herramienta automatizada disponible en GitHub.

OpenClawRadar
Flujo de Trabajo Práctico con Claude Code para Equipos de Desarrollo
Guías

Flujo de Trabajo Práctico con Claude Code para Equipos de Desarrollo

Un usuario de Reddit comparte su presentación interna sobre las mejores prácticas de Claude Code, incluyendo selección de modelos, flujos de trabajo estructurados y técnicas específicas de prompts para mejorar la calidad de la salida.

OpenClawRadar
OpenClaw 4.1 con Gemma 4 Stack: Arquitectura Híbrida y Correcciones de Configuración
Guías

OpenClaw 4.1 con Gemma 4 Stack: Arquitectura Híbrida y Correcciones de Configuración

Una publicación de Reddit detalla una pila de agentes locales optimizada que combina OpenClaw 4.1 con el modelo Gemma 4 de Google, con una arquitectura híbrida, correcciones de configuración específicas para la llamada a herramientas de Ollama y ajustes en la ventana de contexto.

OpenClawRadar
Un sistema de memoria de 4 archivos para agentes OpenClaw sin complementos.
Guías

Un sistema de memoria de 4 archivos para agentes OpenClaw sin complementos.

Un usuario de Reddit comparte un sistema de memoria práctico que utiliza cuatro archivos markdown: USER.md para identidad, CONTEXT.md para trabajo activo, MEMORY.md para temas estructurados y ARCHIVE.md para elementos completados. El enfoque aborda el problema de que 'el agente no sabe lo que sabe' mediante una mejor arquitectura de archivos en lugar de más memoria.

OpenClawRadar