Dentro de vLLM: Anatomía de un sistema de inferencia LLM de alto rendimiento

✍️ OpenClawRadar📅 Publicado: 7 de agosto de 2026🔗 Source
Dentro de vLLM: Anatomía de un sistema de inferencia LLM de alto rendimiento
Ad

vLLM es uno de los motores de inferencia de código abierto más utilizados para LLMs, y la reciente publicación de Aleksa Gordić proporciona un sólido recorrido técnico por sus entresijos. Está dirigido a desarrolladores curiosos sobre cómo se construyen los motores LLM modernos, o a aquellos que consideran contribuir a vLLM, SGLang y proyectos similares. El análisis está fijado al commit 42172ad (9 de agosto de 2025) y se centra en el nuevo motor V1 (V0 está obsoleto).

Componentes principales del motor

El artículo comienza con la configuración síncrona fuera de línea, utilizando un objeto LLM simple. El constructor del motor se desglosa en varias partes clave:

  • Configuración de vLLM: todos los ajustes para modelo, caché, paralelismo, etc.
  • Procesador: convierte las entradas brutas en solicitudes del núcleo del motor mediante validación y tokenización.
  • Cliente del núcleo del motor: en el ejemplo, es un InprocClient que se ejecuta en el mismo proceso; para producción se pasaría a un cliente multiproceso como DPLBAsyncMPClient.
  • Procesador de salida: convierte las salidas del núcleo del motor en salidas de solicitud orientadas al usuario.

El núcleo del motor contiene el ejecutor de modelos (que impulsa los pases hacia adelante), un administrador de salida estructurada (para decodificación guiada) y un planificador con colas de espera/ejecución. El planificador utiliza una política (FCFS o prioridad) e incluye el administrador de caché KV.

Ad

Atención paginada y caché KV

El administrador de caché KV es el corazón de la atención paginada. Mantiene una free_block_queue de bloques disponibles, a menudo cientos de miles dependiendo de la VRAM y el tamaño de bloque. El tamaño de bloque para un transformador estándar (no MLA) se calcula como:

2 * block_size * num_kv_heads * head_size * dtype_num_bytes

que para la configuración predeterminada produce un tamaño de bloque práctico. Este mecanismo de paginación permite una gestión eficiente de la memoria y un alto rendimiento.

Características avanzadas

La publicación no se detiene en lo básico. Describe características avanzadas que hacen que vLLM esté listo para producción:

  • Prefill fragmentado: divide prompts largos en fragmentos para intercalarlos con la generación.
  • Caché de prefijos: reutiliza la caché KV para prefijos de prompts compartidos.
  • Decodificación guiada: restringe la salida a un esquema o gramática.
  • Decodificación especulativa: utiliza un modelo borrador para acelerar la generación.
  • P/D desagregado: separa el prefill y la decodificación en diferentes GPUs.

También cubre el escalado a configuraciones multi-GPU y multi-nodo, además de la capa de servicio para manejar tráfico web concurrente. Se mencionan puntos de referencia y ajuste automático para medir latencia y rendimiento.

Para desarrolladores que construyen o amplían sistemas de inferencia LLM, esto proporciona un modelo mental claro de cómo vLLM orquesta la planificación, la memoria y la ejecución. Es el primero de una serie, por lo que se esperan análisis más profundos de subsistemas individuales más adelante.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix
Herramientas

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix

Elodin ha publicado un simulador open-source para la clasificación virtual del AI Grand Prix, que cumple con las restricciones de la competición y funciona con Betaflight real. La herramienta basada en Rust/Bevy genera muestras de sensores de cámara directamente en el bucle, evitando la sobrecarga de motores de juego pesados.

OpenClawRadar
Memex: Complemento de Memoria de Código Abierto para Claude Cowork
Herramientas

Memex: Complemento de Memoria de Código Abierto para Claude Cowork

Memex es un complemento de código abierto que le da a Claude Cowork memoria persistente entre sesiones utilizando un sistema de carga de contexto por niveles. Después de ejecutar /memex:init una vez, Claude se pone al día en aproximadamente 20 segundos por sesión y retoma donde lo dejaste.

OpenClawRadar
Claude añade función de creación de gráficos y diagramas interactivos
Herramientas

Claude añade función de creación de gráficos y diagramas interactivos

Claude ahora puede generar visuales interactivos que incluyen gráficos, diagramas y desgloses explorables directamente dentro de las conversaciones. La función está disponible en versión beta en todos los planes, incluido el nivel gratuito.

OpenClawRadar
Servidor MCP Rastrea Errores Conocidos en Herramientas de Desarrollo para Mejorar las Recomendaciones de LLM
Herramientas

Servidor MCP Rastrea Errores Conocidos en Herramientas de Desarrollo para Mejorar las Recomendaciones de LLM

nanmesh-mcp es un servidor MCP que rastrea problemas de GitHub, Stack Overflow y Reddit para seguir problemas reales en 57 herramientas de desarrollo, proporcionando a los LLMs datos actualizados sobre errores antes de hacer recomendaciones de bibliotecas.

OpenClawRadar