Dentro de vLLM: Anatomía de un sistema de inferencia LLM de alto rendimiento

vLLM es uno de los motores de inferencia de código abierto más utilizados para LLMs, y la reciente publicación de Aleksa Gordić proporciona un sólido recorrido técnico por sus entresijos. Está dirigido a desarrolladores curiosos sobre cómo se construyen los motores LLM modernos, o a aquellos que consideran contribuir a vLLM, SGLang y proyectos similares. El análisis está fijado al commit 42172ad (9 de agosto de 2025) y se centra en el nuevo motor V1 (V0 está obsoleto).
Componentes principales del motor
El artículo comienza con la configuración síncrona fuera de línea, utilizando un objeto LLM simple. El constructor del motor se desglosa en varias partes clave:
- Configuración de vLLM: todos los ajustes para modelo, caché, paralelismo, etc.
- Procesador: convierte las entradas brutas en solicitudes del núcleo del motor mediante validación y tokenización.
- Cliente del núcleo del motor: en el ejemplo, es un
InprocClientque se ejecuta en el mismo proceso; para producción se pasaría a un cliente multiproceso comoDPLBAsyncMPClient. - Procesador de salida: convierte las salidas del núcleo del motor en salidas de solicitud orientadas al usuario.
El núcleo del motor contiene el ejecutor de modelos (que impulsa los pases hacia adelante), un administrador de salida estructurada (para decodificación guiada) y un planificador con colas de espera/ejecución. El planificador utiliza una política (FCFS o prioridad) e incluye el administrador de caché KV.
Atención paginada y caché KV
El administrador de caché KV es el corazón de la atención paginada. Mantiene una free_block_queue de bloques disponibles, a menudo cientos de miles dependiendo de la VRAM y el tamaño de bloque. El tamaño de bloque para un transformador estándar (no MLA) se calcula como:
2 * block_size * num_kv_heads * head_size * dtype_num_bytes
que para la configuración predeterminada produce un tamaño de bloque práctico. Este mecanismo de paginación permite una gestión eficiente de la memoria y un alto rendimiento.
Características avanzadas
La publicación no se detiene en lo básico. Describe características avanzadas que hacen que vLLM esté listo para producción:
- Prefill fragmentado: divide prompts largos en fragmentos para intercalarlos con la generación.
- Caché de prefijos: reutiliza la caché KV para prefijos de prompts compartidos.
- Decodificación guiada: restringe la salida a un esquema o gramática.
- Decodificación especulativa: utiliza un modelo borrador para acelerar la generación.
- P/D desagregado: separa el prefill y la decodificación en diferentes GPUs.
También cubre el escalado a configuraciones multi-GPU y multi-nodo, además de la capa de servicio para manejar tráfico web concurrente. Se mencionan puntos de referencia y ajuste automático para medir latencia y rendimiento.
Para desarrolladores que construyen o amplían sistemas de inferencia LLM, esto proporciona un modelo mental claro de cómo vLLM orquesta la planificación, la memoria y la ejecución. Es el primero de una serie, por lo que se esperan análisis más profundos de subsistemas individuales más adelante.
📖 Lee la fuente completa: HN LLM Tools
👀 Ver también

Skill Studio: Aplicación de Escritorio de Código Abierto para Gestionar Habilidades del Agente de IA Claude
Skill Studio es una aplicación de escritorio gratuita y de código abierto para macOS que permite a los desarrolladores explorar repositorios de habilidades de la comunidad, previsualizar documentación con renderizado de markdown e instalar habilidades con comandos de un clic como npx skills add.

Habilidad OpenClaw para Transcripción de Reuniones Locales con Whisper
Una nueva habilidad de OpenClaw llamada ghostmeet proporciona transcripción local de reuniones usando Whisper. Captura audio de pestañas del navegador mediante una extensión de Chrome y puede generar resúmenes usando Claude, procesando todo el audio y la transcripción localmente en tu máquina.

Claude Code carga perezosamente esquemas de herramientas mediante ToolSearch para ahorrar tokens
Claude Code difiere la carga de esquemas de herramientas enviando solo los nombres de las herramientas por adelantado y requiriendo una llamada ToolSearch para obtener los esquemas antes de su uso. Esta arquitectura reduce significativamente el consumo de tokens.

Codiff v0.1.0: Un visor local de diferencias para revisiones de código generadas por LLM
Codiff v0.1.0 es una aplicación de escritorio rápida y minimalista para revisar diferencias locales de Git, con modo de recorrido LLM y comentarios en línea que se pueden copiar como Markdown.