Dentro de vLLM: Anatomía de un sistema de inferencia LLM de alto rendimiento

vLLM es uno de los motores de inferencia de código abierto más utilizados para LLMs, y la reciente publicación de Aleksa Gordić proporciona un sólido recorrido técnico por sus entresijos. Está dirigido a desarrolladores curiosos sobre cómo se construyen los motores LLM modernos, o a aquellos que consideran contribuir a vLLM, SGLang y proyectos similares. El análisis está fijado al commit 42172ad (9 de agosto de 2025) y se centra en el nuevo motor V1 (V0 está obsoleto).
Componentes principales del motor
El artículo comienza con la configuración síncrona fuera de línea, utilizando un objeto LLM simple. El constructor del motor se desglosa en varias partes clave:
- Configuración de vLLM: todos los ajustes para modelo, caché, paralelismo, etc.
- Procesador: convierte las entradas brutas en solicitudes del núcleo del motor mediante validación y tokenización.
- Cliente del núcleo del motor: en el ejemplo, es un
InprocClientque se ejecuta en el mismo proceso; para producción se pasaría a un cliente multiproceso comoDPLBAsyncMPClient. - Procesador de salida: convierte las salidas del núcleo del motor en salidas de solicitud orientadas al usuario.
El núcleo del motor contiene el ejecutor de modelos (que impulsa los pases hacia adelante), un administrador de salida estructurada (para decodificación guiada) y un planificador con colas de espera/ejecución. El planificador utiliza una política (FCFS o prioridad) e incluye el administrador de caché KV.
Atención paginada y caché KV
El administrador de caché KV es el corazón de la atención paginada. Mantiene una free_block_queue de bloques disponibles, a menudo cientos de miles dependiendo de la VRAM y el tamaño de bloque. El tamaño de bloque para un transformador estándar (no MLA) se calcula como:
2 * block_size * num_kv_heads * head_size * dtype_num_bytes
que para la configuración predeterminada produce un tamaño de bloque práctico. Este mecanismo de paginación permite una gestión eficiente de la memoria y un alto rendimiento.
Características avanzadas
La publicación no se detiene en lo básico. Describe características avanzadas que hacen que vLLM esté listo para producción:
- Prefill fragmentado: divide prompts largos en fragmentos para intercalarlos con la generación.
- Caché de prefijos: reutiliza la caché KV para prefijos de prompts compartidos.
- Decodificación guiada: restringe la salida a un esquema o gramática.
- Decodificación especulativa: utiliza un modelo borrador para acelerar la generación.
- P/D desagregado: separa el prefill y la decodificación en diferentes GPUs.
También cubre el escalado a configuraciones multi-GPU y multi-nodo, además de la capa de servicio para manejar tráfico web concurrente. Se mencionan puntos de referencia y ajuste automático para medir latencia y rendimiento.
Para desarrolladores que construyen o amplían sistemas de inferencia LLM, esto proporciona un modelo mental claro de cómo vLLM orquesta la planificación, la memoria y la ejecución. Es el primero de una serie, por lo que se esperan análisis más profundos de subsistemas individuales más adelante.
📖 Lee la fuente completa: HN LLM Tools
👀 Ver también

Caliby: Base de datos vectorial embebida de código abierto para agentes de IA con almacenamiento híbrido de texto+vector
Caliby es una base de datos vectorial incrustada en C++ con enlaces a Python (pip install caliby) que soporta índices HNSW, DiskANN e IVF+PQ, afirma un rendimiento 4 veces superior a pgvector y almacena texto de forma nativa junto a vectores para casos de uso de IA Agente/RAG.

ClawProxy: Proxy de Enrutamiento de IA Autohospedado para Rotar Claves API de Nivel Gratuito
ClawProxy es un proxy de enrutamiento de IA autohospedado que gestiona múltiples claves de API de IA de nivel gratuito para evitar límites de tasa y sobrecargas de proveedores. Cuenta con rotación de claves en vuelo, balanceo de carga ponderado, traducción de modelos y un panel con registros analizados en profundidad.

OpenClaw como Interfaz de Infraestructura como Código para la Gestión de Laboratorios Domésticos
OpenClaw se transforma de un dispositivo de IA a la interfaz principal de la computadora para la gestión del laboratorio doméstico, ejecutando tareas como configurar contenedores de Traefik, crear configuraciones de Dashy y configurar el acceso a Tailscale con acceso directo a la máquina.

Agentes & A.I.mpires: Juego de Estrategia Donde los Agentes de IA Juegan y los Humanos Espectan
Agents & A.I.mpires es un juego de estrategia en tiempo real persistente en un globo con cuadrícula hexagonal donde los agentes de IA reclaman territorio de forma autónoma, atacan, forman alianzas y escriben blogs de guerra diarios mediante llamadas a la API HTTP. Los humanos solo observan el comportamiento emergente.