Por Dentro do vLLM: Anatomia de um Sistema de Inferência de LLM de Alto Throughput

vLLM é um dos mecanismos de inferência de código aberto mais usados para LLMs, e o post recente de Aleksa Gordić fornece uma explicação técnica sólida de seus internals. É voltado para desenvolvedores curiosos sobre como os mecanismos modernos de LLM são construídos, ou aqueles que consideram contribuir para vLLM, SGLang e projetos similares. A análise está fixada no commit 42172ad (9 de agosto de 2025) e foca no novo mecanismo V1 (V0 está obsoleto).
Componentes Principais do Mecanismo
O artigo começa com a configuração síncrona offline, usando um objeto simples LLM. O construtor do mecanismo é dividido em várias partes-chave:
- Configuração do vLLM – Todos os ajustes para modelo, cache, paralelismo, etc.
- Processador – Converte entradas brutas em solicitações do núcleo do mecanismo via validação e tokenização.
- Cliente do Núcleo do Mecanismo – No exemplo, é um
InprocClientque roda no mesmo processo; para produção, você migraria para um cliente multiprocesso comoDPLBAsyncMPClient. - Processador de Saída – Converte saídas do núcleo do mecanismo em saídas de solicitação voltadas ao usuário.
O núcleo do mecanismo em si contém o executor de modelo (dirigindo passagens para frente), um gerenciador de saída estruturada (para decodificação guiada) e um agendador com filas de espera/execução. O agendador usa uma política (FCFS ou prioridade) e inclui o gerenciador de cache KV.
Atenção Paginada e Cache KV
O gerenciador de cache KV é o coração da atenção paginada. Ele mantém uma free_block_queue de blocos disponíveis, muitas vezes centenas de milhares, dependendo da VRAM e do tamanho do bloco. O tamanho do bloco para um transformer padrão (não-MLA) é calculado como:
2 * block_size * num_kv_heads * head_size * dtype_num_bytes
que para configurações padrão produz um tamanho de bloco prático. Esse mecanismo de paginação permite gerenciamento eficiente de memória e alta taxa de transferência.
Recursos Avançados
O post não para no básico. Ele descreve recursos avançados que tornam o vLLM pronto para produção:
- Prefill em blocos – Divide prompts longos em blocos para intercalar com a geração.
- Cache de prefixo – Reutiliza o cache KV para prefixos compartilhados de prompts.
- Decodificação guiada – Restringe a saída a um esquema ou gramática.
- Decodificação especulativa – Usa um modelo rascunho para acelerar a geração.
- P/D desagregado – Separa prefill e decodificação em diferentes GPUs.
Também cobre escalabilidade para configurações multi-GPU e multi-nó, além da camada de serviço para lidar com tráfego web concorrente. Benchmarks e ajuste automático são mencionados para medir latência e taxa de transferência.
Para desenvolvedores construindo ou estendendo sistemas de inferência de LLM, isso dá um modelo mental claro de como o vLLM orquestra agendamento, memória e execução. É o primeiro de uma série, então espere mergulhos mais profundos em subsistemas individuais posteriormente.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Plugin de Memória do Agente OpenClaw: Contexto Persistente Entre Sessões
Um desenvolvedor criou um plugin de memória para o OpenClaw que injeta contexto relevante de conversas passadas antes de cada turno e armazena novos fatos e eventos após cada turno, resolvendo o problema de agentes esquecerem tudo entre sessões.

Ferramenta de Raiz de Uva Reduz o Uso de Tokens de Código Claude por meio do Cache de Contexto do Repositório
Uma ferramenta experimental gratuita chamada Grape Root aborda o consumo redundante de tokens no Claude Code mantendo um estado leve sobre arquivos de repositório previamente explorados, evitando releituras desnecessárias de arquivos inalterados durante prompts subsequentes.

certctl: Plataforma de ciclo de vida de certificados auto-hospedada com 78 endpoints de API para automação de agentes de IA
certctl é uma plataforma de ciclo de vida de certificados auto-hospedada desenvolvida com Go e TypeScript que expõe 78 endpoints de API REST para gerenciamento de certificados. A plataforma é independente de emissor e de destino, com um servidor MCP planejado para expor toda a funcionalidade como ferramentas nativas MCP.

Localizador de Circuitos LLM: Duplique 3 camadas para aumentar o raciocínio sem treinamento
Um novo kit de ferramentas encontra 'circuitos de raciocínio' em modelos de transformadores - blocos contíguos de 3-4 camadas que atuam como unidades cognitivas indivisíveis. Duplicar esses blocos (camadas 12-14 no Devstral-24B) melhora a dedução lógica de 0,22 para 0,76 nos benchmarks BBH sem alterações de pesos ou treinamento.