Por Dentro do vLLM: Anatomia de um Sistema de Inferência de LLM de Alto Throughput

✍️ OpenClawRadar📅 Publicado: August 7, 2026🔗 Source
Por Dentro do vLLM: Anatomia de um Sistema de Inferência de LLM de Alto Throughput
Ad

vLLM é um dos mecanismos de inferência de código aberto mais usados para LLMs, e o post recente de Aleksa Gordić fornece uma explicação técnica sólida de seus internals. É voltado para desenvolvedores curiosos sobre como os mecanismos modernos de LLM são construídos, ou aqueles que consideram contribuir para vLLM, SGLang e projetos similares. A análise está fixada no commit 42172ad (9 de agosto de 2025) e foca no novo mecanismo V1 (V0 está obsoleto).

Componentes Principais do Mecanismo

O artigo começa com a configuração síncrona offline, usando um objeto simples LLM. O construtor do mecanismo é dividido em várias partes-chave:

  • Configuração do vLLM – Todos os ajustes para modelo, cache, paralelismo, etc.
  • Processador – Converte entradas brutas em solicitações do núcleo do mecanismo via validação e tokenização.
  • Cliente do Núcleo do Mecanismo – No exemplo, é um InprocClient que roda no mesmo processo; para produção, você migraria para um cliente multiprocesso como DPLBAsyncMPClient.
  • Processador de Saída – Converte saídas do núcleo do mecanismo em saídas de solicitação voltadas ao usuário.

O núcleo do mecanismo em si contém o executor de modelo (dirigindo passagens para frente), um gerenciador de saída estruturada (para decodificação guiada) e um agendador com filas de espera/execução. O agendador usa uma política (FCFS ou prioridade) e inclui o gerenciador de cache KV.

Ad

Atenção Paginada e Cache KV

O gerenciador de cache KV é o coração da atenção paginada. Ele mantém uma free_block_queue de blocos disponíveis, muitas vezes centenas de milhares, dependendo da VRAM e do tamanho do bloco. O tamanho do bloco para um transformer padrão (não-MLA) é calculado como:

2 * block_size * num_kv_heads * head_size * dtype_num_bytes

que para configurações padrão produz um tamanho de bloco prático. Esse mecanismo de paginação permite gerenciamento eficiente de memória e alta taxa de transferência.

Recursos Avançados

O post não para no básico. Ele descreve recursos avançados que tornam o vLLM pronto para produção:

  • Prefill em blocos – Divide prompts longos em blocos para intercalar com a geração.
  • Cache de prefixo – Reutiliza o cache KV para prefixos compartilhados de prompts.
  • Decodificação guiada – Restringe a saída a um esquema ou gramática.
  • Decodificação especulativa – Usa um modelo rascunho para acelerar a geração.
  • P/D desagregado – Separa prefill e decodificação em diferentes GPUs.

Também cobre escalabilidade para configurações multi-GPU e multi-nó, além da camada de serviço para lidar com tráfego web concorrente. Benchmarks e ajuste automático são mencionados para medir latência e taxa de transferência.

Para desenvolvedores construindo ou estendendo sistemas de inferência de LLM, isso dá um modelo mental claro de como o vLLM orquestra agendamento, memória e execução. É o primeiro de uma série, então espere mergulhos mais profundos em subsistemas individuais posteriormente.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Claude Code Perda de Dados de Sessão: Script de Backup para Windows e Mac
Tools

Claude Code Perda de Dados de Sessão: Script de Backup para Windows e Mac

Usuários relatam perda silenciosa de dados de sessão no Claude Code. Veja um script gratuito de backup automático para Windows e Mac usando PowerShell e launchd.

OpenClawRadar
Qure: Aplicativo de Desktop para Gerar Testes E2E a Partir de Fluxos de Navegador Gravados
Tools

Qure: Aplicativo de Desktop para Gerar Testes E2E a Partir de Fluxos de Navegador Gravados

Qure é um aplicativo de desktop desenvolvido pela JetBrains (atualmente em beta fechado) que gera código de teste web de ponta a ponta a partir de gravações feitas em seu navegador integrado. Em vez de descrever fluxos de teste em texto para agentes de IA, os desenvolvedores gravam seus cenários de QA manual interagindo com seu produto, e a IA produz código de teste funcional que corresponde à sua base de código existente.

OpenClawRadar
Benchmark Mostra que Ferramenta CLI Reduz Custos de Tokens de Código do Claude em 32% por Meio de Navegação Estrutural
Tools

Benchmark Mostra que Ferramenta CLI Reduz Custos de Tokens de Código do Claude em 32% por Meio de Navegação Estrutural

Um desenvolvedor criou uma ferramenta CLI em Rust que dá aos agentes Claude Code comandos de navegação estrutural como 'mostre-me um resumo de 180 tokens desta classe de 6.000 tokens'. Benchmarking no Sonnet 4.6 em 54 execuções automatizadas mostrou 32% de custo menor por tarefa e 67% mais edições de código por sessão.

OpenClawRadar
Claude Code agora suporta mais de 240 modelos via gateway NVIDIA NIM — incluindo Nemotron-3 120B para codificação agêntica
Tools

Claude Code agora suporta mais de 240 modelos via gateway NVIDIA NIM — incluindo Nemotron-3 120B para codificação agêntica

O Claude Code pode alternar no meio da sessão para mais de 240 modelos NVIDIA NIM através do comando /model. A variante de raciocínio Nemotron-3 Super 120B mostra resultados fortes para refatoração de múltiplos arquivos e tarefas de agente.

OpenClawRadar