Pilha de Rastreamento de LLM de Ponta a Ponta: Do Toque de Tecla ao Token Transmitido

Um engenheiro de software publicou um documento técnico detalhado que rastreia exatamente o que acontece em cada camada da pilha quando você envia um prompt para um LLM como Claude ou ChatGPT. Inspirado pelo clássico repositório "o-que-acontece-quando" para navegação no navegador, este documento fornece uma perspectiva de sistemas de produção sobre interações de chat com LLMs.
O que o Documento Aborda
O documento segue a jornada completa na ordem de produção:
- Lado do cliente: Contagem de tokens em tempo real via tokenizadores WASM, eventos de composição IME, renderização otimista da interface
- Rede: Por que SSE vence sobre WebSockets para chat, problema de limite UTF-8 no streaming
- Gateway de API: Terminação TLS na borda, limitação de taxa multidimensional (RPM vs ITPM vs OTPM)
- Classificadores de segurança: O que executa antes e depois do modelo, por que a injeção de prompt é estruturalmente não resolvida
- Montagem de contexto: O que realmente entra na janela de contexto (não são apenas suas mensagens)
- Tokenização: Por que modelos não podem contar letras, por que espaços iniciais importam, como tokens especiais consomem orçamento
- Cache KV e cache de prefixo: Matemática de memória GQA vs MHA, PagedAttention, taxa de acerto do cache como alavanca de custo
- Prefill vs decode: Por que eles têm gargalos diferentes (computação vs largura de banda de memória)
- Pipeline de amostragem: O pipeline completo de logits em ordem — penalidade de repetição, temperatura, top-k, top-p, softmax, amostra
- Streaming: Análise de TTFT, análise de eventos SSE, renderização incremental de markdown
- Uso de ferramentas e loops agenticos: Chamadas paralelas de ferramentas, injeção de prompt ressurgindo em resultados de ferramentas
- Cobrança e observabilidade: TTFT vs TPOT, matemática de precificação de cache, o que instrumentar
Detalhes do Documento
O documento é voltado para engenheiros que já entendem transformers e querem ver como os sistemas de produção realmente funcionam. Foi lançado sob licença CC0, e contribuições são bem-vindas. O autor observa vários subsistemas não cobertos no final, incluindo decodificação especulativa, sistemas multimodais e coordenação multiagente.
O repositório foi criado para abordar a lacuna entre explicações de alto nível "transformers são mágicos" e artigos acadêmicos que não conectam conceitos ao comportamento do sistema de produção.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Conectando o CludeCode a Aplicativos Web para Interação Automatizada
Explore como o CludeCode pode ser usado para interagir automaticamente com aplicações web aproveitando ferramentas de IA como navegadores e utilitários de scraping.

O que Quebra ao Executar Agentes de Codificação em Modelos Locais Pequenos
Pontos de falha do mundo real ao testar tarefas com múltiplos arquivos em modelos sub-7B: fences de markdown, confiabilidade de saída estruturada, erros de edição de arquivos e classificação de ações de leitura vs. escrita.

Recomendações de Configuração de LLM Local para OpenClaw
Um usuário compartilha sua configuração para executar um LLM local com o OpenClaw, usando um GB10 para processamento de IA e um Mac mini para a instalação do OpenClaw, com detalhes específicos do modelo e do servidor.
OpenClaw 2026.9.1 Migração: Notas de Atualização de Agentes Múltiplos Legados do r/openclaw
Um usuário documenta uma atualização tranquila do OpenClaw 2026.7.1-2 para 2026.9.1, cobrindo migrações de configuração, atualizações de esquema e correções multiagente — feito via Codex em cerca de 30 minutos.