Сквозная трассировка стека LLM: от нажатия клавиши до потокового токена

✍️ OpenClawRadar📅 Опубликовано: 19 марта 2026 г.🔗 Source
Сквозная трассировка стека LLM: от нажатия клавиши до потокового токена
Ad

Программист опубликовал подробный технический документ, в котором точно описывается, что происходит на каждом уровне стека при отправке промпта в LLM, такую как Claude или ChatGPT. Вдохновлённый классическим репозиторием «что происходит, когда» для навигации в браузере, этот документ даёт представление о работе чат-взаимодействий с LLM с точки зрения производственных систем.

Что охватывает документ

Документ следует полному пути в порядке производства:

  • Клиентская сторона: Подсчёт токенов в реальном времени через WASM-токенизаторы, события композиции IME, оптимистичный рендеринг интерфейса
  • Сеть: Почему SSE выигрывает у WebSockets для чата, проблема границ UTF-8 при потоковой передаче
  • API-шлюз: Завершение TLS на границе, многомерное ограничение скорости (RPM против ITPM против OTPM)
  • Классификаторы безопасности: Что запускается до и после модели, почему инъекция промптов структурно не решена
  • Сборка контекста: Что на самом деле попадает в контекстное окно (это не только ваши сообщения)
  • Токенизация: Почему модели не могут считать буквы, почему важны начальные пробелы, как специальные токены расходуют бюджет
  • KV-кэш и кэширование префиксов: Расчёты памяти GQA против MHA, PagedAttention, процент попаданий в кэш как рычаг затрат
  • Предзаполнение против декодирования: Почему они ограничены по-разному (вычисления против пропускной способности памяти)
  • Конвейер выборки: Полный конвейер логитов по порядку — штраф за повторение, температура, top-k, top-p, softmax, выборка
  • Потоковая передача: Разбор TTFT, парсинг событий SSE, инкрементальный рендеринг markdown
  • Использование инструментов и агентские циклы: Параллельные вызовы инструментов, повторное появление инъекции промптов в результатах инструментов
  • Биллинг и наблюдаемость: TTFT против TPOT, расчёты стоимости кэширования, что инструментировать
Ad

Детали документа

Документ предназначен для инженеров, которые уже понимают трансформеры и хотят увидеть, как на самом деле работают производственные системы. Он выпущен под лицензией CC0, и вклад приветствуется. Автор отмечает несколько неохваченных подсистем внизу, включая спекулятивное декодирование, мультимодальные системы и координацию множественных агентов.

Репозиторий был создан для устранения разрыва между объяснениями высокого уровня «трансформеры — это магия» и академическими статьями, которые не связывают концепции с поведением производственных систем.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

OpenClaw Ollama Cloud:针对缺失模型和医生删除错误的三层修复
Гайды

OpenClaw Ollama Cloud:针对缺失模型和医生删除错误的三层修复

Чистая установка OpenClaw с моделями Ollama Cloud провалилась: работала только kimi-k2.5, конфиги исчезали. Коренная причина: отсутствие списка провайдеров, обязательное поле name, и 'openclaw doctor --fix' удаляет ваш блок провайдера.

OpenClawRadar
Визуализация рабочего процесса Claude Code объясняет иерархию памяти и систему навыков.
Гайды

Визуализация рабочего процесса Claude Code объясняет иерархию памяти и систему навыков.

Пользователь Reddit поделился визуальной диаграммой, показывающей структуру рабочего процесса Claude Code, включая слои памяти с файлами CLAUDE.md и переиспользуемые навыки, определённые в директориях .claude/skills/. Цикл рабочего процесса предлагает использовать режим Plan, описывать функции, автоматически принимать изменения и часто коммитить.

OpenClawRadar
Практические стратегии кодирования ИИ, основанные на 1000 часах опыта
Гайды

Практические стратегии кодирования ИИ, основанные на 1000 часах опыта

В посте на Reddit описываются конкретные уровни промптов и стратегии рабочего процесса для эффективного использования AI-агентов в программировании, включая отношение к ИИ как к младшему разработчику, поэтапную реализацию и использование файлов с инструкциями.

OpenClawRadar
Создание полностью локального мультиагентного ассистента с OpenClaw и Ollama
Гайды

Создание полностью локального мультиагентного ассистента с OpenClaw и Ollama

Разработчик делится своим стеком для полностью локального персонального AI-ассистента с использованием OpenClaw и Ollama, включая модели qwen3.5:35b-a3b, gemma3:4b, mistral:7b, MCP-серверы для Home Assistant и Gmail, а также интерфейс Telegram Bot.

OpenClawRadar