エンドツーエンドLLMスタックトレース:キーストロークからストリーミングトークンまで

ソフトウェアエンジニアが、ClaudeやChatGPTのようなLLMにプロンプトを送信した際にスタックの各レイヤーで正確に何が起こるかを追跡した詳細な技術文書を公開しました。ブラウザナビゲーションの古典的な「what-happens-when」リポジトリに触発され、この文書はLLMチャットインタラクションに対するプロダクションシステムの視点を提供します。
文書の内容
この文書はプロダクションの順序に沿って全体の流れを追っています:
- クライアント側: WASMトークナイザーによるライブトークンカウント、IME構成イベント、楽観的UIレンダリング
- ネットワーク: チャットにおけるSSEがWebSocketより優れる理由、ストリーミングにおけるUTF-8境界問題
- APIゲートウェイ: エッジTLS終端、多次元レート制限(RPM対ITPM対OTPM)
- 安全性分類器: モデルの前後に実行されるもの、プロンプトインジェクションが構造的に未解決である理由
- コンテキスト組み立て: コンテキストウィンドウに実際に入るもの(単なるメッセージだけではない)
- トークン化: モデルが文字を数えられない理由、先頭スペースが重要な理由、特殊トークンが予算を消費する仕組み
- KVキャッシュとプレフィックスキャッシング: GQA対MHAメモリ計算、PagedAttention、コストレバーとしてのキャッシュヒット率
- プリフィル対デコード: ボトルネックが異なる理由(計算対メモリ帯域幅)
- サンプリングパイプライン: 完全なロジットパイプラインの順序 — 反復ペナルティ、温度、top-k、top-p、ソフトマックス、サンプリング
- ストリーミング: TTFT内訳、SSEイベント解析、インクリメンタルマークダウンレンダリング
- ツール使用とエージェントループ: 並列ツール呼び出し、ツール結果で再浮上するプロンプトインジェクション
- 課金と可観測性: TTFT対TPOT、キャッシュ価格計算、計装すべき項目
文書の詳細
この文書は、トランスフォーマーを既に理解しているエンジニアが、プロダクションシステムが実際にどのように機能するかを確認したい人を対象としています。CC0ライセンスで公開されており、貢献を歓迎しています。著者は、推測的デコード、マルチモーダルシステム、マルチエージェント調整など、カバーされていないいくつかのサブシステムを末尾に記載しています。
このリポジトリは、高レベルの「トランスフォーマーは魔法」という説明と、概念をプロダクションシステムの動作に結びつけない学術論文との間のギャップを埋めるために作成されました。
📖 Read the full source: r/LocalLLaMA
👀 See Also

予算内でOpenClaw、ClawdBot、MoltBotを実行する
OpenClaw、ClawdBot、MoltBotを予算を抑えて実行する方法を発見しましょう。r/clawdbotの愛好家たちが議論した予算管理のヒントや無料の代替手段を探ります。

フローマップ:高速サンプリングのための拡散モデルの積分学習
サンダー・ディールマンがフローマップについて解説。拡散モデルのODEの積分を直接予測するニューラルネットワークにより、高速サンプリング、報酬ベース学習、制御可能性を実現する。

OpenClaw Ollama Cloud: モデル欠落と医者削除バグに対する三層修正
OpenClawをクリーンインストールしてOllama Cloudモデルを設定したが、kimi-k2.5のみ動作し、設定が消える問題が発生。原因は、プロバイダ一覧の欠落、nameフィールドの必須化、'openclaw doctor --fix'によるプロバイダブロックの削除。

Google AI Proアカウント、OpenClaw OAuth禁止後に復活——異議申立フォームが機能
OpenClawをGoogle OAuth経由でリンクしたことでGoogle AI Proアカウントが停止されたが、3ヶ月後に復旧したとユーザーが報告。公式の異議申立フォームが最終的に機能した。