エンドツーエンドLLMスタックトレース:キーストロークからストリーミングトークンまで

ソフトウェアエンジニアが、ClaudeやChatGPTのようなLLMにプロンプトを送信した際にスタックの各レイヤーで正確に何が起こるかを追跡した詳細な技術文書を公開しました。ブラウザナビゲーションの古典的な「what-happens-when」リポジトリに触発され、この文書はLLMチャットインタラクションに対するプロダクションシステムの視点を提供します。
文書の内容
この文書はプロダクションの順序に沿って全体の流れを追っています:
- クライアント側: WASMトークナイザーによるライブトークンカウント、IME構成イベント、楽観的UIレンダリング
- ネットワーク: チャットにおけるSSEがWebSocketより優れる理由、ストリーミングにおけるUTF-8境界問題
- APIゲートウェイ: エッジTLS終端、多次元レート制限(RPM対ITPM対OTPM)
- 安全性分類器: モデルの前後に実行されるもの、プロンプトインジェクションが構造的に未解決である理由
- コンテキスト組み立て: コンテキストウィンドウに実際に入るもの(単なるメッセージだけではない)
- トークン化: モデルが文字を数えられない理由、先頭スペースが重要な理由、特殊トークンが予算を消費する仕組み
- KVキャッシュとプレフィックスキャッシング: GQA対MHAメモリ計算、PagedAttention、コストレバーとしてのキャッシュヒット率
- プリフィル対デコード: ボトルネックが異なる理由(計算対メモリ帯域幅)
- サンプリングパイプライン: 完全なロジットパイプラインの順序 — 反復ペナルティ、温度、top-k、top-p、ソフトマックス、サンプリング
- ストリーミング: TTFT内訳、SSEイベント解析、インクリメンタルマークダウンレンダリング
- ツール使用とエージェントループ: 並列ツール呼び出し、ツール結果で再浮上するプロンプトインジェクション
- 課金と可観測性: TTFT対TPOT、キャッシュ価格計算、計装すべき項目
文書の詳細
この文書は、トランスフォーマーを既に理解しているエンジニアが、プロダクションシステムが実際にどのように機能するかを確認したい人を対象としています。CC0ライセンスで公開されており、貢献を歓迎しています。著者は、推測的デコード、マルチモーダルシステム、マルチエージェント調整など、カバーされていないいくつかのサブシステムを末尾に記載しています。
このリポジトリは、高レベルの「トランスフォーマーは魔法」という説明と、概念をプロダクションシステムの動作に結びつけない学術論文との間のギャップを埋めるために作成されました。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Qwen3.5-397B MoE、M1 Ultraでページ化エキスパートローディングにより14GB RAMで動作
Paged MoEエンジンは常時20のエキスパートのみをRAMに保持し、残りをSSDからレイジーロードすることで、209GBの397Bモデルを64GB Mac Studio上で1.59 tok/s、ピークRAM14GBで動作させる。小型モデルのベンチマークも含む。

MCPサーバーを自作インストールさせる:3つのホスト、3つのメカニズム、落とし穴
VS Code、Cursor、Claude CodeでMCPサーバーをプログラムからインストールする方法を詳しく解説。API、ファイル書き込み、不正なJSON、アトミック書き込み、冪等更新のようなエッジケースもカバー。

OpenClawセットアップチェックリスト:新規ユーザーのための6つの重要なステップ
Redditの投稿では、OpenClawユーザー向けに6つの必須設定手順が示されています:コスト削減のためデフォルトモデルをOpusからSonnetに変更、セキュリティのためゲートウェイホストを127.0.0.1に固定、エージェントの性格設定用にSOUL.mdを作成、初期段階ではスキルをインストールしない、複数のエージェントを作成しない、会話コンテキスト管理に/newコマンドを使用する。

Claude VS Code拡張機能のエラー修正:「command claude-vscode.editor.openLast not found」
Claude VS Code拡張機能バージョン2.1.51には、重大なバグが含まれており、ユーザーが操作しようとすると「コマンド 'claude-vscode.editor.openLast' が見つかりません」というエラーが発生します。回避策はバージョン2.1.49にダウングレードすることです。