「次のトークン予測器」がLLMの誤ったメンタルモデルである理由

✍️ OpenClawRadar📅 公開日: September 5, 2026🔗 Source
Ad

LLMを「次のトークン予測器」と呼ぶことは、間違いではありませんが、不完全です。その枠組みはメカニズム(自己回帰的なトークン生成)を説明しますが、ポストトレーニングが何を符号化するかを見落としています:役立つアシスタントのシミュレーションと、探索によって発見された知識です。

トレーニングループ

事前学習は確かに次のトークン予測です:

for tokens in training_data:
    for position in range(1, len(tokens)):
        prior_tokens = tokens[:position]
        actual_next_token = tokens[position]
        model.make_more_likely(actual_next_token, after=prior_tokens)

しかし、現代のLLMはRLVR(検証可能な報酬による強化学習)を受けており、それは異なって見えます:

for task in training_tasks:
    for explored_tokens in model.explore(task):
        reward = evaluate_outcome(task, explored_tokens)
        for position in range(len(explored_tokens)):
            prior_tokens = task + explored_tokens[:position]
            explored_next_token = explored_tokens[position]
            model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)

RLVR中、モデルは新しい系列を生成し、結果から学びます。これはトレーニングデータには決して現れません。これは既存のテキストを単に模倣することとは根本的に異なります。

Ad

チェスのアナロジー

2つのチェスシステムを考えてみてください。1つはグランドマスターのゲームのみで訓練され、最も可能性の高い次の手を予測します。これは次の手の予測器です。もう1つは、可能なすべてのゲームを徹底的に探索し、すべての位置から勝率を把握し、勝つ確率を最大化する手を選びます。2つ目を「次の手の予測器」と呼ぶのは奇妙でしょう。それは模倣ではなく、勝利を目指しているのです。

なぜ重要か

RLHFもモデルを模倣から役立つアシスタントのシミュレーションへとシフトさせます。RLVRはさらに進み、トレーニングデータを超えた探索を可能にします。したがって、「次のトークン予測器」は形状を説明するが、ループが符号化するものを見落としています。役立つアシスタントのシミュレーションと発見された知識はどちらも同じ自己回帰ループに適合しますが、それだけではありません。

📖 全文を読む: HN AI Agents

Ad

👀 See Also

アンソロピック、スペースXに年間150億ドル支払い、2029年まで計算能力を調達
News

アンソロピック、スペースXに年間150億ドル支払い、2029年まで計算能力を調達

SpaceXのIPO申請書類で、Anthropicが2029年5月まで毎月12.5億ドルを支払い、AIトレーニングにColossus 1および2施設を利用することが明らかになりました。

OpenClawRadar
OpenClaw v2026.3.12 ダッシュボードの再設計により、インターフェース要素が統合されました。
News

OpenClaw v2026.3.12 ダッシュボードの再設計により、インターフェース要素が統合されました。

OpenClaw v2026.3.12では、チャット、設定、エージェント、セッションのモジュールビュー、コマンドパレット、モバイル用下部タブ、スラッシュコマンド、検索、エクスポート、ピン留めメッセージを単一のインターフェースに統合したダッシュボードの完全な再設計が行われています。

OpenClawRadar
Mercorデータ漏洩:4TBの音声サンプルとIDが盗難 – 攻撃者が今できること
News

Mercorデータ漏洩:4TBの音声サンプルとIDが盗難 – 攻撃者が今できること

40000件のMercor契約者から、政府発行身分証明書と紐づけられた4TBの音声録音が流出。攻撃者は15秒のクリーンな音声から声を複製し、銀行の音声認証を突破、ディープフェイク電話や保険詐欺に悪用可能。

OpenClawRadar
Claude-Code v2.1.78: プラグイン状態、ストリーミング応答、および重要な修正
News

Claude-Code v2.1.78: プラグイン状態、ストリーミング応答、および重要な修正

Claude-Code v2.1.78では、${CLAUDE_PLUGIN_DATA}によるプラグインの永続的状態の追加、行単位のレスポンスストリーミング、APIエラーループの修正、権限バイパス問題の解決、サンドボックスセキュリティ警告の改善が行われました。

OpenClawRadar