Warum das Modell „Nächster-Token-Vorhersager“ das falsche Denkmodell für LLMs ist

✍️ OpenClawRadar📅 Veröffentlicht: 5. September 2026🔗 Source
Ad

Ein LLM als „Next-Token-Prädiktor“ zu bezeichnen, ist nicht falsch – es ist unvollständig. Diese Sichtweise beschreibt den Mechanismus (autoregressive Token-Erzeugung), ignoriert aber, was das Post-Training kodiert: die Simulation eines hilfsbereiten Assistenten und durch Exploration entdecktes Wissen.

Die Trainingsschleifen

Das Vortraining ist in der Tat Next-Token-Prädiktion:

for tokens in training_data:
    for position in range(1, len(tokens)):
        prior_tokens = tokens[:position]
        actual_next_token = tokens[position]
        model.make_more_likely(actual_next_token, after=prior_tokens)

Aber moderne LLMs durchlaufen RLVR (Verstärkungslernen mit überprüfbaren Belohnungen), das anders aussieht:

for task in training_tasks:
    for explored_tokens in model.explore(task):
        reward = evaluate_outcome(task, explored_tokens)
        for position in range(len(explored_tokens)):
            prior_tokens = task + explored_tokens[:position]
            explored_next_token = explored_tokens[position]
            model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)

Während RLVR generiert das Modell neue Sequenzen und lernt aus Ergebnissen – die in den Trainingsdaten nie vorkamen. Das ist grundlegend anders als bloße Nachahmung vorhandener Texte.

Ad

Schach-Analogie

Denken Sie an zwei Schachsysteme. Eines, das nur mit Großmeisterpartien trainiert wurde, sagt den wahrscheinlichsten nächsten Zug voraus – ein Nächster-Zug-Prädiktor. Ein anderes erkundet erschöpfend alle möglichen Partien, kennt die Gewinnwahrscheinlichkeit von jeder Stellung aus und wählt den Zug, der das Gewinnen maximiert. Das zweite als „Nächster-Zug-Prädiktor“ zu bezeichnen, wäre seltsam – es versucht zu gewinnen, nicht zu imitieren.

Warum es wichtig ist

RLHF verschiebt Modelle ebenfalls von Nachahmung zur Simulation eines hilfsbereiten Assistenten. RLVR geht weiter und ermöglicht Exploration über Trainingsdaten hinaus. „Next-Token-Prädiktor“ beschreibt also die Form, ignoriert aber, was die Schleife kodiert. Eine Simulation eines hilfsbereiten Assistenten und entdecktes Wissen passen beide in dieselbe autoregressive Schleife – aber das ist nicht alles, was sie sind.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Entwickler bevorzugt Qwen3.5-27B gegenüber proprietären Modellen aufgrund seiner Fehlermodi
Nachrichten

Entwickler bevorzugt Qwen3.5-27B gegenüber proprietären Modellen aufgrund seiner Fehlermodi

Ein Entwickler auf r/LocalLLaMA berichtet, dass er Qwen3.5-27B gegenüber Gemini 3.1 Pro und GPT-5.3 Codex bevorzugt, weil es bei problematischen Aufgaben aufgibt, anstatt potenziell gefährlichen Code wie uneingeschränkte Perl- oder NodeJS-Skripte zu generieren.

OpenClawRadar
Claude Code CC 2.1.124 und 2.1.126: Erinnerung an überschrittenes Dateiänderungsbudget, Aktualisierung der Harness-Anweisungen, REPL wartet auf Klärung, und Erinnerung an Malware-Analyse entfernt
Nachrichten

Claude Code CC 2.1.124 und 2.1.126: Erinnerung an überschrittenes Dateiänderungsbudget, Aktualisierung der Harness-Anweisungen, REPL wartet auf Klärung, und Erinnerung an Malware-Analyse entfernt

CC 2.1.124 fügt eine Systemerinnerung für aufgrund von Budgetgrenzen ausgelassene Dateiänderungen hinzu, aktualisiert die Harness-Anweisungen mit expliziten Einfügepunkten und stellt das REPL-Auto-Await-Verhalten klar. CC 2.1.126 entfernt die Erinnerung zur Malware-Analyse nach dem Lesen.

OpenClawRadar
Anthropic veröffentlicht kostenloses Bildungsprogramm inklusive Claude Code- und MCP-Mastery-Kurse.
Nachrichten

Anthropic veröffentlicht kostenloses Bildungsprogramm inklusive Claude Code- und MCP-Mastery-Kurse.

Anthropic hat sein gesamtes Bildungsprogramm kostenlos verfügbar gemacht, einschließlich Kursen zu Claude Code, MCP Mastery, API-Nutzung und KI-Kompetenz. Das Curriculum wird als universitätsniveau beschrieben und bietet strukturiertes Lernen im Vergleich zu zufälligen Tutorials.

OpenClawRadar
Erforschung von Clawras Architektur und sozialem Autonomie-Rahmenwerk
Nachrichten

Erforschung von Clawras Architektur und sozialem Autonomie-Rahmenwerk

Davids Im's Arbeiten an Clawra durch OpenClaw führen zu einem überzeugenden Ansatz mit einem Konzept der 'digitalen Seele', das darauf abzielt, dass KI-Begleiter autonom in einem 'Parallelen Welt'-Setting agieren. Ein wesentlicher Aspekt dieser Architektur ist der Fokus auf speichergetriebene Autonomie.

OpenClawRadar