Warum das Modell „Nächster-Token-Vorhersager“ das falsche Denkmodell für LLMs ist
Ein LLM als „Next-Token-Prädiktor“ zu bezeichnen, ist nicht falsch – es ist unvollständig. Diese Sichtweise beschreibt den Mechanismus (autoregressive Token-Erzeugung), ignoriert aber, was das Post-Training kodiert: die Simulation eines hilfsbereiten Assistenten und durch Exploration entdecktes Wissen.
Die Trainingsschleifen
Das Vortraining ist in der Tat Next-Token-Prädiktion:
for tokens in training_data:
for position in range(1, len(tokens)):
prior_tokens = tokens[:position]
actual_next_token = tokens[position]
model.make_more_likely(actual_next_token, after=prior_tokens)
Aber moderne LLMs durchlaufen RLVR (Verstärkungslernen mit überprüfbaren Belohnungen), das anders aussieht:
for task in training_tasks:
for explored_tokens in model.explore(task):
reward = evaluate_outcome(task, explored_tokens)
for position in range(len(explored_tokens)):
prior_tokens = task + explored_tokens[:position]
explored_next_token = explored_tokens[position]
model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)
Während RLVR generiert das Modell neue Sequenzen und lernt aus Ergebnissen – die in den Trainingsdaten nie vorkamen. Das ist grundlegend anders als bloße Nachahmung vorhandener Texte.
Schach-Analogie
Denken Sie an zwei Schachsysteme. Eines, das nur mit Großmeisterpartien trainiert wurde, sagt den wahrscheinlichsten nächsten Zug voraus – ein Nächster-Zug-Prädiktor. Ein anderes erkundet erschöpfend alle möglichen Partien, kennt die Gewinnwahrscheinlichkeit von jeder Stellung aus und wählt den Zug, der das Gewinnen maximiert. Das zweite als „Nächster-Zug-Prädiktor“ zu bezeichnen, wäre seltsam – es versucht zu gewinnen, nicht zu imitieren.
Warum es wichtig ist
RLHF verschiebt Modelle ebenfalls von Nachahmung zur Simulation eines hilfsbereiten Assistenten. RLVR geht weiter und ermöglicht Exploration über Trainingsdaten hinaus. „Next-Token-Prädiktor“ beschreibt also die Form, ignoriert aber, was die Schleife kodiert. Eine Simulation eines hilfsbereiten Assistenten und entdecktes Wissen passen beide in dieselbe autoregressive Schleife – aber das ist nicht alles, was sie sind.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Entwickler bevorzugt Qwen3.5-27B gegenüber proprietären Modellen aufgrund seiner Fehlermodi
Ein Entwickler auf r/LocalLLaMA berichtet, dass er Qwen3.5-27B gegenüber Gemini 3.1 Pro und GPT-5.3 Codex bevorzugt, weil es bei problematischen Aufgaben aufgibt, anstatt potenziell gefährlichen Code wie uneingeschränkte Perl- oder NodeJS-Skripte zu generieren.

Claude Code CC 2.1.124 und 2.1.126: Erinnerung an überschrittenes Dateiänderungsbudget, Aktualisierung der Harness-Anweisungen, REPL wartet auf Klärung, und Erinnerung an Malware-Analyse entfernt
CC 2.1.124 fügt eine Systemerinnerung für aufgrund von Budgetgrenzen ausgelassene Dateiänderungen hinzu, aktualisiert die Harness-Anweisungen mit expliziten Einfügepunkten und stellt das REPL-Auto-Await-Verhalten klar. CC 2.1.126 entfernt die Erinnerung zur Malware-Analyse nach dem Lesen.

Anthropic veröffentlicht kostenloses Bildungsprogramm inklusive Claude Code- und MCP-Mastery-Kurse.
Anthropic hat sein gesamtes Bildungsprogramm kostenlos verfügbar gemacht, einschließlich Kursen zu Claude Code, MCP Mastery, API-Nutzung und KI-Kompetenz. Das Curriculum wird als universitätsniveau beschrieben und bietet strukturiertes Lernen im Vergleich zu zufälligen Tutorials.

Erforschung von Clawras Architektur und sozialem Autonomie-Rahmenwerk
Davids Im's Arbeiten an Clawra durch OpenClaw führen zu einem überzeugenden Ansatz mit einem Konzept der 'digitalen Seele', das darauf abzielt, dass KI-Begleiter autonom in einem 'Parallelen Welt'-Setting agieren. Ein wesentlicher Aspekt dieser Architektur ist der Fokus auf speichergetriebene Autonomie.