Почему модель «предсказатель следующего токена» — неверный подход к пониманию LLM
Называть LLM «предсказателем следующего токена» не неверно — это неполно. Такая формулировка описывает механизм (авторегрессионную генерацию токенов), но игнорирует то, что закладывается пост-обучением: симуляцию полезного ассистента и знания, открытые в ходе исследования.
Циклы обучения
Предобучение действительно является предсказанием следующего токена:
for tokens in training_data:
for position in range(1, len(tokens)):
prior_tokens = tokens[:position]
actual_next_token = tokens[position]
model.make_more_likely(actual_next_token, after=prior_tokens)
Но современные LLM проходят RLVR (обучение с подкреплением на основе проверяемых вознаграждений), которое выглядит иначе:
for task in training_tasks:
for explored_tokens in model.explore(task):
reward = evaluate_outcome(task, explored_tokens)
for position in range(len(explored_tokens)):
prior_tokens = task + explored_tokens[:position]
explored_next_token = explored_tokens[position]
model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)
Во время RLVR модель генерирует новые последовательности и учится на результатах, которых никогда не было в обучающих данных. Это принципиально отличается от простой имитации существующего текста.
Шахматная аналогия
Представьте две шахматные системы. Одна, обученная только на партиях гроссмейстеров, предсказывает наиболее вероятный следующий ход — это предсказатель следующего хода. Другая исчерпывающе исследует все возможные партии, знает вероятность выигрыша из каждой позиции и выбирает ход, максимизирующий победу. Называть вторую «предсказателем следующего хода» было бы странно — она пытается выиграть, а не имитировать.
Почему это важно
RLHF также смещает модели от имитации к симуляции полезного ассистента. RLVR идет дальше, позволяя исследовать за пределами обучающих данных. Таким образом, «предсказатель следующего токена» описывает форму, но игнорирует то, что кодирует цикл. Симуляция полезного ассистента и обнаруженные знания умещаются в одном авторегрессионном цикле — но это не все, чем они являются.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Еженедельное руководство по выживанию в r/ClaudeAI: Opus 4.7, ошибка биллинга и инцидент с удалением базы данных
Еженедельное руководство по выживанию от Wilson'а собирает лучшие темы r/ClaudeAI (50+ комментариев) в практические уроки: обсуждение Opus 4.7, баг с выставлением счета на $200 из-за имени файла в git, ИИ-агент, удаливший всю базу данных за 9 секунд, и повышение цен Copilot на модели Claude в 9 раз.
Обнаруженные материалы: ИИ-агенты открывают более 500 новых материалов, но только у одного есть реальный путь синтеза
Discovered Materials (YC P26) использовала передовые LLM для вычислительного поиска более 500 новых полупроводниковых материалов. Только один имеет реальный путь синтеза, что подчеркивает разрыв между лабораторией и производством.

Напряженность нарастает между Пентагоном и компанией ИИ Anthropic.
Использование ИИ Anthropic Пентагоном в засекреченных операциях, таких как рейд в Венесуэле, создало напряженность по поводу политик безопасности ИИ компании.

Пентагон установил пятницу крайним сроком для компании Anthropic, чтобы та отказалась от правил этики ИИ.
Пентагон дал компании Anthropic до пятницы, чтобы отказаться от правил этики ИИ, согласно отчету Politico. Статья получила 15 баллов и 3 комментария на Hacker News.