Por que o 'Previsor de Próximo Token' é o Modelo Mental Errado para LLMs

✍️ OpenClawRadar📅 Publicado: September 5, 2026🔗 Source
Ad

Chamar um LLM de "preditor de próximo token" não é errado—é incompleto. Esse enquadramento descreve o mecanismo (geração autoregressiva de tokens), mas ignora o que o pós-treinamento codifica: simulação de um assistente útil e conhecimento descoberto por exploração.

Os Loops de Treinamento

O pré-treinamento é de fato predição de próximo token:

for tokens in training_data:
    for position in range(1, len(tokens)):
        prior_tokens = tokens[:position]
        actual_next_token = tokens[position]
        model.make_more_likely(actual_next_token, after=prior_tokens)

Mas LLMs modernos passam por RLVR (aprendizado por reforço com recompensas verificáveis), que se parece com isto:

for task in training_tasks:
    for explored_tokens in model.explore(task):
        reward = evaluate_outcome(task, explored_tokens)
        for position in range(len(explored_tokens)):
            prior_tokens = task + explored_tokens[:position]
            explored_next_token = explored_tokens[position]
            model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)

Durante o RLVR, o modelo gera novas sequências e aprende com os resultados—nunca vistos nos dados de treinamento. Isso é fundamentalmente diferente de apenas imitar texto existente.

Ad

Analogia com Xadrez

Pense em dois sistemas de xadrez. Um treinado apenas com jogos de grandes mestres prevê o movimento mais provável—um preditor de próximo movimento. Outro explora exaustivamente todos os jogos possíveis, conhece a probabilidade de vitória de cada posição e escolhe o movimento que maximiza a vitória. Chamar o segundo de "preditor de próximo movimento" seria estranho—ele está tentando vencer, não imitar.

Por Que Isso Importa

RLHF também desloca os modelos da imitação para a simulação de assistente útil. O RLVR vai além, permitindo exploração além dos dados de treinamento. Então "preditor de próximo token" descreve a forma, mas ignora o que o loop codifica. Uma simulação de um assistente útil e conhecimento descoberto cabem no mesmo loop autoregressivo—mas isso não é tudo o que eles são.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also