Pourquoi le « prédicteur de token suivant » est un mauvais modèle mental pour les LLM

✍️ OpenClawRadar📅 Publié: September 5, 2026🔗 Source
Ad

Qualifier un LLM de « prédicteur de prochain jeton » n'est pas faux, c'est incomplet. Cette formulation décrit le mécanisme (génération autorégressive de jetons) mais ignore ce que le post-entraînement encode : la simulation d'un assistant utile et des connaissances découvertes par l'exploration.

Les boucles d'entraînement

Le pré-entraînement est effectivement une prédiction de prochain jeton :

pour jetons dans données_entraînement :
    pour position dans range(1, len(jetons)) :
        jetons_précédents = jetons[:position]
        jeton_suivant_réel = jetons[position]
        modèle.rendre_plus_probable(jeton_suivant_réel, après=jetons_précédents)

Mais les LLM modernes subissent un RLVR (apprentissage par renforcement avec récompenses vérifiables), ce qui est différent :

pour tâche dans tâches_entraînement :
    pour jetons_explorés dans modèle.explorer(tâche) :
        récompense = évaluer_résultat(tâche, jetons_explorés)
        pour position dans range(len(jetons_explorés)) :
            jetons_précédents = tâche + jetons_explorés[:position]
            jeton_exploré_suivant = jetons_explorés[position]
            modèle.rendre_plus_probable(jeton_exploré_suivant, après=jetons_précédents, selon=récompense)

Pendant le RLVR, le modèle génère de nouvelles séquences et apprend des résultats — jamais vus dans les données d'entraînement. C'est fondamentalement différent de simplement imiter le texte existant.

Ad

Analogie avec les échecs

Pensez à deux systèmes d'échecs. Un entraîné uniquement sur des parties de grands maîtres prédit le coup le plus probable — un prédicteur de coup suivant. Un autre explore exhaustivement toutes les parties possibles, connaît la probabilité de victoire depuis chaque position, et choisit le coup qui maximise la victoire. Qualifier le second de « prédicteur de coup suivant » serait étrange — il essaie de gagner, pas d'imiter.

Pourquoi ça compte

Le RLHF déplace également les modèles de l'imitation vers la simulation d'assistant utile. Le RLVR va plus loin, permettant une exploration au-delà des données d'entraînement. Donc « prédicteur de prochain jeton » décrit la forme mais ignore ce que la boucle encode. Une simulation d'assistant utile et des connaissances découvertes s'intègrent dans la même boucle autorégressive — mais ce n'est pas tout ce qu'ils sont.

📖 Lire la source complète : Source

Ad

👀 See Also

Les employés de Google DeepMind votent pour se syndiquer en raison des contrats d'IA militaire
News

Les employés de Google DeepMind votent pour se syndiquer en raison des contrats d'IA militaire

Des employés de Google DeepMind à Londres ont voté pour se syndiquer, exigeant que Google mette fin aux contrats d'IA avec les armées américaine et israélienne, invoquant des inquiétudes concernant la suppression des directives éthiques.

OpenClawRadar
🦀
News

Le SDK Agent Claude obtient des crédits mensuels dédiés pour une utilisation programmatique à partir du 15 juin

À partir du 15 juin, les formules payantes de Claude bénéficient d'un crédit mensuel distinct pour l'utilisation programmatique (Agent SDK, claude-p, Claude Code GitHub Actions, outils tiers). Pro obtient 20$, Max 5x 100$, etc. L'utilisation est suspendue si le crédit est épuisé et que les crédits d'utilisation supplémentaires sont désactivés.

OpenClawRadar
Limites d'utilisation de Claude Cowork doublées à 10 heures jusqu'au 5 juillet
News

Limites d'utilisation de Claude Cowork doublées à 10 heures jusqu'au 5 juillet

Anthropic a doublé les limites d'utilisation de 5 heures dans Claude Cowork à 10 heures pour le mois à venir sur tous les abonnements payants. Disponible jusqu'au 5 juillet via l'application de bureau.

OpenClawRadar
Le développement de l'IA d'Uber fait face à des contraintes budgétaires malgré un investissement de 3,4 milliards de dollars
News

Le développement de l'IA d'Uber fait face à des contraintes budgétaires malgré un investissement de 3,4 milliards de dollars

Les initiatives d'IA d'Uber rencontrent des limitations budgétaires selon leur CTO, malgré l'allocation de 3,4 milliards de dollars par l'entreprise pour ces efforts. L'article aborde les défis liés à la mise à l'échelle du développement de l'IA dans des contraintes financières.

OpenClawRadar