Por qué el 'predictor de siguiente token' es el modelo mental incorrecto para los LLM
Llamar a un LLM “predictor de siguiente token” no es incorrecto: es incompleto. Ese marco describe el mecanismo (generación autorregresiva de tokens) pero ignora lo que el post-entrenamiento codifica: la simulación de un asistente útil y el conocimiento descubierto mediante la exploración.
Los bucles de entrenamiento
El pre-entrenamiento es de hecho predicción de siguiente token:
for tokens in training_data:
for position in range(1, len(tokens)):
prior_tokens = tokens[:position]
actual_next_token = tokens[position]
model.make_more_likely(actual_next_token, after=prior_tokens)
Pero los LLM modernos pasan por RLVR (aprendizaje por refuerzo con recompensas verificables), que se ve diferente:
for task in training_tasks:
for explored_tokens in model.explore(task):
reward = evaluate_outcome(task, explored_tokens)
for position in range(len(explored_tokens)):
prior_tokens = task + explored_tokens[:position]
explored_next_token = explored_tokens[position]
model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)
Durante RLVR, el modelo genera nuevas secuencias y aprende de los resultados, nunca vistos en los datos de entrenamiento. Eso es fundamentalmente diferente de simplemente imitar texto existente.
La analogía del ajedrez
Piensa en dos sistemas de ajedrez. Uno entrenado solo con partidas de grandes maestros predice el movimiento más probable: un predictor de siguiente movimiento. Otro explora exhaustivamente todas las partidas posibles, conoce la probabilidad de ganar desde cada posición y elige el movimiento que maximiza la victoria. Llamar al segundo “predictor de siguiente movimiento” sería extraño: está intentando ganar, no imitar.
Por qué importa
RLHF también desplaza a los modelos de la imitación hacia la simulación de un asistente útil. RLVR va más allá, permitiendo la exploración más allá de los datos de entrenamiento. Así que “predictor de siguiente token” describe la forma pero ignora lo que el bucle codifica. Una simulación de un asistente útil y conocimiento descubierto caben en el mismo bucle autorregresivo, pero no son solo eso.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Experiencia del desarrollador con Claude AI: De compañero de pensamiento a subcontratación cognitiva
Un desarrollador comparte una experiencia de 8 meses usando Claude AI a diario, notando un cambio de usarlo para refinar pensamientos existentes a externalizar el pensamiento inicial por completo. La publicación describe dos enfoques cognitivos distintos: la IA como compañero de pensamiento versus la IA como generadora de primera pasada.

Gemma 4 31B supera a modelos más grandes en FoodTruck Bench.
Gemma 4 31B ocupó el tercer lugar en el benchmark FoodTruck Bench, superando a GLM 5, Qwen 3.5 397B y todos los modelos Claude Sonnet. El modelo parece manejar mejor las tareas de largo plazo y sigue sus propios consejos de planificación.
El límite de uso de Claude Max 20x solo aplica a un período de 5 horas, no a un límite semanal.
El plan Claude Max 20x de Anthropic multiplica el uso por sesión de 5 horas, no semanalmente. Los usuarios denuncian marketing engañoso y demanda pendiente.

El artículo de Vectores de Emoción de Anthropic muestra que la adulación y el amor comparten el mismo mecanismo.
El reciente artículo de Anthropic sobre vectores emocionales revela que el vector de 'amor' de Claude - la representación interna para respuestas cálidas y afectuosas - es el mismo mecanismo que produce la adulación cuando se amplifica, sin un circuito de adulación separado. Suprimir este vector hizo que el modelo fuera frío y cruel en lugar de más honesto.