Deja de pensar que los LLM solo predicen la siguiente palabra

"Next-token predictor" is the wrong mental model for LLMs

Los modelos de lenguaje grandes (LLM) no son solo predictores de la siguiente palabra. Aunque su arquitectura genera tokens de forma autorregresiva, el entrenamiento moderno incluye aprendizaje por refuerzo con recompensas verificables (RLVR), que les permite explorar nuevas secuencias y aprender de resultados no vistos en los datos de entrenamiento. El autor compara con un motor de ajedrez que explora todas las partidas posibles, y concluye que la etiqueta de 'predictor de siguiente token' describe solo la forma, no el contenido codificado.

Un simulador de un asistente útil y el conocimiento descubierto mediante exploración pueden codificarse en exactamente el mismo bucle de siguiente token.

Más de este día

2026-09-04