Почему LLM — это не просто предсказатели следующего токена
"Next-token predictor" is the wrong mental model for LLMs
Автор разбирает распространённое утверждение, что большие языковые модели — всего лишь предсказатели следующего токена. Он признаёт, что технически это верно, но упускает суть. В статье объясняется, как пост-обучение, особенно обучение с подкреплением на основе проверяемых вознаграждений (RLVR), позволяет моделям выходить за рамки имитации обучающих данных и открывать новые знания. Аналогия с шахматными движками помогает увидеть разницу между предсказанием следующего хода и выбором выигрышного хода. Автор приходит к выводу, что называть LLM предсказателями следующего токена — значит описывать лишь форму механизма, игнорируя его содержание.
Называть вторую систему «предсказателем следующего хода» было бы странно: она не пытается угадать, какой ход встретится в наборе данных, а стремится выбрать ход, который ведёт к победе.