Модель мира учится выбирать стартового покемона в Pokémon Red

Teaching a World Model to Play Pokemon

Модель мира учится выбирать стартового покемона в Pokémon Red

Автор обучил world model на архитектуре JEPA предсказывать последствия нажатий кнопок в Pokémon Red. Модель планирует последовательность действий, чтобы выбрать стартового покемона в лаборатории профессора Оука. В статье разбираются эмбеддинги, коллапс латентного пространства и регуляризация SIGReg, а также трудности, возникшие при обучении на RTX 3080 Ti.

В худшем случае энкодер начинает учиться встраивать каждый скриншот как один и тот же эмбеддинг c. Тогда предиктор также начинает предсказывать, что следующий эмбеддинг будет c. Это называется латентным коллапсом и означает, что модель нашла тривиальный способ уменьшить функцию потерь — сколлапсировав все эмбеддинги в один.

Ещё за этот день

2026-09-26