用 World Model 教 AI 玩 Pokémon Red
Teaching a World Model to Play Pokemon

受旧金山 Pokémon 热潮启发,我决定用 Yann LeCun 提出的 JEPA 架构,训练一个 World Model 来玩经典的 Pokémon Red。我的目标很具体:让模型在 Professor Oak 的实验室里,通过预测屏幕截图的潜在状态变化,自主规划按键序列来选择初始宝可梦。然而,训练过程并非一帆风顺,模型一度陷入“潜在坍塌”的陷阱,将所有画面压缩成相同的向量。为了解决这个问题,我引入了 SIGReg 正则化技术,强制嵌入空间保持高斯分布的多样性。最终,模型成功学会了在 Oak 的实验室中按下正确的按钮,选择了 Squirtle。
世界模型的目标是学习这种相关性,而不是仅仅记住在 Professor Oak 的实验室里按左键会让角色向左移动,而是要学会在任何地方按左键都会让角色向左移动。