用强化学习训练无人机竞速的实战配方

A recipe for drone racing with reinforcement learning

用强化学习训练无人机竞速的实战配方

这是四旋翼模拟系列的终章。我不再从头推导公式,而是分享一套训练无人机竞速策略的实战配方。从验证 PPO 超参数的倒立摆任务,到构建基于 MuJoCo 的自定义环境,再到实现 CTBR 动作空间与低层 P 控制器,我逐步拆解了从悬停到穿越八门赛道的关键技巧。核心在于将长任务拆解为短任务,通过随机重置起始门让策略真正学会读取目标信息。这套方法没有严谨证明,全是经验之谈,代码已开源在 GitHub 上。

在每次重置时随机化起始门,因为它将一个漫长的竞速任务转化为许多短小的单门任务,并迫使策略真正从观测中读取目标门。

同日更多故事

2026-08-19