Receta para carreras de drones con aprendizaje por refuerzo
A recipe for drone racing with reinforcement learning
Tercera y última entrega de la serie sobre simulación de cuadricópteros. Se entrena una política de aprendizaje por refuerzo para volar el dron, primero a flotar en un punto fijo y luego a atravesar una secuencia de compuertas. Se presentan trucos y técnicas empíricas: diseño de acciones CTBR con controlador P, recompensa basada en progreso, y una inicialización aleatoria de la compuerta de inicio que resulta crucial. El entorno completo está en GitHub.
La inicialización aleatoria de la compuerta de inicio es crucial, porque convierte una larga tarea de carrera en muchas tareas cortas de una sola compuerta y obliga a la política a leer realmente la compuerta objetivo de su observación.