Por qué backprop va hacia atrás
Why back propagation goes backward

La retropropagación se explica a menudo como propagar errores hacia atrás, pero rara vez se justifica por qué no calcular el gradiente en una pasada forward. Gregory Gundersen responde desde los primeros principios: en un grafo computacional dirigido, un algoritmo forward repite los mismos términos una y otra vez, con un coste cuadrático en el número de nodos. La pasada backward, en cambio, reutiliza los mensajes locales y logra un tiempo lineal.
Si ya tuviéramos acceso a los términos posteriores, por ejemplo, entonces podríamos pasar esos términos hacia atrás hasta el nodo para calcular.