Universelle Trainierbarkeit: Jedes neuronale Netz lässt sich per Gradientenabstieg optimieren
Universality of Gradient Descent Neural Network Training

Die Wahl des Netzwerkdesigns entscheidet oft über den Erfolg des Trainings. Diese Arbeit zeigt: Wenn es überhaupt einen Algorithmus gibt, der für eine Klassifikationsaufgabe gute Gewichte findet, dann existiert eine Erweiterung des Netzwerks, die diese Gewichte und die zugehörige Ausgabe allein durch Gradientenabstieg reproduziert. Das Konstrukt ist nicht für die Praxis gedacht, bietet aber Orientierung für Meta-Learning und verwandte Ansätze.
Wenn es für ein gegebenes Netzwerk irgendeinen Algorithmus gibt, der gute Gewichte für eine Klassifikationsaufgabe finden kann, dann existiert eine Erweiterung dieses Netzwerks, die diese Gewichte und die entsprechende Vorwärtsausgabe durch bloßes Gradientenabstieg-Training reproduziert.