ai-trains-ai - RL-trained agent that RL-trains AI models
Show HN: I RL-trained an agent that trains models with RL (for –$1.3k)

ai-trains-aiは、AIエージェントがRL(強化学習)を用いて他のAIモデルを訓練するパイプラインを構築したプロジェクトです。このエージェントは、訓練タスク(例:「モデルにXを教える」)を受け取り、完全なprime-rlトレーニングジョブ(環境、報酬、データセット、ハイパーパラメータを含む)を作成し、Runpod GPU上で実際に訓練を実行します。さらに、Tinkerを使用してエージェント自体をRL訓練し、より良いモデルを訓練した際に報酬を与えました。報酬は54ステップで約0.0からピーク0.63まで上昇し、訓練されていないタスクファミリーへの転移も確認されました。すべてのコード、重み、報酬コード、GPUオーケストレーションがオープンソースで公開されています。
AIがRLループの中で、そのアクションとしてAIをRLループで訓練する——この自己参照的なアプローチが、AIによるAI訓練の新たな可能性を切り開きます。