ai-trains-ai - RL agent that trains AI agents

Show HN: I RL-trained an agent that trains models with RL (for –$1.3k)

ai-trains-ai - RL agent that trains AI agents

ai-trains-ai는 강화학습(RL)으로 훈련된 AI 에이전트가 다른 AI 모델을 훈련시키는 파이프라인을 구축한 프로젝트입니다. 이 에이전트는 훈련 작업을 받아 환경, 보상 함수, 데이터셋, 하이퍼파라미터를 포함한 완전한 prime-rl 훈련 작업을 작성하고, 실제 Runpod GPU에서 훈련을 실행합니다. Tinker를 사용해 에이전트 자체를 RL로 훈련시켰으며, 보상은 54단계에 걸쳐 0.0에서 최고 0.63까지 상승했습니다. 놀랍게도, 이 기술은 훈련 중 보지 못한 새로운 작업군으로 전이되어 일반화 능력을 입증했습니다. 모든 코드, 모델 가중치(LoRA 어댑터), GPU 오케스트레이션, 보상 코드가 오픈소스로 공개되어 있어 누구나 재현하고 확장할 수 있습니다.

에이전트가 더 나은 모델을 만들기 시작했습니다. 단지 작동하는 모델이 아니라 더 나은 모델을요.

이 날의 다른 글

2026-07-14