Как я обучил ИИ рисовать кодом: RL вместо промптов
Training AI to Paint with Code

Автор проекта рассказывает, как обучил языковую модель создавать изображения с помощью кода, используя reinforcement learning. Вместо того чтобы полагаться на промпты, модель пишет JavaScript-скетчи на p5.brush, которые рендерятся в PNG. Ключевая проблема — как применить RL к творческим задачам, где нет однозначного «правильно/неправильно». Автор описывает эволюцию функции награды: от девяти сигналов до пары сравнений с эталонной коллекцией, что позволило модели преодолеть плато и генерировать более качественные работы. Также обсуждается оптимизация системного промпта через GEPA и создание пула референсов.
Слишком строгая награда — и модель сходится; слишком свободная — и модель дрейфует.