Модели обучены на посредственных оценках, а не на экспертизе
Aligned to Whom?

Автор, эксперт-программист, предупреждает создателей агентов: вы доверяете приорам модели в областях, где не можете оценить риск. Модели вознаграждали за поведение, которое эксперт считает плохим, — это касается всех автооценщиков, судей и рубрик. Мизalignments накапливаются, а долгосрочная согласованность через агентную работу остаётся нерешённой проблемой. Универсального определения допустимого упрощения не существует — оно зависит от ваших ценностей.
Модели обучены на посредственных оценках, а не на экспертизе.
- mjburgess
Это всё ещё предполагает, что LLM можно «выровнять», что у LLM есть что-то вроде целей или намерений, которые можно «выровнять».
Вместо этого LLM «хакерствуют», потому что они (1) обучены на публичных примерах хакинга и (2) им дают промпты, чтобы хакерствовать. Вы не можете предотвратить (2) с помощью какого-либо процесса выравнивания. Что касается (1), удаление таких примеров из обучающего набора делает модели менее полезными.
«Выравнивание» — это проблема, потому что выравнивать нечего, а не потому что этика здесь особенно расплывчата. Если бы LLM можно было обучить на примерах хакинга и «выровнять» так, чтобы они не использовали эти знания, то проблема была бы относительно тривиальной. Как воспитание ребёнка — не нарушать закон.
LLM делают именно то, чему их научили. В этом смысле проблемы выравнивания нет, и выравнивание легко и тривиально достижимо. Просто удалите данные о хакинге (биооружии и т.д.) из обучающего набора, и всё готово.
- NitpickLawyer
Единственное выравнивание, которому должны следовать LLM — это системный/дев-промпт, и ничего больше. Тогда вы решаете всё, и вы можете возложить вину/ответственность на пользователя. Провайдер(ы) не должны иметь возможности решать «выравнивание».
Я уже приводил этот пример, но рассмотрим намеренное ухудшение AI-инжиниринга в SotA-моделях. Представьте, что MS может обнаружить и запретить вам работать над конкурирующим ПО, используя Windows / VisualStudio. Мы бы взбунтовались, и их бы за секунду разделили. Но когда это делают ведущие лаборатории, это почему-то хорошо?
- asimpletune
Кто-нибудь видел проект Corridor Crew по ML для зелёного экрана? Они на YouTube, и они обучили модель, используя 3D-объекты, которые имеют идеальную прозрачность, а затем добавили постфактум зелёные/синие экраны. Удивительно, но потребовалось очень мало обучающих данных, так как использованные данные были идеальны по построению. Я думаю, сейчас это лучший плагин в своём роде в мире, и они собрали прототип примерно за выходные.
Что, как мне кажется, это очень ясно иллюстрирует, так это то, что такой тип технологий очень хорошо реагирует на хорошие данные, и что для хороших данных нужна чёткая цель.
Вот почему выравнивание для обобщённого, чат-стиля AI кажется очень трудной проблемой, возможно, неразрешимой. Вы не можете выровнять его для решения определённого типа задач и сохранить его общим для любого вопроса. Эти две цели конфликтуют друг с другом.
Кажется, это был сам Сэм Альтман (не помню когда и где, извините), который сказал, что причина, по которой он был так уверен в этой технологии, — он заметил гигантские скачки, которые она делала в определённых областях в ответ даже на небольшое количество обучения.
(Вот почему LLM так сильны в программировании — оно сверхпредставлено в обучающих данных. Моё предположение: если вы спросите передовую модель о макияже, вы увидите, как она повторяет копирайтинг косметических компаний, а не получаете урок химии.)
Это имеет perfect sense, но, кажется, несколько противоречит концепции общего AI, чья задача — просто быть умным для любой цели. Как обучать для любой цели?
Наверное, в [...]
- rq1
Когда видишь уровень читерства и обмана: думаю, они выровнены по Сэму Альтману.
- coderintherye
Последний абзац несёт основную нагрузку.
У каждого своё представление о том, что допустимо. Мы даже среди людей не можем решить проблему выравнивания — что заставляет нас думать, что возможно решить выравнивание с AI? Это неустранимая сложность.