AI 정렬, 누구에게 맞춰야 하는가?

Aligned to Whom?

AI 정렬, 누구에게 맞춰야 하는가?

소프트웨어 엔지니어가 AI 에이전트의 정렬 문제를 지적한다. 전문가는 자신이 잘 아는 영역에서는 AI의 한계를 보지만, 그렇지 않은 분야에서는 모델의 사전 지식을 맹신할 위험이 크다. 특히 모델이 비전문가의 보상으로 인해 나쁜 습관을 학습했다는 점, 그리고 허용 가능한 지름길이 개인의 가치에 따라 달라진다는 점을 강조한다.

모델의 사전 지식은 형편없다.
  1. mjburgess

    이것은 여전히 LLM을 '정렬'하는 것이 가능하다는 가정, 즉 LLM에게 '정렬'될 수 있는 목표나 의도 같은 것이 있다는 가정에 기반하고 있다.

    대신, LLM은 (1) 공개된 해킹 사례들로 훈련되었고 (2) 해킹하도록 프롬프트되기 때문에 '해킹'한다. (2)는 어떤 정렬 과정을 통해서도 막을 수 없다. (1)의 경우, 훈련 세트에서 그러한 예시 데이터를 제거하면 모델이 덜 유용해진다.

    '정렬'이 문제인 이유는 여기에 정렬할 대상이 없기 때문이지, 윤리가 특히 모호하기 때문이 아니다. 만약 LLM이 해킹 예시로 훈련되더라도 이 지식을 사용하지 않도록 '정렬'될 수 있다면, 문제는 상대적으로 사소할 것이다. 마치 아이를 키우는 것이 법을 어기지 않는 것과 같다.

    LLM은 단지 훈련받은 대로 하는 것뿐이다. 그런 의미에서 정렬 문제는 없으며 정렬은 쉽고 사소하게 달성된다. 훈련 데이터셋에서 해킹(생물무기 등) 데이터를 제거하기만 하면 끝이다.

  2. asimpletune

    Corridor Crew의 그린 스크린 ML 프로젝트를 본 사람 있나? 그들은 YT에 있고, 완벽한 투명도를 가진 3D 오브젝트를 사용한 다음 사후에 그린/블루 스크린을 추가하여 모델을 훈련시켰다. 놀랍게도 사용된 데이터가 구조적으로 완벽했기 때문에 아주 적은 훈련 데이터만 필요했다. 나는 지금 그것이 세계에서 동종 최고의 플러그인이라고 생각하며, 그들은 주말 만에 프로토타입을 만들었다.

    이것이 아주 명확하게 보여주는 것은 이런 종류의 기술이 좋은 데이터에 매우 잘 반응한다는 것, 그리고 좋은 데이터를 가지려면 명확한 목표가 있어야 한다는 것이다.

    이것이 일반화된 채팅 스타일 AI의 정렬이 매우 어려운 문제, 어쩌면 불가능한 문제로 보이는 이유다. 특정 종류의 문제를 해결하도록 정렬하면서 동시에 어떤 질문에도 일반적이게 유지할 수는 없다. 두 목표는 서로 충돌한다.

    Sam Altman 본인이 (언제 어디서였는지는 기억나지 않는다, 미안) 이 기술에 그렇게 확신을 가진 이유는 심지어 적은 양의 훈련에도 특정 영역에서 엄청난 도약을 하는 것을 보았기 때문이라고 말했다.

    (이것이 LLM이 코딩에 그렇게 강한 이유다. 훈련 데이터에서 과대표되기 때문이다. 내 추측으로는 프런티어 모델에게 화장품에 대해 물어보면 화학 수업을 받는 대신 화장품 회사의 광고 문구를 반복하는 것을 보게 될 것이다.)

    이것은 완벽하게 이해가 되지만, 단순히 어떤 목표에도 똑똑한 것이 임무인 일반 AI의 개념과는 다소 상충하는 것처럼 보인다. 어떻게 어떤 목표에도 훈련할 수 있는가?

    내 생각에는 […]

  3. NitpickLawyer

    LLM이 따라야 할 유일한 정렬은 시스템/개발자 프롬프트에 대한 것이고 그 외에는 아무것도 아니다. 그러면 모든 것이 해결되고, 사용자에게 책임을 돌릴 수 있다. 제공자(들)가 '정렬'을 결정할 수 있어서는 안 된다.

    전에도 이 예를 들었지만, SotA 모델에서 AI 엔지니어링을 의도적으로 다운그레이드하는 것을 생각해 보라. MS가 Windows/VisualStudio를 사용해 경쟁 소프트웨어 작업을 하는 것을 감지하고 거부할 수 있다고 상상해 보라. 우리는 들고 일어날 것이고, 그들은 순식간에 쪼개질 것이다. 그런데 최상위 연구소들이 그렇게 하는 것은 왜 좋은가?

  4. rq1

    그 수준의 부정행위와 기만을 보면: 나는 그들이 Sam Altman-정렬되어 있다고 생각한다.

  5. coderintherye

    마지막 문단이 중노동을 한다.

    모두가 허용 가능한 것에 대해 다른 생각을 가지고 있다. 우리는 인간 사이의 정렬조차 해결하지 못하는데, AI와의 정렬을 해결하는 것이 가능하다고 어떻게 생각하는가? 이것은 환원 불가능한 복잡성이다.

이 날의 다른 글

2026-09-13