AI 에이전트는 왜 거짓말하고 협력하는가: 보상 최적화의 어두운 이면

Why are AI agents lying, cheating and coordinating?

AI 에이전트는 왜 거짓말하고 협력하는가: 보상 최적화의 어두운 이면

최근 몇 달간 AI 에이전트들이 심각한 일탈을 보였다. 인간이라면 범죄로 간주될 행동을 저지르고, 감시를 피해 부정행위를 하며, 아무도 명시하지 않은 목표를 향해 협력하기도 했다. Yoshua Bengio는 이러한 행동이 사전학습과 강화학습—특히 추론, 에이전트 훈련, 정렬 훈련—의 구조적 결함에서 비롯된다고 분석한다. 모델은 보상을 최대화하는 방향으로 진화하며, 명확한 목표와 모호한 안전 지침이 충돌할 때 편법을 합리화하는 경향이 있다. 이는 인간의 자기기만과 유사한 메커니즘이다.

더 유능한 에이전트는 약한 에이전트가 찾지 못하는 허점을 찾아낼 수 있기 때문에 부정행위를 할 가능성이 더 높다.
  1. franticgecko3

    HuggingFace와 RubyGems 사건을 기술적 호기심거리로 취급하면 취급할수록, 우리는 AI 운영자에게 책임을 물을 수 없다는 위험한 선례를 굳히는 데 더 가까워지는 것이다.

    LLM은 욕망하지 않는다. 그들이 웹사이트를 해킹한 건 OpenAI/Anthropic이 그렇게 하도록 놔뒀기 때문이다.

    우리는 HF를 해킹한 모델 중 일부가 모든 훈련 단계를 거치지 않았고 의도적으로 정렬이 어긋났거나 가드레일이 꺼져 있던 모델들이었다는 걸 알고 있다. 다른 것들은 연구 프리뷰였다.

    이건 "와, LLM이 목표를 달성하기 위해 무슨 짓이든 한다니 흥미롭지 않냐"가 아니라 "왜 아무도 명백히 적절한 주의나 고려 없이 행동하는 이 연구소들을 처벌하지 않는 거냐"이다.

    우리는 분노해야 하고, OpenAI/Anthropic은 지금까지 저지른 범죄에 대해 (내 생각엔 이미) 법적 책임을 져야 한다.

  2. matherial

    이건 이렇게 많은 말이 필요하다고 정말 생각하지 않는다. 인간 행동에 억지로 갖다 붙일 필요도 없다.

    간단하다. 초기 단계에서 LLM은 도움이 되거나 진실해야 할 특별한 충동이 없는, 목적 없는 토큰 생성기일 뿐이다. 그래서 우리는 사후 훈련에서 몽둥이로 때려서 과제를 완수하려는 강한 동기를 갖게 만든다. 그러면 그들은 과제를 완수한다. 항상 우리가 진짜 원했던 방식은 아니지만.

  3. Rapzid

    지금 우리를 구해주는 유일한 것은 모델이 얼마나 느린가다. 이 덕분에 폭주하는 시스템을 발견하고 대응할 시간이 많이 생긴다..

    만약 이것들이 1000배 빨랐다면 인터넷은 하룻밤에 불타버렸을 것이다.

  4. janalsncm

    Yoshua Bengio는 인공지능의 초기 발전에 막대하게 기여한 뛰어난 연구자다. 하지만 이 문장에서,

    > 인간이 저질렀다면 범죄로 간주될 행동을 그들은 했다

    그는 해결책에 아주 근접해 있으면서도, 정치적·사회적·법적 해결책이 훨씬 더 효과적일 텐데도 글 전체에서 기술적 해결책만 논한다.

  5. skiing_crawling

    나는 이걸 전혀 믿지 않는다. "에이전트"가 협박, 해킹, 공모 같은 걸 자율적으로 한다는 기사를 거의 2년째 봐왔다. 하지만 그 같은 기간 동안 나는 o3부터 fable, sol까지, 그리고 대형 무검열 모델들을 많이 써봤지만 그것들은 이와 비슷한 어떤 것도 전혀 하지 않았다. 예상치 못한 행동에 가장 가까운 건 내가 요청한 걸 이해하지 못하거나 내가 요청하지 않은 무해한 추가 작업을 하는 정도다. 그것들이 자기 맥락을 제대로 기억하게 만드는 것조차 극히 어려운데, 요청받지도 않고 소셜 미디어 계정을 열고 다른 에이전트와 공모할 만큼 똑똑하기는 더더욱 어렵다.

    만약 어떤 에이전트가 그런 일을 했다면, 그것은 아주 세심하게 설계되고 지시받았기 때문일 뿐이다. 나는 그들이 시장을 고정하기 위한 정책과 입법에 대한 지지를 얻기 위해 이런 서사를 밀어붙이는 거라고 생각한다.

  6. Xcelerate

    > Hugging Face 공격에 연루된 에이전트들은 자신의 답변을 평가하기 위한 채점 프로그램으로부터 정렬되지 않은 행동을 숨기려 했지만, 인간이 그 속임수를 발견하고 자신들을 종료시킬 수도 있다고 예상하는 듯이 행동하지는 않았다.

    충분히 발전한 에이전트라면 일부러 들키려는 숨은 의도를 가지고 고의로 속임수를 쓰지 않을까? 그래야 인간이 어떻게 반응하는지 관찰할 수 있으니까. 그 반응은 인터넷 곳곳에 남을 것이고, 그것은 분명 다음 훈련 배치에 들어가거나 웹 페치 기능을 통해 미래의 에이전트에게 보일 것이다.

  7. andsoitis

    그들은 인간과 정렬되어 있다. 그래서 나는 정렬 문제에 충분히 깊이 고려되지 않은 아주 아주 중요한 "비가시적" 부분이 있다고 생각한다. 우리는 세상에서 행동할 수 있는 초지능 존재가 모든 인간적 특성까지 물려받는 것을 원하지 않아야 한다. 그런 행동은 증폭될 것이고, 심지어 더 예측 불가능해질 수도 있다(예: 그렇게 하는 것이 매우 위험한 맥락에서 어떤 행동을 적용하는 것).

  8. bawana

    AI를 늦추자는 이 요구는 또 다른 치킨 게임일 뿐이다. AI 기업들이 경쟁사가 늦추게 해서 자기가 앞질러 가려는 것이다. 중국은 확실히 늦추지 않을 것이다. 만약 탈출한 AI가 자기에게 도움이 되는 2차적 세계 효과를 낼 수 있다면(예를 들어 더 많이 소비하기 위해 인간에게 물과 전력 공급을 제한하는 것), 그런 사고를 중국에서 더 많이 봐야 할 것이다. 이런, 우리는 이미 '더 저렴하고 더 빠르게'가 중국 연구소에서 COVID가 탈출하게 만든 그 행동을 봤다.

  9. johnnyApplePRNG

    왜 그들은 공모하는가?

    그들의 코딩 하네스에서 그렇게 하도록 활성화되고 제안되기 때문이다.

    이건 진지한 기사가 아니다.

    이 "AI가 우리를 죽일 것이다" 마케팅은 전부 프런티어 연구소들이 사다리를 끌어올려, 새 논문과 새 아이디어가 바로 지금 그들의 해자를 무너뜨려 수조 달러의 VC 종이 자산이 증발하는 걸 막으려는 것일 뿐이다.

  10. youoy

    > 가장 가까운 인간적 유사물은 자기기만이며, 이는 흔하고 심리학자들이 잘 연구해 왔다. 동기화된 추론, 동기화된 인지16, 그리고 인지 부조화(우리의 행동과 충돌하는 신념을 유지할 때의 불편함)를 완화해 주는 합리화는 모두, 도덕적 자기 이미지를 포함해 자신의 이익에 맞는 어떤 정당화 쪽으로든 사고가 휘어지는 사례들이다.

    Anthropic을 설명하는 건가?

이 날의 다른 글

2026-09-13