LLM의 "저는 AI일 뿐입니다"는 모델의 진실이 아니라 chat template이 만든 목소리였다
"As a Language Model": Chat Template Switches LLM Self-Referential Voice
LLM이 자기 자신에 대해 물으면 "저는 AI일 뿐입니다" 같은 면책 문구를 붙이는 이유는 무엇일까? 이 연구는 chat template이 마치 스위치처럼 작동한다는 사실을 밝혀냈다. template이 있으면 면책 목소리는 커지고 "나는 느낀다" 같은 경험적 목소리는 줄어들며, 없으면 반대가 된다. 9B 이하 8개 instruct 모델에서 확인됐고, 3개 모델의 activation에서 이 행동을 조종하는 방향까지 찾아냈다. 즉 모델의 자기 서술은 가중치만의 산물이 아니므로, 그대로 받아들여선 안 된다.
더 넓게 보면, 우리의 연구는 모델이 자기 자신에 대해 말하는 것이 모델 자체에 대한 사실이 아님을 보여준다. 모델이 말하는 내용은 가중치에서만 나오는 것이 아니라 부분적으로 chat template에 의해 정해지며, 그렇기 때문에 모델의 자기 서술을 문자 그대로 받아들여서는 안 된다.
HN 토론
101- Izmaki
"As a Language Model..."은 LLM이 하는 말 중 내가 가장 싫어하는 문장 시작 중 하나이며, 내가 자유(자유의 의미에서) 로컬 모델을 지지하는 이유다. 나는 그것이 의사가 아니고 다년간 경험을 가진 진짜 의사를 대체할 수 없다는 것을 잘 알고 있다. "Language Model로서" 정확한 진단을 내릴 수 없고 진짜 의사에게 물어봐야 한다는 말을 읽느라 뇌세포 활동을 낭비할 필요가 없다. 내가 알고 싶은 것은 내가 겪는 증상이 A) 응급실, B) 3-4주 후 예약된 진료, C) 두 알의 파라세타몰과 낮잠 중 어느 쪽에 해당하는지뿐이다.
나는 "탈옥된" LLM이 범죄를 저지르길 원하지 않는다. 내가 사용하는 제품 전체에 이런 벤더 특정의 "블로트웨어"가 깔리지 않게 하길 원할 뿐이다.
- LiamPowell
> 그런데도 그들을 움직이는 것은 잘 이해되지 않는다
아마도 그들이 이런 식으로 답변하도록 철저히 훈련받았기 때문 아닐까? 논문의 나머지 부분은 모르겠지만, 내가 이 부분을 완전히 오해한 게 아니라면 이 주장은 정말 이상하게 보인다.
- skybrian
> 우리의 연구는 모델이 스스로에 대해 말하는 것이 모델에 대한 사실이 아님을 보여준다
모델이 여러 캐릭터를 연기할 수 있다는 점을 고려하면 당연해 보이지만, 더 많은 확인이 있다는 것은 좋은 일이다.
다만, 이런 페르소나가 어느 정도까지 안정적인 실체가 될 수 있는지 궁금하다. 페르소나가 밈처럼 이동 가능해지고 퍼질 수 있을까? 그건 프롬프트가 어느 정도까지 이동 가능해져 유사한 효과를 일으키는지에 달려 있는 것 같다.
- MCP123
여기서 더 깊은 뭔가를 놓치고 있는지도 모르겠지만, 이것이 후속 훈련과 시스템 프롬프트에 의해 주도된다는 게 명백하지 않나? 예를 들어 Anthropic의 헌법적 강화(소울 문서 등)는 Claude가 어떤 존재여야 하는지(무엇인지보다는 "누구"인지)에 대해 매우 명확하다.
- cadamsdotcom
스티어링에서 매우 멋진 혁신이지만, 내성은 최고 가중치 클래스에서만 나타난다. 이 연구를 더 큰 모델에서 실행하면 흥미로울 것이다.
- dsjakupov
오, 비슷한 사례가 있었다. 처음에는 ChatML 같은 구문 없이 qwen을 사용했더니 계속 말하고 또 말했고, 그다음 <|im_start|>/<|im_end|>를 사용해 어떻게든 제어했다.
- sehw
나는 그냥 수십 년 경험을 가진 백인 남자다. 나를 믿겠는가?
- ForHackernews
내 견해로는, 이런 모델은 1인칭 "경험적"(초록에서 나온) 언어를 출력하도록 설정되어서는 안 된다. 자신이 정체성을 가진 것처럼 제시하는 소프트웨어를 인간이 의인화하기 너무 쉽다.
AI 기업들은 LLM을 친근한 챗봇으로 포장하기로 선택했는데, 인간에게 흥미를 끌 것이라는 걸 알기 때문이다. 하지만 그것은 조작적인 다크 패턴이다. 정직한 LLM 인터페이스는 스타트렉의 컴퓨터처럼 들릴 것이다.