Tarski 공격: LLM 은 절대적인 진실을 포착할 수 없다

Truth is not a direction: a Tarski attack on LLM probes

Tarski 공격: LLM 은 절대적인 진실을 포착할 수 없다

LLM 은 진실을 나타내는 특정 방향을 가진다고 믿어졌으나, 이는 Tarski 의 역설로 인해 불가능합니다. 자기 참조 문장을 생성하면 진리 탐지기가 모순에 빠지게 되므로, 모델의 임베딩 공간에서 진실을 완벽하게 포착하는 보편적인 탐지기는 존재할 수 없습니다.

모델의 표현 공간에 대해 정의 가능한 탐지기는 그 탐지기와 그 출력을 설명할 만큼 풍부한 언어에 대해 정확히 진실을 포착할 수 없습니다.
  1. kstenerud

    초인적인 AI 가 진리 오라클 (truth-oracle) 로 기능할 수 있다는 제안 자체가 터무니없게 느껴질 수도 있습니다 (저에게도 그렇습니다). 하지만 이를 진지하게 받아들이야 할 두 가지 이유가 있습니다. 첫째, 이것이 대다수의 사람들이 실제로 이 기술들을 사용할 방식이기 때문입니다. 이미 표준 Google 검색 결과를 대체하고 있으며, 많은 토론이 AI 에게 진리에 대한 최종 권한을 위임하는 것으로 끝나는 것을 목격했습니다.

    이미 이러한 상황을 악용하는 조직들이 등장했습니다. 그들은 LLM 자체를 대상으로 한 'AI 선전'을 적극적으로 생산하고 있습니다. 이는 LLM 이 무엇을 진실로 인식하는지에 대한 이해를 조작하여 강력한 행위자들의 의제에 맞게 왜곡하려는 시도입니다. 그들은 심지어 이를 숨기지도 않습니다.

  2. baq

    제목은 약간 클릭베이트 (clickbait) 식이지만, 내용은 읽을 가치가 충분합니다. 처음에는 호를 들고 왔다가, 결국 거의 모든 내용에 동의하며 떠났습니다. '만약 탐침 (probe) 이 진리성, 지식의 확신, 그리고 결정 가능성이라는 3 차원을 반환할 수 있다면 어떨까?' 같은 질문이 생겼습니다.

    또한 사람들이 LLM 을 오라클처럼 대하지만 사실은 전혀 그렇지 않다는 지적은 정확히 맞습니다. 저도 이와 비슷한 생각을 해왔고, 이는 꽤나 무서운 일입니다.

  3. Legend2440

    이 글은 전제를 지나치게 확장했다고 생각합니다.

    누군가 LLM 의 '진리 벡터 (truth vector)'에서 기대하는 최선은, 해당 진술이 진실인지에 대한 모델의 믿음을 인코딩한다는 것입니다. 물론 완벽한 진리 오라클은 불가능합니다.

  4. aesthesia

    재미있지만, 글의 마지막에 암시된 대로 LLM '진리' 탐침의 목적은 모델 내부의 진리성 판단을 측정하는 것입니다. 이 판단이 100% 정확도로 측정되더라도, 그 판단 자체가 틀릴 수 있거나 논리적으로 일관되지 않을 수 있는 이유는 전혀 없습니다.

  5. tomaskafka

    > 둘째, 일부 사람들은 모든 모델이 수렴하는 일종의 플라톤적 표현 공간 (platonic representation space) 이 존재하며, 그것이 세계의 '진실' 상태를 나타낸다고 진심으로 믿습니다. 진리가 세계의 객관적인 일부라면, 모델이 발전함에 따라 그러한 보편적인 진리 방향이 나타날 것으로 예상할 수 있습니다. 이

    이건 정말 컴퓨터 속에서 신을 찾으려는 모든 SF 이야기처럼 들립니다.

    인터넷에서 수집된 텍스트의 뒤죽박죽 거울 속에 어떻게 있을 수 있겠습니까?

이 날의 다른 글

2026-07-29