신경망 내부에 숨겨진 기호 구조: LLM의 비밀을 밝히다
The Emergent Symbolic Structure of Artificial Neural Networks
AI 시스템은 논리나 언어 같은 기호적 구조를 다루는 데 탁월하지만, 신경망은 정보를 연속적인 벡터로 표현한다. 벡터가 기호 구조를 담기엔 부족해 보이는데 어떻게 이런 성능을 낼까? 이 논문은 신경망의 내부 표현이 사실상 기호 구조를 암묵적으로 구현한다는 가설을 제시한다. 연구진은 다양한 신경망의 벡터 표현이 기호 구조로 근사될 수 있음을 보였고, 특히 LLM의 산술, 논리, 코드, 언어 영역에서 이러한 근사가 가능함을 확인했다. 또한 이 기호적 근사를 통해 LLM의 내부 표현에 정밀한 개입을 가해 행동을 의도적으로 수정하는 데 성공했다. 이는 기호적 지능 개념과 현대 AI의 벡터 기반 방식을 연결할 잠재적 방법을 제시한다.
벡터는 언어, 논리 및 기타 인지 영역의 구조를 포착하기에 부적합해 보이지만, 신경망은 이러한 영역에서 인상적인 성능을 달성합니다.
HN 토론
88- sigpwned
제가 얻은 큰 질문들은 다음과 같습니다:
(1) 그들은 무엇보다도 LLM의 전단사적이고 닫힌 형태의 기호적 표현/근사를 생성한다고 주장합니다. 이러한 닫힌 형태의 표현을 평가하는 것이 계산적으로 더 효율적인가요? 그 의미는 잠재적으로 엄청납니다. 본질적으로 해석적 증류가 될 것입니다. 데이터 센터가 아닌 칩 하나에 담긴 우화는 여러 면에서 중요하고 파괴적일 것입니다.
(2) 비지도 및 심지어 지도 학습 기반의 기호적 문제 해결 접근법은 무엇보다도 조합적 폭발로 인해 붕괴됩니다. 이는 잠재적으로 LLM 훈련과 추론을 다른 접근법으로는 도달할 수 없었던 새로운 종류의 복잡한 문제를 해결하기 위한 새로운 기호적 접근법을 탐색하는 검색 알고리즘으로 취급할 수 있게 해줄 수 있습니다. 그것이 작동한다면, 그것도 피드백 루프일 것이라고 생각합니다. 한 표현에서 얻은 학습이 다른 표현의 발전을 추진합니다. 이는 또한 대규모 훈련 실행의 경제적 가치를 증가시킬 것입니다. 모델 자체가 이제 가치 있기 때문입니다. 추론만이 아니라.
(3) 위의 내용에 따라, 이것이 LLM 설계를 더 큰 능력으로 이끌 수 있습니까?
이것과 Anthropic의 J-space 관찰 사이의 관계도 흥미롭습니다. 그러나 이것은 훨씬 더 깊고 직접적으로 실행 가능합니다.
편집: 제 질문을 Sonnet에 돌려보냈습니다. — 네, 아이러니를 알고 있습니다 — 그리고 그것은 질문 (1)과 (2)에 대해 그다지 낙관적이지 않았지만 (3)은 합리적이라고 생각했습니다. 어쨌든 이것은 상당한 논문입니다. 곰곰이 생각해보면, 저는 정말로 이 논문이 ...
- jsrozner
이러한 지도* 해석 가능성 접근법 중 일부의 큰 문제는 그들이 허위 구조를 찾을 수 있다는 것입니다. (모델이 원하는 대로 작동하게 만드는 방법은 많습니다; 이는 대략 Hewitt와 Liang 2019가 보여준 것입니다.) 이 논문은 20페이지에서 이전 방법인 DAS(분산 정렬 검색)와 대조를 이룹니다. 이러한 방법들과 관련 방법들은 인과 추상화 이론에 기반을 두고 있는데, 이는 이론적으로는 훌륭하지만 실제로는 더 어렵습니다. 예를 들어, DAS는 최근 많은 비판에 직면했습니다 (Makelov 2024, Meloux 2025, Sutter 2025, Grant 2026, Kumon 2026). 제가 가장 좋아하는 것은 상당히 접근하기 쉬운 Meloux 등의 논문입니다; Sutter 2025도 정말 좋지만, 모든 입력의 무손실 인코딩을 허용하는 일종의 실수 논증에 의존합니다.
EMNLP에 제출된 제 forthcoming 논문은 대신 적대적으로 교란할 때 모델 학습/행동에 미치는 영향에 대한 매우 단순한 개념에 표현의 개념을 기반으로 하는 대안을 제공합니다. 예를 들어, 모델에게 "나는 꽥꽥 우는 오리를 보았다"라는 맥락에서 'duck'을 'glam'으로 대체해야 한다고 말한다면, "회의에서 빠져나가야 한다"와 "공원에서 오리가 새끼들을 보호했다"에서 'duck'을 'glam'으로 대체하려는 욕구가 얼마나 될까요? 이 방법은 꽤 잘 작동하는 것으로 밝혀졌으며, 단일 예제만 사용하기 때문에 지도 학습의 필요성을 피합니다.
링크된 논문은 그들의 방법인 DISCOVER가 DAS와 같은 방식으로 지도 학습되지 않는다고 주장합니다. 왜냐하면 인과 효과를 직접 최적화하지 않기 때문입니다. 저는 이 논문을 대충 훑어봤을 뿐이지만, 저는 ...
- gps372
기사를 읽으면서, 왜 이것이 바이트 코드에서 Java 프로그램을 복구하는 능력보다 더 흥미로운지 궁금했습니다. 그래서 Copilot에게 같은 질문을 했습니다. Copilot은 저에게 "솔직히 이것이 엔지니어와 연구자의 차이가 나타나는 곳입니다!"라고 말했습니다.
- jkingsman
여기의 수학과 핵심 실험은 제 능력을 넘어서지만, 제가 이해한 바에 따르면 LLM에 존재하는 더 깊은 표현 패턴이 있을 수 있으며, 이는 문법의 핵심 개념적 관계를 수학적으로 이해할 수 있는 방식으로 증류한 것이며, 겉보기에는 층에 번진 노이즈가 어떻게든 해석 불가능하게(의미 있는 방식으로) 올바른 문법/추론으로 해결되는 것이 아닙니다.
그것은 꽤 멋집니다. 제가 대략적으로 맞게 이해했으면 좋겠습니다.
- 4b11b4
합리적으로 들립니다... 모델이 때때로 본질적으로 기호적인 무언가의 손실 있는 벡터 표현을 학습한다는 것... 물론, NN이 함수를 근사할 수 있나요?
그들은 이것이 ... 그들이 찾은 몇 가지 예에서 성립한다고 말합니까?
저는 이 분야에 대해 충분히 알지 못합니다.