LLM Attention Visualizer - Interactive attention mechanism visualization
Show HN: LLM Attention Visualization
LLM Attention Visualizer는 대규모 언어 모델(LLM)의 주의 메커니즘을 시각화하는 인터랙티브 도구입니다. 생성된 토큰을 탭하거나 호버링하면, 해당 토큰 생성에 영향을 준 이전 토큰들이 강조 표시됩니다. 이 도구는 주의 가중치와 값 벡터의 크기를 결합하여 모든 어텐션 헤드와 레이어를 집계한 단일 수치를 기반으로 투명도를 조절합니다. 브라우저에서 Transformers.js를 사용하여 텍스트를 생성하며, 사전 생성된 프롬프트를 즉시 로드할 수 있습니다. 또한, 내부 값을 추출하기 위해 계측된 ONNX 모델을 사용하며, 전체 코드는 GitHub에서 확인할 수 있습니다.
이 메커니즘을 통해 LLM이 전체 시퀀스를 제한된 내부 상태에서 예측하는 것이 아니라, 모든 과거 토큰에 접근할 수 있기 때문에 복사할 때 어떤 토큰을 참조할지 결정할 수 있어 오류 확률이 매우 낮다는 것을 확인할 수 있습니다.
HN 토론
22- MCP123
정말 좋네요, 감사합니다. 금요일에 이 내용을 가르쳐야 해서 딱 좋은 타이밍이에요. 어텐션 메커니즘을 직관적으로 이해하기 쉽게 설명하는 게 어려운데, 가중치 방식이 직관에 별로 도움이 안 되거든요. 이렇게 시각화해 주니 이해에 큰 도움이 됩니다. 제가 링크할 테니 그 페이지를 옮기지 말아 주세요!
- fuddle
정말 좋네요. 어텐션 메커니즘에 대해 책도 여러 권 읽고 영상도 봤는데, 이제 이해한 입장에서 보면 어텐션이 어떻게 작동하는지 보여주는 가장 명확한 예시네요.
- wopak
멋지네요. 두 구절의 정보를 결합하는 건 이런 도구 없이는 보기 어렵죠.
나중 레이어의 어텐션이, 합에 기여하는 앞 레이어가 더 많다는 이유만으로 초기 레이어에 묻혀 버릴까 봐 걱정되시나요?