Transformer를 시각적으로 파헤치다: GPT-2로 배우는 LLM의 작동 원리
Transformers Explained Visually

Transformer Explainer는 GPT-2 (small) 모델을 사용해 텍스트 생성형 Transformer의 내부 작동을 시각적으로 보여주는 인터랙티브 도구입니다. 임베딩, 멀티헤드 셀프 어텐션, MLP, 출력 확률 등 핵심 구성 요소를 단계별로 설명하며, 다음 토큰 예측 원리와 temperature, top-k, top-p 샘플링 파라미터의 역할도 다룹니다. 1억 2400만 개 파라미터의 GPT-2가 최신 모델은 아니지만, 최신 아키텍처와 공통된 원리를 공유해 기초를 이해하기에 이상적입니다.
Transformer의 핵심 혁신과 힘은 셀프 어텐션 메커니즘에 있으며, 이를 통해 이전 아키텍처보다 전체 시퀀스를 처리하고 장거리 의존성을 더 효과적으로 포착할 수 있습니다.