JEPA를 처음부터 직접 구현해 보는 상세 해설
The Annotated JEPA

이 글은 JEPA(Joint Embedding Predictive Architectures)를 단계별로 설명하고, PyTorch로 I-JEPA를 처음부터 구현하는 방법을 다룹니다. Yann LeCun이 제안한 JEPA는 레이블 없이 표현을 학습하는 자기 지도 학습 방식으로, 픽셀 공간이 아닌 표현 공간에서 예측을 수행합니다. 이 글은 I-JEPA의 핵심 설계 선택(패치 토큰화, 마스킹 전략, 타깃 인코더의 EMA 업데이트)을 자세히 분석하고, V-JEPA와 LeJEPA로의 확장도 간략히 소개합니다. 코드 구현은 교육 목적으로 단순화되었으며, FlashAttention이나 혼합 정밀도 같은 대규모 학습 관련 엔지니어링 세부 사항은 생략되었습니다.
인코더가 문맥에서 추출해야 하는 특징은 정확히 타깃의 표현을 예측하는 데 도움이 되는 의미론적이고 구조적인 특징, 즉 객체 정체성, 공간 관계, 물리적 제약입니다.