JEPA explicado paso a paso: construyendo I-JEPA desde cero
The Annotated JEPA

Esta publicación ofrece un recorrido detallado y anotado de las arquitecturas de incrustación conjunta y predicción (JEPA), con I-JEPA como ejemplo principal. Explica cómo predecir representaciones en lugar de píxeles permite un aprendizaje autosupervisado sin etiquetas ni colapso, y detalla el diseño asimétrico de codificadores y el predictor. Incluye una implementación completa en PyTorch y aborda extensiones a video (V-JEPA) y el enfoque de regularización de LeJEPA.
El predictor no puede alucinar estructura que falte en la codificación del contexto; esta es la función de fuerza que obliga al codificador de contexto a aprender características semánticas y estructurales.