113M 파라미터 지진 LLM을 처음부터 훈련시키다

I trained a 113M-parameter earthquake LLM from absolute scratch

113M 파라미터 지진 LLM을 처음부터 훈련시키다

이 저장소는 빈 폴더에서 시작해 지진 과학에 특화된 113M 파라미터 GPT 모델을 사전 훈련하는 전체 과정을 단계별로 설명합니다. Crossref+Unpaywall, arXiv, EarthArXiv, Substack 등 6개의 무료 데이터 소스에서 논문과 일반 텍스트를 크롤링하고, 정제·중복 제거 후 16k BPE 토크나이저를 훈련하고, GQA+RoPE 구조의 디코더 모델을 2개의 NVIDIA A30 GPU에서 DDP로 훈련해 스트리밍 추론까지 진행합니다. 4096 토큰 컨텍스트가 성능을 크게 향상시키며, 일반 텍스트 혼합이 자연스러운 문장 생성에 필수적임을 실험으로 보여줍니다.

컨텍스트 길이 4096에서 2048~4096번째 토큰의 손실은 0~64번째보다 25% 낮았습니다. 즉 모델이 수천 개의 앞선 토큰을 실제로 조건으로 사용한다는 뜻입니다.

이 날의 다른 글

2026-07-12