Entrena un LLM de terremotos de 113M de parámetros desde cero
I trained a 113M-parameter earthquake LLM from absolute scratch

nanoGPT-Seis es un repositorio educativo que recorre todo el ciclo de vida de un modelo de lenguaje pequeño especializado en sismología: desde el rastreo de datos hasta la inferencia, con explicaciones detalladas de cada etapa. El corpus combina artículos científicos y textos generales, y el modelo de 113M de parámetros se entrena en dos NVIDIA A30. Los resultados muestran que un contexto más largo y una mezcla de datos generales mejoran la fluidez y el rendimiento, ofreciendo una base sólida para futuros ajustes.
El contexto más largo ayudó: un A/B controlado (datos fijos) —reentrenar a 4096 frente a 1024— redujo la perplejidad ~11% (9.74 → 10.93 solo dominio) por solo ~26% más de cómputo por paso; los artículos tienen una estructura de largo alcance que una ventana de 1024 tokens no puede ver.