113M-Parameter-Erdbeben-LLM von Grund auf trainiert
I trained a 113M-parameter earthquake LLM from absolute scratch

Ein Entwickler trainierte ein 113M-Parameter-Sprachmodell für Erdbebenwissenschaft von Grund auf – von der Datensammlung bis zur Inferenz. Der gesamte Prozess ist in einem Lehr-Repository dokumentiert, das jede Phase erklärt: Crawling aus sechs freien Quellen, Bereinigung und Deduplizierung, Training eines BPE-Tokenizers, Modellarchitektur mit GQA und RoPE, Training auf zwei NVIDIA A30 GPUs und Streaming-Inferenz. Überraschende Erkenntnisse: Ein längeres Kontextfenster (4096 statt 1024 Token) senkt die Perplexität um 11 %, und die Beimischung von allgemeinem Text (Wikipedia, FineWeb-Edu) verbessert die Sprachgewandtheit um 35 % bei leichtem Verlust an Fachschärfe.
Ein fokussiertes Korpus ermöglicht es einem ~100M-Parameter-Modell, auf einem einzelnen Knoten wirklich fließend zu werden, sodass man den gesamten Kreislauf an einem Tag schließen kann, nicht in einem Monat.