Entrena un LLM de 3.8B con 0.384 en CORE por solo $998
Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes
Hugo Vergnes entrenó un modelo de 3.8B parámetros desde cero en 43 horas usando 8 GPUs B200, con un costo total de $998. Inspirado por nanochat de Andrej Karpathy, el modelo alcanzó 0.384 en CORE, superando a GPT-2 y a configuraciones similares. El proyecto destaca por su infraestructura configurable, el uso de Muon y FP8, y demuestra que con mil dólares se puede lograr un modelo significativo fuera de un laboratorio.
Mi modelo es más grande que nanochat d32 y tomó un tiempo de reloj similar. Las B200 fueron mejor valor por unidad de trabajo que las H100. Pero por aproximadamente el mismo dinero que la configuración de $1,000 de nanochat, este queda significativamente por delante.