Mini-AGI: un modelo que aprende sin olvidar en una GPU de 8 GB

Mini-AGI – dynamic continual learning model trained from scratch on 8GB VRAM

Mini-AGI: un modelo que aprende sin olvidar en una GPU de 8 GB

Mini-AGI es un modelo de lenguaje a nivel de bytes que se entrena desde cero en una sola GPU de 8 GB y sigue aprendiendo de todo lo que lee. Almacena sus pesos en disco y los pagina a la VRAM según los necesita, por lo que su tamaño solo está limitado por el espacio libre. Crece y poda expertos dinámicamente, y evita el olvido catastrófico ajustando la tasa de aprendizaje del tronco. Es un experimento inicial, no un modelo de frontera.

El trunk learning rate es el mecanismo. El tronco —embeddings, atención, routers, la cabeza de detención— es la parte por la que pasa cada carácter, y carga el 97.6% de la norma del gradiente al cuadrado. Ejecutarlo a 0.1x la tasa de los expertos reduce el olvido de +2.2300 a +0.0067 nats, lo que supone un 99.84% de progreso retenido frente al azar.

Más de este día

2026-09-21