Mini-AGI: Kontinuierliches Lernen auf 8 GB VRAM ohne katastrophales Vergessen

Mini-AGI – dynamic continual learning model trained from scratch on 8GB VRAM

Mini-AGI: Kontinuierliches Lernen auf 8 GB VRAM ohne katastrophales Vergessen

Ein byte-level Sprachmodell, das auf einer einzelnen 8-GB-GPU von Grund auf trainiert wird und kontinuierlich aus allem lernt, was es liest. Es speichert Gewichte als Dateien auf der Festplatte und lädt sie bei Bedarf in den VRAM, sodass die Parameteranzahl nur durch den freien Speicherplatz begrenzt ist. Die Architektur wächst dynamisch, wenn Kapazität fehlt, und schrumpft, wenn Experten nicht mehr benötigt werden. Der Schlüssel gegen das Vergessen: Die Lernrate des Trunks wird auf 0,1x der Expertenrate gesenkt, wodurch 99,84 % des Fortschritts erhalten bleiben.

Die Lernrate des Trunks ist der Mechanismus. Der Trunk – Embeddings, Attention, Router, der Halting-Head – ist der Teil, den jedes Zeichen durchläuft, und er trägt 97,6 % der quadrierten Gradientennorm. Läuft er mit 0,1x der Rate der Experten, sinkt das Vergessen von +2,2300 auf +0,0067 Nats, was 99,84 % des Fortschritts gegenüber dem Zufall entspricht.

Mehr von diesem Tag

2026-09-21