Модель mini-AGI учится непрерывно на одном GPU с 8 ГБ VRAM

Mini-AGI – dynamic continual learning model trained from scratch on 8GB VRAM

Модель mini-AGI учится непрерывно на одном GPU с 8 ГБ VRAM

mini-AGI — это byte-level языковая модель, которая собирает собственную архитектуру, обучается с нуля на одном потребительском GPU с 8 ГБ VRAM и продолжает учиться на всём, что читает. Веса хранятся на диске и подгружаются по мере необходимости, поэтому число параметров ограничено свободным местом, а не видеопамятью. Модель растёт, добавляя экспертов, и удаляет неиспользуемые. Пока это игрушечный эксперимент, но он показывает, что непрерывное обучение без катастрофического забывания возможно на скромном железе.

The trunk learning rate is the mechanism. The trunk - embeddings, attention, routers, the halting head - is the part every character passes through, and it carries 97.6% of the squared gradient norm. Running it at 0.1x the experts' rate takes forgetting from +2.2300 to +0.0067 nats, which is 99.84% of progress retained against chance.

Ещё за этот день

2026-09-21