Apple trainiert KI nicht mit deinen privaten Daten
Apple wants to train AI on your private personal data
Apple stellt die dritte Generation seiner Foundation Models vor – fünf Modelle, von denen zwei direkt auf dem Gerät laufen und drei auf Private Cloud Compute. Das Flaggschiff AFM 3 Core Advanced nutzt eine sparse Architektur, die nur 1 bis 4 Milliarden Parameter gleichzeitig aktiviert, und speichert das Gesamtmodell im Flash-Speicher statt im DRAM. Apple betont, dass weder private Nutzerdaten noch Interaktionen zum Training verwendet werden.
Wir verwenden keine privaten personenbezogenen Daten oder Nutzerinteraktionen unserer Nutzer, wenn wir unsere Foundation Models trainieren.
- EAtmULFO
Schon wieder geändert?
"Wir verwenden weder die privaten persönlichen Daten noch die Interaktionen unserer Nutzer, wenn wir unsere Foundation Models trainieren. Wir respektieren auch das Recht von Web-Publishern, sich vom Foundation-Model-Training abzumelden."
- MattDamonSpace
Der Titel scheint irreführend, wenn nicht sogar schlicht falsch zu sein, nachdem ich den Artikel gelesen habe.
- nojs
Zur Architektur:
> Statt das gesamte Modell in den DRAM zu zwingen, wird das vollständige Modell im Flash-Speicher (NAND) abgelegt. Da die Bandbreite zwischen NAND und DRAM zu langsam ist, um Gewichte Token für Token auszutauschen, wie es Standard-MoE-Modelle erfordern, trifft AFM 3 Core Advanced Routing-Entscheidungen pro Prompt. Ein leichtgewichtiger, dichter Block wählt während der initialen Verarbeitung eine feste Menge von Experten aus und wählt sie während der Generierung periodisch neu aus. Um die Datenbewegung zu minimieren, setzt das Modell auf einen hohen Anteil immer aktiver "shared experts" neben eingabeabhängigen "routed experts", die nur bei Bedarf in den DRAM getauscht werden.
Dies ist ein interessanter Hybrid zwischen MoE und der Verwaltung völlig separater domänenspezifischer Modelle. Wähle die Experten einmal aus, bringe sie in den Speicher und führe die Inferenz für einen gewissen Zeitraum aus, bevor du neu bewertest. Das spart, alle Experten im Speicher zu halten, ist aber besser als nur ein ganzes Modell pro Anfrage auszuwählen, da du eine hohe Anzahl kleiner, undurchsichtiger Experten hast, die sich überlappen und auf interessante Weise kombinieren.
Es gibt wahrscheinlich einen massiven Qualitätsverlust dadurch, aber es ist interessant, weil es unendliche Skalierung der Modellgröße ermöglicht.