Muse Glimmer:30B Transformerに偽装されたメモリ階層
Muse Glimmer is a memory hierarchy disguised as a 30B Transformer

MetaのMuse Glimmerは、クラウド不要でデバイス上で自律エージェントを動かすとされる。その実現には、30B級モデルと長い作業履歴を24〜32GBのメモリに収める必要がある。同モデルは、ローカルな注意とグローバルな注意を4層ごとに切り替え、KVキャッシュを2ヘッドに削減。さらに4ビット量子化でパラメータを圧縮し、131Kトークンのコンテキストを実現している。実質的には、メモリ階層として機能するアーキテクチャだ。
Muse Glimmerは、メモリ階層を30B Transformerに偽装したものだ。
- glimshe
メタは好きじゃないけど、ここには賢いエンジニアリングがある。よくやった!
もしこれが中国の研究所からリリースされていたら、HNはアメリカがイノベーションで追い抜かれたと言っていただろう。でもメタだから、AIが書いた記事だといういつもと同じでうんざりするような不満が出るだけだ。