Apple Silicon向けMiniMax H3推論エンジン「h3.c」が登場
Antirez/h3.c: MiniMax H3 inference engine for Mac computers
Antirez氏が開発した「h3.c」は、Apple Silicon(M3 MaxやM5 Max)上でMiniMax-H3モデルをネイティブ実行する推論エンジンです。Metalベースの実装で、プロンプトから動画・音声・画像の生成をエンドツーエンドでサポート。高速化のための設定(ステップ数、レイヤー数、トークン削減など)を細かく調整でき、M5 Maxでは4ステップの推論が約3.5秒で完了。品質と速度のバランスを検証したプリセットも用意されています。
4パス(ステップ)のノイズ除去はM5 Maxで約3.5秒、参照用の29パスと比較してフルビデオSSIMは0.556でした。
HNでの議論
98- Meleagris
ComfyUIを通じて、M5 Pro 64GB MacBook ProでMiniMax H3を使っています。非常にうまく動作します。デフォルトのComfyUIワークフローを、GGUF量子化モデルを使うように変更する必要がありました(city96のComfyUI-GGUFカスタムノード、標準のローダーの代わりにUnetLoaderGGUFを使用)[0]。Q5_K_Mとラベル付けされたモデルを使っています。Q8_0も利用可能で、34GBあり、解像度を控えめにすれば64GBのユニファイドメモリに余裕で収まります。主な問題は速度で、480x864の約9秒のクリップを20ステップで生成するのに1時間ちょっとかかります。なので、速度向上だけでも試す価値はありそうです。r/StableDiffusionサブレディットには、参考になる優れた情報やワークフローがたくさんあります。[0] https://huggingface.co/Abiray/MiniMax-H3-GGUF/tree/main/unet
- antirez
AMAでMinimaxは、H3がスパースアテンションをサポートできると言っていました。それは大きな高速化になるでしょう!それに関するニュースはあるのでしょうか。H3はとてもクールです。編集:Redditの投稿での彼らの発言に基づいて、--sparse-attentionオプションモードをテストしています。
- diddid
ここでDGX Sparkは、LLM作業で失った地歩をいくらか取り戻します。拡散モデルとCUDAは、ピーナッツバターとジャムのように相性が良いのです。
- linzhangrun
128GBのM4 Max Mac Studioで、ComfyUIでMiniMax H3を使って15秒の480p動画を生成するのに1時間半かかります。今すぐCodexにデプロイを任せて、速度がかなり向上することを期待しています。とにかくありがとうございます。
- TechSquidTV
これにはまだ128GBのメモリが必要ですよね?私の貧弱な96GBでは、まるで平民のように、楽しみを逃しています。