Tencent、Hy3を発表:単一の統一モデルでテキスト・画像・音声・動画を生成
TencentのHy3は、テキスト、画像、音声、動画を単一の統一モデルで生成するマルチモーダルAI。従来の専門モデルを組み合わせるアプローチとは異なり、Hy3はすべてのモダリティを共通の表現空間で処理することで、クロスモーダルな一貫性を実現し、生成プロセスを簡素化する。この設計により、異なるモダリティ間での整合性が向上し、より自然でシームレスなコンテンツ生成が可能になる。
Hy3は、単一の統一モデルでテキスト、画像、音声、動画を生成する初のシステムであり、従来の専門モデルを組み合わせるアプローチの限界を克服します。