Qwen-Image-2.1、7Bパラメータで生成と編集を1モデルに統合
Qwen-Image-2.1: Compact, efficient, and unified image creation
Qwen-Image-2.1は、テキストからの画像生成と画像編集を単一モデルに統合したオープンソースの画像モデルだ。視覚生成コンポーネントは32層のSingle-Stream DiTと7Bパラメータという軽量構成ながら、透明画像のネイティブ生成・編集、最大10枚の参照画像、マスクや円・塗り注釈による局所編集、人物や製品の一貫性保持に対応する。混合粒度アテンションとKVキャッシュ再利用で推論効率も高めている。
Qwen-Image-2.1は、テキストからの画像生成と画像編集を単一モデルに統合し、視覚生成コンポーネントはわずか7Bパラメータで、透明画像の生成と編集をネイティブにサポートする。