Qwen-Image-3.0:从好看走向好用

Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge

Qwen-Image-3.0:从好看走向好用

我们正式发布了 Qwen-Image-3.0,这是 Qwen-Image 系列的第三代基础图像生成模型。如果说前代关键词是“精准”或“多样”,那么 Qwen-Image-3.0 的核心只有一个字——“实”。它支持高达 4.5k token 的输入,能一次性生成包含复杂数学公式、多语言文本和嵌套界面的 3x3 网格图;在细节上,连 10px 的小字、皮肤毛孔和发丝都能逼真还原;更具备深厚的世界知识,原生支持 12 种语言及主流 UI 界面渲染。Qwen-Image-3.0 不再仅仅追求“好看”,而是致力于成为真正可落地的生产力工具,让图像生成在新闻排版、分镜脚本和复杂 UI 设计等场景中发挥实际价值。

Qwen-Image-3.0 不仅仅是在追求“好看”,它追求的是“好用”,旨在让图像生成成为真正可部署的生产力工具。
  1. mynti

    对我来说,人们试图把这些模型推向在线购物领域,比如“看看这件裙子/衬衫/裤子穿在你身上是什么效果”,这感觉真的很奇怪。但这些模型永远会让衣服完美贴合你的身材,把你展示在最光鲜亮丽的状态下,等等。至于衣服实际穿起来合不合身,和用这些工具之前一样,依然难以捉摸。

  2. weird-eye-issue

    HTML 里的 meta 关键词很有意思。里面有 100 多个关于 NSFW 主题的引用,比如 hentai(色情动漫)、nudes(裸照)之类的。

  3. postalcoder

    他们肯定是用 GPT Image 1 的输出来训练的。那种泛黄的色调 unmistakable( unmistakable 意为“ unmistakable ”,此处指“ unmistakable ”)。

  4. hessammehr

    非常酷,但标题图里的阿拉伯文显然是彻底崩了,这很奇怪,因为实际使用模型时并不会出现这种情况。会不会是那张主图根本不是 Qwen Image 3.0 生成的?

  5. simonw

    > 要精确描述完整的 3×3 网格需要整整 3.7k 个 token

    真可惜他们没分享那个提示词(prompt)——那样会让这个演示更有说服力。

  6. embedding-shape

    完全没有提到他们什么时候(或者是否会)发布这个模型的权重,是我漏看了吗?

  7. Mashimo

    > 支持高达 4.5k token 的输入,轻松生成报纸、故事板和试卷等复杂布局。

    很厉害。

    顺便问一下,目前在 16GB 显存上本地运行的最佳模型是什么?是 Z-Image Turbo 吗?

  8. jcattle

    我一直想不通的是:这些模型是怎么训练的?

    是什么训练机制或模型架构提供了从人类文本到图像的“粘合剂”?

    难道不需要数百万张带有非常详尽标签的图片吗?

同日更多故事

2026-07-21