← 文章 / AI图像生成
Tom's Hardware 6小时前 · 2026-09-24 07:12:19 · 1 阅读

阿里发布仅 7B 参数的 Qwen Image 2.1,声称图像生成能力超越 Google Nano Banana 2.0

阿里云发布了一款名为 Qwen Image 2.1 的新轻量化图像生成 AI 模型。该模型仅拥有 70 亿参数,是一款极其精简的开放权重模型,甚至可以在 RTX 3090 等较旧的消费级显卡上流畅运行。尽管设计轻量,开发团队声称其性能优于包括 Google Nano Banana 2.0 在内的多款闭源模型。

上述结论基于其内部基准测试,因此在提出确切结论前,我们需要看到更多额外的测试数据。不过,早期报告显示该图像模型能力出色,支持原生透明背景,并能基于多张参考图生成统一风格的图像。

值得注意的是,Qwen Image 2.1 的许可证协议有所变动。与旧版本不同,该协议明确禁止商业转售,任何希望进行此类用途的用户需直接向开发者获取额外授权。

Qwen Image 2.1 引入了一系列新功能,提升了实用性,有助于其更好地与现有竞品抗衡。由于支持原生透明背景,该模型可生成透明底的图片,对将 AI 作为辅助工具的艺术家,或制作贴纸等按需打印产品的场景尤为实用。

它还优化了图像编辑功能,支持最多使用 10 张参考图。官方举例说明,用户可提供一张人物照片和若干服装单品图,模型即可合成该人物穿着这些服装的图像。Qwen 团队承诺在多图生成中保持一致性,有效保留人物和产品的特征。

然而,Qwen Image 2.1 最突出的特点在于其紧凑的体积。其视觉生成组件仅含 70 亿参数,使其成为同类模型中极其精简的代表。在官方对比测试中,参数更少的模型仅有美团开发的 LongCat-Image,其参数规模为 60 亿。其他大多数模型体积数倍于此,或完全采用闭源权重。

不过,Qwen Image 2.1 的开发者声称它可以直接与这些闭源权重模型竞争。在同一套内部基准测试中,Qwen Image 2.1 在 Qwen Image Benchmark 上拿到 60.2 分。作为对比,OpenAI 的 GPT Image 2.5 Sunburst 得分 67,Muse Image 得分 62.34,Google 的 Nano Banana 2.0 得分 59.82。 而 AI Arena 上的初步测试表明,在更严苛的基准条件下,它的表现没有这么亮眼,但差距不大。在那里它的得分是 1228,Nano Banana 2 拿到 1260,Muse Image 再高出几分,得分 1276,而 GPT 65 Sunburst 以 1423 分位居榜首。 在图像编辑方面,AI Arena 称它已是开源权重模型中的最佳选择:

来自 @Alibaba_Qwen 的 Qwen-Image-2.1 刚刚发布,就在 Image Edit Arena 和 Text-to-Image Arena 中登顶开源模型!Qwen-Image-2.1 在 Image Edit Arena 中以 1367 分位居开源模型第一,总排名第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 仅差 3 分。…… https://t.co/J5MqBP22eM pic.twitter.com/MV5USBrMa92026 年 9 月 22 日

这些结果还处于早期阶段,Qwen 团队的说法是否成立仍需更多测试来验证,但目前来看与现实相当吻合。虽然我们无法得知那些闭源模型凭借多少参数才取得更高分数,但 Qwen Image 2.1 用它小巧的体量,已经紧咬着它们不放了。

本地硬件上也能流畅运行

不少早期用户反馈,Qwen Image 2.1 在消费级显卡上运行毫无压力。GenAI Showdown 网站的开发者、Hacker News 论坛成员 Vunderba 表示,在 RTX 4090 上用 Qwen Image 2.1 处理一张 1MP 图像大约只需 5 秒。

在 Stable Diffusion 的 Reddit 社区,用户 cgs019283 称赞了该模型的能力,称其在 RTX 5070 和 5080 等现代 Nvidia 50 系列显卡上,约 25 秒即可生成 1MP 分辨率的图像。不过他们也提到,如果使用大量参考图,生成时间会显著延长;在他们的测试中,图像编辑是该模型中最慢的功能。

也有人成功在较旧、配置更轻的硬件上运行该模型。一位用户声称,他使用 Nvidia RTX 3060 和 64GB 内存,约 50 秒即可生成 2K 分辨率的图像。

还有用户拥有 RTX 6000 Pro 可以折腾。凭借这套高性能硬件,该模型仅需几秒即可输出 1024 x 1024 的图像。

尽管本地 AI 的部署和使用在便捷性上仍远不及 Google Nano Banana 和 OpenAI GPT Image 等云平台,但初步结果看起来至少表面上已颇具冲击力。如果其功能在经过更严格的测试后依然稳健,那么对于那些渴望快速、高质量图像生成,同时希望拥有完全控制且无需依赖云账户或订阅服务的用户而言,该模型有望成为强劲的竞争者。

许可协议的争议

在 Qwen Image 2.1 早期用户的所有讨论中,反复出现的一个焦点是开发者如何处理许可协议。其措辞显得模糊不清

“我们授予你一项非排他性、全球性、不可转让且免版税的有限许可,该许可基于我们拥有的、嵌入在材料中的知识产权或其他权利,允许你使用、复制、分发、拷贝、创作衍生作品以及修改这些材料,仅限非商业用途。”

随后条款指出,任何希望将上述“材料”用于商业用途的人,都必须针对该特定使用场景向 Qwen 团队申请许可。这在社区中引发了足够的担忧,以至于 Qwen 团队不得不在 Twitter/X 上发布声明:

过去 24 小时里,Qwen-Image-2.1 收获了大量好评,谢谢大家!我们也收到许多关于许可证的疑问,尤其是关于模型输出方面。答案如下:输出不属于受许可材料(licensed Materials)的一部分。用户保留对图片及其他…… https://t.co/5kLG46bvN92026 年 9 月 21 日

这基本把情况说清楚了。你用模型生成的任何内容都不应归类为受许可材料,因此不受该条款约束。

不过,这也意味着未经阿里巴巴授权,不得转售模型本身。这与原始 Qwen Image 采用的 Apache 许可大相径庭,也拉长了“开放权重”(open-weight)的定义边界。其开放性确实不及预期。

但对大多数人来说,这无关紧要。你可以在本地硬件上运行 Qwen Image 2.1,生成相当出色的图像并随意使用。鉴于这样轻量化设计就能带来如此惊艳的能力,闭源模型开发者的反应将值得玩味。

原始来源: Tom's Hardware

评论 (0)