阿里巴巴的Qwen团队于周二推出了Qwen Image 3.0,其投稿与输出的外观有多漂亮无关。这是关于输出是否可以真正在工作中使用的问题。
大多数人工智能图像工具——Reve、Nano Banana、Seedream——都是为了在特定领域表现出色而设计的:创造力、真实感、编辑能力等等。 Qwen Image 3.0 正在走向不同的方向。 “Qwen-Image-3.0不只是追求‘好看’,而是追求‘有用’,让图像生成成为真正可部署的生产力工具。”Qwen团队在官方公告中写道。

核心内容是中国巨头阿里巴巴所说的丰富内容。该模型最多可接受 4,500 个代币,是上一代处理能力的 4.5 倍。令牌是人工智能读取的文本单位;将令牌大致想象为一个单词或单词的一部分,因此其中 4,500 个是几页详细说明
这足以在一个提示中描述九个独立的信息图表面板,并将它们作为一个完整的图像返回。
阿里巴巴在其博客中写道:“上面的整个图像是由 Qwen-Image-3.0 单次生成的,而不是由多个图像拼接在一起。”演示中的每个面板都包含自己的图表、公式、标题和精美的文本——一次性渲染,而不是在后期组装。
这是唯一能够实现这一目标且没有重大错误的模型。
第二部分是该公司所说的真实细节。据阿里巴巴介绍,该模型“支持小至 10 像素的文本精确渲染,以逼真的微观层面描绘,生动地再现毛孔、发丝等细节。”十个像素是细则——您会在药品免责声明中看到的那种。该模型还可以在完整的学术论文模型中准确地处理 LaTeX(研究人员用来编写复杂数学方程的符号系统)。
在我们通常的测试中,我们给模型一些句子并评估它们如何处理它们。根据阿里巴巴官方博客,Qwen Image 3.0 能够生成下面的图像。
我们使用该模型最快的配置尝试了此功能。 Qwen Image 3.0 能够复制 Decrypt 的一篇完整文章。执行确实令人印象深刻,但结果并非完美无缺。
Qwen Image 3.0的第三个支柱是深度知识。 Qwen 团队表示,该模型“支持 12 种语言的原生渲染,模拟网页、游戏、直播等主流界面,借鉴丰富的世界知识”。它还连接到互联网以获取实时数据,这意味着提示特定城市和日期的天气预报视觉效果会返回准确的图形,而不是猜测。
例如,阿里巴巴分享了一张叶子上昆虫的照片。该模型能够根据对图像的理解生成相关文本。
阿里巴巴正在向需要批量生产的视觉资产的设计工作室、内容团队、电子商务运营和教育工作者进行推介。
不过,值得注意的是,在阿里巴巴自己的 Qwen-Image-Bench 评估(对 18 个型号的图像质量、美观度和现实世界保真度进行评分的基准)中,之前的旗舰产品 Qwen Image 2.0 Pro 排名第五。 OpenAI 的 GPT Image 2 排名第一。新模型可能表现更好,但发布时没有提供任何可衡量的方法来确认它,因为它没有基准表、可下载的权重或技术报告。
Qwen Image 1.0 在 Apache 2.0 许可证和当天的技术报告下以开放权重发布。这个没有。作为阿里巴巴最近推动人工智能的一部分,这里的证据完全是该公司选择发布的精选示例图像。 API 试用已在 chat.qwen.ai 上开放。定价尚未公布。
每日简报时事通讯