阿里发布Qwen Image 3,主打复杂版式生成

阿里发布Qwen Image 3,主打复杂版式生成

摘要

阿里巴巴发布 Qwen Image 3.0,强调复杂版式与细小文字生成能力,但未公布权重、基准测试和 API 定价 。

阿里巴巴通义千问团队于 7 月 21 日发布 Qwen Image 3.0。这次更新的重点不在“更好看”,而是强调图像生成能否直接进入工作流程,用于设计、内容制作、电商和教育等场景。

可一次生成复杂排版

官方称,新模型最多可接收 4500 个 token 的文字指令,约为上一代的 4.5 倍。这意味着用户可以在一次提示中,描述更复杂的页面结构,再由模型直接输出完整图像。

阿里展示的案例包括报纸版式、分镜脚本和高密度信息图。按照官方说法,这类内容可以一次生成完成,而不是先拆成多张图,再在后期拼接。

细小文字和公式是重点

除了长指令处理能力,阿里还把“细节还原”作为这次升级的另一卖点。官方称,Qwen Image 3.0 可较准确地渲染 10 像素级别的小字,也能处理毛发、皮肤纹理等细节。

在文本与学术内容方面,模型还支持 LaTeX 公式排版,可用于生成带有公式、图表和说明文字的学术页面样稿。官方同时表示,模型支持 12 种语言原生渲染,并可模拟网页、游戏和直播界面等常见视觉形式。

已开放试用,但关键信息未披露

目前,Qwen Image 3.0 已在 chat.qwen.ai 开放试用。不过,这次发布没有同步提供开源模型权重,也没有公布基准测试表和技术报告,API 价格也尚未对外披露。

这与 Qwen Image 1.0 的发布方式有所不同。后者上线时曾同步提供 Apache 2.0 许可下的开放权重和技术报告。相比之下,Qwen Image 3.0 现阶段更多仍以官方展示样例作为能力说明。

从已披露信息看,阿里希望把这款模型定位为可直接用于生产的图像工具,而不只是偏重审美表现的生成模型。不过,在缺少统一测试结果和技术细节的情况下,外界暂时还难以量化比较其与其他主流模型的实际差距。