阿里发布Qwen-Image-3.0图像生成模型:4.5倍超长输入,复杂信息图与UI界面一次生成

2026-07-22 16:36:52   |   探索者   |   4729

7月22日,据报道,阿里正式发布最新图像生成基础模型Qwen-Image-3.0。该模型支持最大4.5k token超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂UI界面,同时支持12国语言和20多款字体原生渲染,大幅降低了多语言产品海报、影视分镜等商业素材的生产成本。

Qwen-Image-3.0是千问图像生成与编辑系列的第三代基础模型,着重提升了对复杂信息的承载能力,文本输入长度较前代实现4.5倍跃升。在影视短剧分镜、复杂信息图、产品说明页等需要超长提示词输入的场景中,用户不再需要将需求压缩成一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节,从而让模型更精准地生成图文内容,减少反复生成和人工调试成本。

凭借对语义并置和空间控制能力的优化,新模型可一次性生成涵盖9种不同领域的九宫格知识图解,字字清晰,幅幅准确。Qwen-Image-3.0能够理解复杂指令和画面的逻辑嵌套关系,可根据一条指令在同一幅图中生成网页、软件界面、聊天窗口、海报等多类视觉内容的组合式表达。

例如,当用户输入“在VSCode编程界面中,通过千问App生成一张发布在聊天界面里的手冲咖啡海报”时,模型能够准确理解其中的多层UI嵌套关系,并依次生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报,在保持各层界面结构、风格准确的同时,甚至能将手机截图里的时间数字——低至10像素的小字——清晰可辨。

在具体应用场景方面,Qwen-Image-3.0延续了前代在直播间页面生成上的优势,同时扩展至人像摄影、数学试卷、古碑拓片等更多领域。据官方介绍,在12项主观评测维度上,Qwen-Image-3.0的整体表现优于OpenAI最新图像生成模型gpt-image-2,涵盖短文本准确率、长文本准确率、概念理解准确率、布局控制准确率、角色一致性保持等多方面评估。

该模型在输入长度和指令理解能力上的突破,为专业图像生成场景提供了从“快照式生成”向“文档级生成”过渡的可能——用户以需求文档方式描述画面,模型一次性输出结构完整、细节准确的结果。对于需要频繁输出多语言、多版式商业素材的团队而言,Qwen-Image-3.0或将成为图像生成工作流中的关键效率节点。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阿里发布Qwen-Image-3.0图像生成模型:4.5倍超长输入,复杂信息图与UI界面一次生成

2026-07-22 16:36:52 浏览量: 4729 作者: 探索者

7月22日,据报道,阿里正式发布最新图像生成基础模型Qwen-Image-3.0。该模型支持最大4.5k token超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂UI界面,同时支持12国语言和20多款字体原生渲染,大幅降低了多语言产品海报、影视分镜等商业素材的生产成本。

Qwen-Image-3.0是千问图像生成与编辑系列的第三代基础模型,着重提升了对复杂信息的承载能力,文本输入长度较前代实现4.5倍跃升。在影视短剧分镜、复杂信息图、产品说明页等需要超长提示词输入的场景中,用户不再需要将需求压缩成一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节,从而让模型更精准地生成图文内容,减少反复生成和人工调试成本。

凭借对语义并置和空间控制能力的优化,新模型可一次性生成涵盖9种不同领域的九宫格知识图解,字字清晰,幅幅准确。Qwen-Image-3.0能够理解复杂指令和画面的逻辑嵌套关系,可根据一条指令在同一幅图中生成网页、软件界面、聊天窗口、海报等多类视觉内容的组合式表达。

例如,当用户输入“在VSCode编程界面中,通过千问App生成一张发布在聊天界面里的手冲咖啡海报”时,模型能够准确理解其中的多层UI嵌套关系,并依次生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报,在保持各层界面结构、风格准确的同时,甚至能将手机截图里的时间数字——低至10像素的小字——清晰可辨。

在具体应用场景方面,Qwen-Image-3.0延续了前代在直播间页面生成上的优势,同时扩展至人像摄影、数学试卷、古碑拓片等更多领域。据官方介绍,在12项主观评测维度上,Qwen-Image-3.0的整体表现优于OpenAI最新图像生成模型gpt-image-2,涵盖短文本准确率、长文本准确率、概念理解准确率、布局控制准确率、角色一致性保持等多方面评估。

该模型在输入长度和指令理解能力上的突破,为专业图像生成场景提供了从“快照式生成”向“文档级生成”过渡的可能——用户以需求文档方式描述画面,模型一次性输出结构完整、细节准确的结果。对于需要频繁输出多语言、多版式商业素材的团队而言,Qwen-Image-3.0或将成为图像生成工作流中的关键效率节点。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号