Qwen-Image-3.0发布:AI绘图从好看走向实用
2026年7月21日,阿里千问正式发布第三代图像生成模型Qwen-Image-3.0。从1.0的"Precision"到2.0的"Variety+Completeness+Beauty+Authenticity",再到3.0的"Real"(实)——千问图像模型的目标始终是让图像生成从"好看"走向"有用",从"可用"走向"实用"。
三大核心能力:丰实、真实、厚实
Qwen-Image-3.0围绕三个核心维度展开:
内容丰实(Rich Content):支持最大4.5K Token的超长指令输入,能够一次性生成包含九宫格级别复杂信息的版面——每个格子是独立信息图,不需要多张拼接。从报纸版面到学术试卷,从分镜脚本到UI界面仿真,一张图承载海量结构化信息。
细节真实(Authentic Details):10px小字依然清晰可辨,LaTeX公式、学术论文排版无障碍。毛孔与发丝级别的微观质感还原,让写实人像达到摄影级真实。还能在传统画作上叠加逼真手写批注,或在受损画作上进行风格一致的修复。
知识厚实(Deep Knowledge):原生支持12种语言渲染,覆盖100多种艺术风格,能联网搜索实时信息生成天气预报图。最惊艳的是深度嵌套UI生成——一张图里从外到内依次嵌套VSCode编程界面、千问App界面、微信聊天界面和手冲咖啡海报,四层"画中画"每个UI都保留原生风格。
实测体验:文字渲染与复杂版面
在实际测试中,让Qwen-Image-3.0书写近800字的《滕王阁序》并搭配贴合主题的背景,模拟语文课本呈现样式——整张图文字没有错字漏字,标题作者正文层级清晰,画面还添加了红色篆刻印章和页码标注,细节拉满。
艺术展海报测试中,左侧水彩画风格与右侧赛博朋克风格通过中间人物和雨雾氛围自然过渡,中文和韩语一一对应,色泽字体与两侧风格兼容。
与GPT-Image-2的对比
独立测试者将Qwen-Image-3.0与GPT-Image-2进行了五维度对比:
- 文字准确率:GPT-Image-2领先,Qwen在阿拉伯文和科学知识准确性上有差距
- 排版与信息密度:打平,两者复杂排版基础能力都在线
- 写实度:打平,人像测试都达到"看不出AI感"水平
- UI与交互逻辑:GPT-Image-2领先,Qwen的评论区昵称和内容层级偶有颠倒
- 极限输出:各有优势,GPT原生4K分辨率更高,Qwen生成速度更快
总体来看,在GPT Image 2之下,Qwen-Image-3.0是国内排名第一的图像生成模型。
适用场景与人群
Qwen-Image-3.0最适合文字量大、版面复杂的生产力场景:报纸版面、学术试卷、分镜脚本、UI界面设计。如果你需要在一张图里塞进大量结构化文字信息,Midjourney做不到但Qwen-Image-3.0能做到。
模型已在千问App和HuggingFace开放使用,但目前未开源权重。对于专业创作者和内容团队来说,Qwen-Image-3.0的"丰实+真实+厚实"组合让AI绘图第一次真正成为可落地的生产力工具。