通义千问发布 Qwen-Image-3.0 图像生成基座:4.5k token 指令输入,10px 小字精准渲染,12 种语言原生支持

本站收录 2026-07-20 00:00来源:https://qwen.ai/blog?id=qwen-image-3.0

通义千问团队 7 月 21 日发布第三代图像生成基座模型 Qwen-Image-3.0。官方把这一代的核心关键词归结为一个字——「实」(1.0 是「精准」,2.0 是「精准、多样、完整、美观、真实」),即不只追求好看,而是追求把图像生成变成可落地的生产力工具。「实」体现在三个维度:内容丰富、细节真实、知识深厚。

内容丰富方面,模型支持最长 4.5k token 的指令输入,可一次性生成报纸、分镜脚本、试卷等复杂版式。官方演示中最重的案例是一张 3×3 网格图:九个格子分别是隧道安全漫画、空间几何课、《出师表》风格分析、物理抛体运动、寄生虫学讲解、医学示意图、群论西罗定理、银行内控信息图、DNA 结构对比——整张图一次生成而非拼接,完整描述需要 3.7k token。深度方向上,模型还能用一条指令逐层渲染嵌套界面(VSCode → Qwen Chat → 微信界面 → 手冲咖啡海报)的「画中画中画」效果。

细节真实方面,Qwen-Image-3.0 可精确渲染小至 10 像素的文字,官方展示了整页代数几何学术论文(密集 LaTeX 公式、上下标、多行对齐)、带真实纸张质感的报纸版面,以及书页上叠加手写风格批注的编辑任务;纹理层面覆盖毛孔、发丝等微观刻画,还能修复受损传统绘画并保持原有笔触。知识深厚方面,模型原生支持 12 种语言渲染、100 多种艺术风格,并可模拟网页、游戏、直播等主流界面。

值得注意的是,截至本稿发布,Hugging Face Qwen 官方账号下尚未出现 Qwen-Image-3.0 的开源权重(最新模型仍停留在 6 月底的 Qwen3-ASR/ForcedAligner 系列),官方博客也未公布参数规模与开源计划——本轮发布以能力展示为主,权重是否开源以官方后续披露为准。加上 7 月 19 日官宣 2.4T 旗舰 Qwen3.8,通义本周在 LLM 与图像两条线上同时发力,延续了国产开源模型密集发布的暑期节奏。

本文相关产品

已复制,可直接粘贴给你的 AI