阿里巴巴Qwen-Image-3.0支持4.5K Token输入,生成复杂图像
阿里巴巴正式发布了Qwen-Image-3.0,这是其图像生成基础模型的最新版本。作为Qwen图像生成与编辑系列的第三代模型,它带来了重大升级:现在可以处理高达4.5K token的超长文本输入,是上一代的4.5倍。
这在实际应用中意味着什么?用户现在可以详细描述复杂场景——比如公式、几何形状、逻辑推导或多层UI界面——模型将一次性生成。无需再将想法压缩成简短提示。你可以写一份设计文档级别的指令,涵盖视觉结构、文本内容、风格和布局,并获得准确结果。这减少了反复调整和手动修改的需求。

模型改进的语义解析和空间布局能力使其能够生成复杂的构图,比如覆盖多个主题的九宫格知识图,同时保持文本清晰和内容准确。它还能处理复杂的逻辑嵌套。例如,你可以要求它生成一张手冲咖啡海报,显示在聊天界面内,而聊天界面又位于Qwen App中,该App运行在VSCode编程界面内。模型理解这些多层关系,并在所有元素中保持一致的风格,甚至能清晰渲染约10像素的小字体文本。

Qwen-Image-3.0在细节还原方面也表现出色,适用于人像摄影、数学测试、古代石刻和直播页面等场景。团队针对复杂文本和图像布局以及高密度信息承载能力进行了关键优化。
关键点
- 4.5K token输入:处理长而详细的提示,无需压缩。
- 复杂生成:一次性创建公式、图表、多层UI等。
- 12种语言,20多种字体:支持多样化的文本和图像内容。
- 细节还原:针对人像、数学测试、石刻和直播进行了优化。