跳转到主要内容

Qwen-Image-2.1:全能7B开源模型

Qwen-Image-2.1:一个全能的7B开源模型

9月21日,Qwen团队发布了Qwen-Image-2.1,这是一个新的开源图像模型,将文本到图像生成、透明图像创建和一套编辑工具打包到一个7B参数的框架中。它是一个精简的设置,旨在平衡质量、速度和成本。

其核心是,该模型使用32层单流DiT架构。得益于混合粒度注意力结构和KV Cache重用,它高效地处理多图像输入并控制内存使用——这对在普通硬件上运行的开发者来说是一个巨大的优势。

透明图像变得简单

一个突出的功能是透明图像生成。根据您的提示,模型会自动决定是输出标准图像还是带有透明通道的RGBA图像。您可以调整表情或编辑文本,同时保持背景透明。如果您输入一张真实照片,它会提取主体并生成透明图层——非常适合设计工作和合成。

Image

您可以修改主体的表情,同时保持透明背景。

Image

透明层内的文本也可以编辑——例如,将“BLOOM”改为“Qwen-Image”。

编辑感觉自然

在编辑方面,Qwen-Image-2.1最多接受10张参考图像,让您可以将多个主体和材料混合到一个连贯的场景中。局部编辑可以通过选择、画笔或独立蒙版完成——因此您可以精确指定要更改的内容。该模型还对面部和产品保持令人印象深刻的一致性:编辑后,面部特征保持逼真,产品文本和形状保持完整。

除此之外,该模型在文本渲染、人物光照和精细细节方面取得了长足进步。它轻松处理全景图像、信息图表和故事板。目前,Qwen-Image-2.1在GitHub、ModelScope和Hugging Face上免费使用。

关键点

  • Qwen-Image-2.1是一个7B开源模型,结合了文本到图像、透明图像生成和编辑。
  • 它使用32层单流DiT,具有混合粒度注意力和KV Cache重用,以实现高效推理。
  • 透明图像生成支持表情调整和文本编辑,同时保持透明度。
  • 编辑最多接受10张参考图像,并提供基于选择、画笔和蒙版的局部编辑。
  • 在GitHub、ModelScope和Hugging Face上免费可用。