跳转到主要内容

商汤新8B模型:4K视觉编辑,现已开源

商汤科技刚刚发布了一款新的开源模型,在AI社区引起了轰动。这就是SenseNova U1.5Lite,一个80亿参数的轻量级多模态模型,证明了尺寸并非一切。尽管体积紧凑,但它在复杂布局和文本渲染方面表现出色,能与一些大型商业模型一较高下。

这款模型的独特之处在哪里?首先,它原生支持3到4K的上下文长度,这意味着它可以同时处理多个约束条件——比如主体、数量、空间关系、文本、布局和风格——一次性完成。这对于处理复杂视觉任务时的稳定性来说是一个游戏规则改变者。

Image

但真正的魔力在于其视觉能力。该模型在生成质量上带来了显著提升:更好的构图、更丰富的色彩、更逼真的材质和光照,以及更精细的局部细节。这种改进让你不禁多看两眼——不再有“乍一看还行,细看就崩”的情况。

然后是编辑方面。SenseNova U1.5Lite提供了更可靠的原生图像编辑,在调整特定区域时保留主体的身份、空间结构和布局关系。无论是替换元素、细化文本,还是使用多个参考图像,它都能处理得游刃有余。

Image

文本和复杂布局?它也覆盖了。该模型加强了对中英文文本、海报、信息图、品牌视觉和多文本格式的处理,推动内容向完整的视觉表达迈进。对于控制狂来说,它支持边界框、视觉标记以及单图或多图参考,让你可以精确指定要编辑的内容。

也许最令人印象深刻的是原生4K高分辨率输出。这意味着你可以同时获得宏观构图和最微小的纹理、小文本和光照效果——而不会损失质量。就像口袋里装了一个专业设计工作室。

那么,这是为谁准备的?开发者、创作者、研究人员——任何渴望尝试先进多模态AI而不需要超级计算机的人。通过开源这个模型,商汤科技将钥匙交给了社区,可能性是无限的。

如果你好奇,可以深入GitHub上的项目:https://github.com/OpenSenseNova/SenseNova-U1

关键要点

  • 轻量但强大:80亿参数在复杂视觉任务中提供与更大商业模型相当的性能。
  • 原生4K输出:高分辨率生成,同时保持宏观构图和细节。
  • 高级编辑:可靠的原生图像编辑,保留身份、结构和未编辑区域。
  • 多约束处理:支持3-4K上下文长度,同时管理多个约束以获得稳定结果。
  • 开源:可在GitHub上获取,邀请社区探索和创新。