跳转到主要内容

微软推出MAI-Image-2.6-Flash:生成速度快2.8倍,成本直降一半多

微软在9月正式推出了自研图像生成模型的轻量级版本——MAI-Image-2.6-Flash,并已通过Microsoft Foundry开放公开预览。作为上个月在技术排行榜上登顶的MAI-Image-2.6的高效版,这一新模型的发布,标志着微软在AI图像生成领域,开始全面向需要高并发、低延迟且对成本敏感的工业级场景进军。

测试数据显示,MAI-Image-2.6-Flash的图像生成速度是GPT-Image-2-Medium的2.8倍,整体综合效率提升了72%。在显著降低推理延迟和计算成本的同时,该变体完整继承了主模型的核心生成与编辑能力,支持高精度的文生图和局部对象级图像编辑。

Image

除了速度与成本的优势,整个MAI-Image-2.6系列还带来了多项架构升级。比如,它现在最多支持五张参考图像,确保角色和产品在多张图片中的一致性;集成了Bing搜索的网页定位功能,可以补充真实世界的图像信息;还原生支持动态宽高比和更高分辨率的输出。

在商业定价策略上,Flash版本将文本输入、图像输入和图像输出的每百万token价格分别降至1.75美元、2.50美元和19美元,相比主模型实现了超过50%的成本削减。

微软建议,对于需要严苛图像质量和文字渲染的商业设计及最终生产资产,应使用主模型;而Flash版本则精准定位于交互式应用、快速创意迭代和大规模自动化流程。这种兼顾极致性能与最优成本的多模态模型矩阵,反映出生成式AI正从单一的技术突破,转向高吞吐、低成本的工程化落地。

关键要点

  • 速度与成本:MAI-Image-2.6-Flash生成速度比GPT-Image-2-Medium快2.8倍,成本降低超50%。
  • 功能继承:完整保留主模型的图像生成与编辑能力,支持高精度文生图和局部编辑。
  • 架构升级:支持最多五张参考图像、集成Bing搜索、原生动态宽高比和更高分辨率输出。
  • 定价策略:Flash版本每百万token价格分别为文本输入1.75美元、图像输入2.50美元、图像输出19美元。
  • 应用定位:主模型用于商业设计,Flash版本用于交互式应用、快速迭代和大规模自动化。