小鹏TuringViT:仅用十分之一数据,性能超越SOTA
视觉大模型长期以来面临着一个艰巨的障碍:要达到顶级性能,需要海量数据集和巨大的计算能力。这使得先进的视觉能力只掌握在少数领先团队手中。但在7月21日,小鹏集团推出了TuringViT,一种高效的视觉编码器,有望改变这一现状。该公司声称,它从架构到数据再到训练,系统地重新思考了视觉编码器,提供了一条可复现、低成本的通往最先进视觉Transformer的路径。
TuringViT专为VLM和VLA时代设计,支持三大关键业务场景:智能驾驶、智能座舱和IRON人形机器人。它在架构、数据和训练三个方面取得突破,构建了一个以线性注意力、高质量数据治理和原生动态分辨率为中心的系统。结果如何?性能、效率和实用性均提升了三倍。

架构:规模化效率
TuringViT有两种版本。TuringViT-18L包含三个Turing Block,具有15个TLA层和3个MHA层,专注于动态分辨率下的高效部署。TuringViT-24L包含四个Turing Block,具有20个TLA层和4个MHA层,在保持线性计算为主干的同时提升了表示能力。测试数据显示,随着输入分辨率的提高,TuringViT的延迟增长远慢于标准softmax ViT。在1536x1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍和SigLIP2-ViT-L的2.16倍。这为高分辨率感知、多摄像头输入和长时视频处理的边缘部署扫清了主要障碍。
数据:质量胜于数量
当行业常常用更多数据来解决问题时,TuringViT采取了更智能的方法。它引入了VISTA-Curation多模态数据治理管道,专注于提升每个样本的监督价值,而不仅仅是扩大规模。对于图像-文本数据,该管道分三步工作:首先,过滤掉低分辨率、模糊或低纹理的图像;然后,使用多个模型和提示生成多样化的候选标题,交叉验证视觉一致性;最后,根据相对图像-文本对齐、文本信息量和歧义性对每个样本进行评分,选择高质量注释,同时消除弱或模糊的注释。对于视频数据,管道将长视频分割成短片段,采样代表性帧,并使用语义和运动一致性过滤有效片段。然后,结合局部帧级标题和全局时间标题生成捕捉变换的视频注释,帮助模型从连续场景中学习鲁棒的视觉表示。

结果:更少数据,更好性能
效果显而易见。TuringViT仅使用了8.5亿图像-文本对——约为训练SigLIP2-L所用数据的十分之一——却在包括ImageNet-1K在内的六个零样本分类基准上实现了83.6%的平均准确率。这超过了在100亿数据点上训练的主流开源基线。在COCO和Flickr30K上的图像-文本检索任务中也显示出显著优势。简而言之,它用更少的数据获得了更好的结果。

训练:从第一天起动态
TuringViT采用四阶段渐进式原生动态分辨率训练范式。从预训练的第一天起,它就适应了下游VLM和VLA的输入特性,摒弃了固定分辨率预训练后再进行事后调整的旧方法。
关键点
- TuringViT仅使用8.5亿图像-文本对(典型数据集的十分之一)就超越了SOTA基线。
- 其架构采用线性注意力,实现高效的高分辨率处理。
- VISTA-Curation管道通过严格的过滤和标题生成确保高质量数据。
- 四阶段动态分辨率训练范式消除了固定分辨率预训练的需要。