跳转到主要内容

小鹏二代VLA大模型首升级,安全能力飙升20倍

8月27日,小鹏汽车举办了一场以“TIME·时间”为主题的AI分享会,正式发布了第二代VLA大模型的首次重大升级。新版本XOS 6.3.0在全球首发于小鹏G9L车型上,其核心变化在于让AI真正理解时间,推动物理AI基础模型从静态3D空间理解迈向动态4D时空理解。

这次升级背后,是小鹏在自动驾驶领域对Scaling Law的持续验证。边缘端模型参数量提升了3.5倍,与行业常见的小模型拉开了明显差距。配合超长序列上下文记忆能力,AI司机现在能“看得准、想得通、反应快”。同时,新版本还引入了车机Master Agent,实现了VLA与VLM在座舱内的融合,并把一些L4级Robotaxi的体验下放到了量产车上。

Image

物理AI面对的并非静态图像,而是一个连续的过程。要让模型像人一样理解世界,首先得理解“时间”。传统模型能识别车辆和行人,但车辆需要知道过去、现在和未来可能发生什么。为此,第二代VLA引入了Infini-VLA长时序架构,能记住前30秒的世界,为驾驶决策提供更长的上下文。连续发生的道路事件不再被割裂成单帧画面。

为了跟上不断变化的真实路况,第二代VLA同时提升了模型推理效率,采用流式自回归推理,从离散推理转向连续推理,端到端响应速度提升了300%。模型能并行处理“看、想、动”,面对前车急刹、行人回头、旁车强行加塞等突发情况,反应像老司机一样娴熟敏捷。

此外,小鹏的X-Foresight预测世界模型首次部署上车,能预测未来6秒内的事件,模拟周围交通参与者的可能行为。新模型还引入了MoT混合架构,为不同任务动态分配模型能力,减少城区、园区、泊车等不同场景间的任务干扰。更大的参数、更先进的轨迹预测、超长有效时序、更快的决策响应,让多维综合安全能力提升了20倍。

在车机方面,小鹏首次推出Master Agent,用机器人技术重构车辆大脑,实现VLA与VLM在座舱内的融合。它不仅能理解自然语言和模糊语义,还能自动将用户意图拆解为任务,调度智驾、底盘、座舱、车身控制等垂直Agent协同执行。新版本还带来了“语音找车位”和“语音控车位”等功能,实现了从“语音指令”到“自主执行”的完整闭环。L4级Robotaxi技术正加速下放量产车。

作为一家全球化的具身智能公司,小鹏致力于统一技术底座,连接汽车与机器人,推动物理AI进入大规模复制阶段。搭载第二代VLA的Robotaxi近期获得了广州智能网联汽车远程测试资格,可在无安全员的情况下在相关道路测试。机器人方面,小鹏通用人形机器人IRON搭载三颗图灵AI芯片,算力达2250 TOPS,已实现边缘端部署,能独立完成复杂任务。小鹏机器人业务近期也完成了9亿美元的首轮股权融资,投后估值超过63亿美元。

为了让技术惠及更多用户,小鹏通过基于学习的Token压缩和蒸馏训练,将第二代VLA基础模型能力部署到较低算力平台。蒸馏后的图灵VLA2.0Lite将于9月首发搭载在小鹏G9L Max版本上。同时,小鹏正积极推进第二代VLA的全球部署,近期已在德国完成本地化验收测试,目标明年上半年获得欧洲监管批准并交付海外用户。

这一系列进展背后,是小鹏长期构建的完整AI Infra体系。依托百万级车队和十亿级数据资产,小鹏建立了数据飞轮,单次训练数据吞吐量达到1亿clips,比半年前提升了10倍。通过持续积累AI Infra,小鹏正将模型能力的进化从单一汽车产品扩展到机器人等不同具身载体,不断延伸物理AI与真实世界交互的边界。

关键要点

  • 第二代VLA大模型首次重大升级,核心是让AI理解时间,从3D空间理解跃升到4D时空理解。
  • 边缘端模型参数量提升3.5倍,端到端响应速度提升300%,综合安全能力提升20倍。
  • 引入Infini-VLA长时序架构和X-Foresight预测世界模型,支持30秒记忆和6秒未来预测。
  • 车机端首次推出Master Agent,实现VLA与VLM融合,并推动L4级Robotaxi技术下放量产车。
  • 小鹏机器人业务完成9亿美元首轮融资,投后估值超63亿美元。