文|傲然
编辑|杨布丁
8月27日,小鹏集团宣布第二代VLA大模型首次重大升级,全新XOS 6.3.0版本将在小鹏G9L上全球首发。此次模型升级的核心,是让模型第一次把“时间”纳入理解范围,从看静态画面走向理解连续的时空变化。
第二代VLA全新版本将于9月面向Ultra和Ultra se车型开启推送。此外,小鹏汽车通过Token压缩与蒸馏训练,在不牺牲输入信息和模型容量的基础上,把第二代VLA基座模型部署到算力更低的平台。图灵VLA 2.0 Lite版本预计9月开启首批推送,小鹏G9L Max版本首发搭载这一蒸馏版本。
据了解,第二代VLA引入Infini‑VLA长时序架构,能记住前30秒的世界,把连续发生的道路事件串成完整时序,而不是割裂成一张张独立画面。配合X‑Foresight预测世界模型,系统可以推演周边交通参与者未来6秒内的可能行为。
小鹏集团通用智能中心负责人刘先明表示,过去做物理AI,受各类条件制约,更多是做空间理解,知道自身所处位置,知道周遭世界是什么样。但想要做好物理AI,还要理解时间,要把认知从空间拓展到时空维度,要尝试回答,在时空当中正在发生什么、即将要发生什么。
在刘先明看来,绝大多数观测场景不需要超过30秒时长的数据,所以把历史记忆的观测窗口限定为30秒,“仅仅这30秒的历史记忆,模型会变得更聪明,计算更紧凑,对过往发生的事件形成记忆,对未来做出更好的判断”。
此外,第二代VLA采用了Streaming Inference流式自回归推理,从离散推理转向连续推理。刘先明解释称,传统模型是看、算、输出、再看的串行模式,流式推理可以简单理解为,一边接收画面,一边思考,一边输出轨迹规划,循环往复,通过这套方式,整体时延、响应速度提升300%。
据小鹏汽车介绍,全新版本端侧模型参数量扩大3.5倍,达到主流VLA模型的15倍以上。同时,第二代VLA引入MoT混合架构,针对城区道路、园区、泊车等不同任务动态分配模型能力,把不同问题交给不同专家处理,让模型在任务之间切换更稳定。
小鹏集团董事长何小鹏8月27日发文表示,小鹏正在加快第二代VLA的全球部署,目标明年上半年率先在欧洲获得监管许可,开始向更多海外用户交付第二代VLA。
“我们非常期待与全球其他友商最领先的智能辅助驾驶系统直接同台竞技。”何小鹏表示,在大路等常规道路场景下,第二代VLA已经与全球一流水准的产品并驾齐驱,而在小路博弈、园区和停车场等复杂场景下,体验还要更好,支持从导航直接到达停车位,既高效又安全。
小鹏还用做机器人的方式重构了车机大脑,首次推出Master Agent,实现VLA与VLM的驾舱融合。
刘先明介绍称,Master Agent建立在小鹏自研Omni全模态模型之上,能理解自然语言和模糊语义,把用户意图自动拆解为任务,调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,车辆不再只是识别指令、回复话术,而是能控制整车、完成整套任务。