首页
学习
活动
专区
圈层
工具
发布

TIME | 第二代 VLA 大模型开始拥有“时间感”

第二代 VLA 通过模型扩容和架构升级,开始连接过去、现在与未来:记住更长的道路信息,实时理解环境变化,并推演接下来可能发生什么。

同一套物理 AI 能力也开始进入整车智能、覆盖更多车型,并向机器人等更多本体延展。

技术突破

AI 开始连接过去、现在与未来

从模型突破到体系进化,Physical AI 进入真实世界

物理 AI 最终要解决的是:理解世界,并在世界中行动。

模型范式奠定方向,模型规模拔高能力上限;数据提供理解真实世界的经验;云端与端侧算力分别支撑训练和实时运行;本体让 AI 进入真实世界持续验证。

本次最大的变化,是模型开始理解“时间”

一张图片只能告诉模型“这里有个人”,却无法完整说明他从哪里来、准备往哪里去。第二代 VLA 不再只看眼前画面,而是让连续发生的信息共同参与判断。

看见世界只需要一瞬间,理解世界需要时间。

连接过去、理解现在、推演未来

Infini-VLA:让过去的有效信息持续参与当前判断

Streaming Inference(流式自回归推理):持续接收新信息并实时更新决策

X-Foresight+Flow Matching:推演未来多种可能,生成更自然的驾驶轨迹

MoT 混合架构:让不同场景调用不同专家,同时保留跨场景视觉信息

这些能力共同帮助模型理解一个连续变化的物理世界。

产品落地

从模型能力走向完整任务

模型更大、记得更久、响应更快、想得更远

端侧模型参数量提升3.5 倍,支持最长30 秒有效时序,并可推演未来6 秒内的多种可能变化。车辆能够结合红绿灯变化、交通参与者运动趋势和道路环境,更早作出判断、更快完成响应。

最终感受到的是:面对遮挡、突然横穿、加塞和复杂路口,车辆动作更早、决策更连贯、乘坐更平稳。

VLA+VLM 融合,Master Agent 上车

基于自研 Omni 多模态基座的 Master Agent,能够理解复杂意图、拆解任务,并调度智驾、底盘、座舱和车身控制等垂直 Agent 协同执行。

当用户说“找个地方停一下”,车辆不只是识别一句语音,而是理解需求、判断环境、规划任务并完成停车,实现自然语言从意图直接走向 Action。

真正的整车智能,不只是听懂指令,而是把事情完整办成。

一个基座,让能力向上突破、向下覆盖、向外延展

向上,同源技术在 Robotaxi 中验证更高阶自动驾驶能力,目前已完成超过 2000 单内测,并取得主驾无人道路测试资质;向下,通过同源蒸馏让 VLA 2.0 Lite 进入算力更低的平台,覆盖更多车型和用户。

基座越强,能力上限越高,蒸馏后的能力起点也越高。

能力延展

从汽车走向更广阔的物理世界

一版模型决定一次体验,一套 Infra 决定长期进化

第二代 VLA 的升级并非一次孤立突破,背后是一套覆盖数据、训练、仿真、评估、部署和优化的 AI Infra。真实车队不断提供新问题,数据引擎发现高价值与长尾样本,训练系统推动模型迭代,仿真平台则大规模验证模型行为。单次训练数据吞吐量较半年前增长 10 倍,让更多真实世界问题更快进入训练与验证闭环。

真正的护城河,不是这一版模型,而是持续训练出下一版模型的能力。

从汽车到机器人,物理 AI 飞轮开始产生复利

模型能力提升,带来更好的产品体验;更多量产产品进入真实世界,又产生新的数据和问题;数据经过训练、仿真和验证,再推动下一代模型进化。随着这套闭环不断运转,能力将不再局限于单一版本、单一车型或单一本体,而是持续向汽车、Robotaxi、机器人及更多智能产品延展。

真正产生复利的,不是某一版模型,而是让每个本体都成为下一轮进化的起点。

第二代 VLA 全新版本,即将开启推送

/ 欢迎咨询小鹏汽车 /

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O09FJU1y7UKY0MLxpy5kp-5g0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券