物理 AI 要解决的问题,是理解一个持续变化的世界,并在其中行动。对智能汽车来说,这意味着模型既要看懂眼前的道路,也要记住刚刚发生了什么,判断接下来可能发生什么,再及时做出行动。
第二代 VLA 的这次升级,围绕这一核心目标展开:把时间纳入模型,在有限车端算力下扩大能力边界,再通过架构优化与蒸馏,让这些能力进入更多车型。XOS 6.3.0 是这套模型能力的一次集中落地,也是小鹏长期建设物理 AI 技术体系的阶段性成果。
一、从物理世界的约束出发,升级底层架构
从 2024 年开始,我们持续推进同一条核心技术路线:通过底层架构创新,提高模型理解世界、作出决策和执行行动的能力。随着模型进入更多真实场景,一些问题越来越清楚:缺少历史信息,模型就难以理解变化;缺少未来预测,决策就容易滞后;无法表达多种可能,复杂场景中的选择就会受限。这些问题,需要从模型本身寻找解法。
物理 AI 又有明确的边界。车端芯片的算力、内存和功耗有限,推理必须满足时延要求,系统还要遵循安全与法规约束。更大的模型、更长的上下文和更丰富的预测,最终都要在这些条件下运行。
因此,我们把模型架构、芯片、编译器和部署方式放在一起设计:哪些信息值得保留,哪些计算可以复用,模型容量应该分配给哪些能力。物理 AI 的架构设计,要回答的是如何让有限的计算资源产生更强、可部署的智能。
一张图片可以告诉模型“这里有个人”,却很难完整说明这个人从哪里来、正在向哪里走。驾驶所需的大量信息,存在于连续变化之中。XOS 6.3.0 的关键升级,就是让过去、现在和未来共同参与判断。
InfiniVLA:让历史信息持续参与判断
长时序的价值,是保留对当前决策有用的上下文。例如,理解一次尚未完成的转向,或判断一个短暂被遮挡的交通参与者,往往需要回看此前的变化。
InfiniVLA 让历史视觉信息持续参与当前判断,处理更长的物理世界上下文。在本次车端部署中,我们选择 30 秒历史上下文,在有效记忆与计算开销之间作出取舍。配合流式自回归推理,模型持续接收观察、进行推理并输出行动,让信息处理跟上场景变化,也让连续动作获得更充分的上下文支撑。
同时,考虑到算力的限制,InfiniVLA 创新性的引入了缓存机制,能在不大幅增加算力消耗的情况下,实现几乎无限时序的记忆能力。这些技术上的底层创新为我们提高智能驾驶的上限提供了源动力。
Infini-VLA让过去发生的信息能够持续参与当前判断,处理物理世界更长的“上下文”
X-Foresight:把未来变化纳入当前决策
时间维度的引入,不仅需要我们能理解过去,也需要向前看,来预测世界即将要发生的变化,从而更有效更安全的应对。X-Foresight 世界模型根据车辆位置、速度和环境等信息的变化,对未来场景进行预测,使当前决策能够参考接下来可能发生的变化。好的物理 AI 系统一定是能通过对于未来的预判来规避陷入长尾场景的能力。
预测范围同样需要服务于实际任务。车端方案选择 6 秒未来预测,把资源集中在与当前驾驶决策密切相关的时间范围内。我们希望模型能更早理解变化趋势,为后续行动留出空间。
我们在今年 6 月的 CVPR 上向学术界介绍了我们的世界模型 X-Foresight,也在这一次的 OTA 中完成了落地量产。
真实道路经常允许多种合理选择:同一个场景下,可以减速等待,也可能存在合适的绕行路径。这些选择对应不同的轨迹分布。把它们压成一个“平均答案”,可能无法表达任何一种完整、合理的动作。
Flow Matching Head 以融合视觉、导航和车辆状态的长时序驾驶表征为条件,通过学习的向量场,将噪声转化为动作轨迹。这种生成方式能够拟合多峰分布,表达不同的驾驶意图与轨迹选择。训练阶段再结合安全、效率、舒适和合规等反馈,通过强化学习优化策略,让多种可能的表达能力服务于最终的驾驶行动。
MoT:在有限算力下,扩展模型容量
当模型需要同时处理更长历史、更多模态和更复杂场景时,对模型容量和计算效率的要求也随之提高。MoT(Mixture of Transformers)通过专家分工,让不同场景由相应的专家承载。视觉与文本信息共同指导场景切换,按当前场景选择专家;同时复用视觉信息、保持长时记忆连续,让模型切换任务时仍能保留重要上下文。
我们扩大模型规模,是为了容纳更复杂的关系,支持更多场景与更强的泛化。参数量必须与架构、数据和算力利用效率共同发挥作用,才能转化为真实的能力增量。这也是我们持续推进跨区域泛化、面向更广阔市场验证模型的基础。
MoT(Mixture of Transformers) 让不同模态、场景分配独立Experts,降低模式混淆;同时通过视觉跨场景复用,重要的长时视觉信息不会因为场景切换就全部丢失
这几项技术共同建立了模型的时间能力:InfiniVLA 保留过去,流式推理跟进现在,X-Foresight 预测未来,Flow Matching 表达多种行动可能,MoT 为这些能力提供更有效的容量与分工。
我们也看到了加强了模型对于时间的理解,以及容量之后,产生了更加安全和效率的驾驶行为。
蒸馏的目标是什么?关于蒸馏,我们有过很多的考量。一方面,我们不希望蒸馏成为一种对模型进行缩小甚至砍半、剪枝的部署工具,来适配更低算力的芯片;另外,我们又希望能尽可能的保留 VLA 2.0 模型的原始能力和风格。一个更强的基座模型,也应该让更多车型受益。这看似不可能的矛盾问题,只能通过底层的架构升级和技术突破来解决,而不是简单粗暴的一刀切。
要把它部署到算力更有限的平台上,有几个关键的技术问题需要解决:
首先,蒸馏的关键在于学生模型能否承接教师模型的能力,以及这些能力能否在目标芯片上高效运行。我们的做法从学生模型的架构开始。围绕 Max 车型的计算瓶颈,重新分配模型中的计算资源。针对计算量最重的 ViT 部分进行了彻底重构,以 HybridViT、TuringViT 等视觉架构工作为基础,使用“学习式压缩”来降低有效计算量,结合编译器与部署优化,提高硬件利用效率,尽可能保留模型“大脑”容量,从而实现有效的算力-能力的平衡。这样,学生模型在接受蒸馏之前,就具备更高的能力起点。
蒸馏还依赖两个关键条件。一个是足够强的教师模型,它提供更丰富的学习信号;另一个是合适的数据分布,它决定学生模型在哪些问题上学习、能否覆盖目标使用场景。依托数据基础设施,我们组织高质量、分布合理的训练样本,把教师能力、学生容量与训练重点结合起来。
Max 蒸馏由四项工作共同支撑:针对芯片重做架构、持续增强教师模型、提高学生模型的基础能力,以及优化训练数据的质量与分布。
Ultra 和 Max 也有不同的能力侧重。Ultra 以向 L4 能力演进为长期研发目标,持续拓展场景覆盖、长尾问题处理和跨区域泛化能力。Max 聚焦通勤与日常使用,在数据选择和训练中,把有限资源优先投入这些高频场景。两者共享技术积累,也需要按照各自的计算条件和产品目标作出取舍。
单图灵平台上的 Max 蒸馏是这一思路的落地,双 Orin X 平台的蒸馏版本也在推进中。针对双 Orin 的蒸馏,因为涉及到跨平台 / 跨模型架构的蒸馏,技术的挑战更大,需要对底层甚至是算子层面做更彻底的优化。最近我们也取得了突破性的进展,开始内部的测试工作。
我们会持续把模型与部署环节的进展带到更多硬件平台。同时,无论是单图灵还是双 Orin,蒸馏版 VLA Lite 都会随着基座模型的能力升级而持续优化。
模型升级背后,是一套让数据进入训练、让模型得到验证、再将能力部署到产品中的基础设施。XOS 6.3.0 的迭代,建立在这套体系的长期积累之上。
芯片与模型联合优化,让能力真正落到车端。芯片决定计算条件,模型决定如何使用这些条件,编译器与部署链路则影响最终的运行效率。把这些环节协同设计,才能让架构创新转化为实际可用的模型容量、响应速度和产品体验。
数据基础设施,让模型学到需要的经验。我们用“数量 × 质量 × 分布”概括数据工作的重点:规模提供覆盖基础,质量影响学习效果,分布决定哪些场景被充分学习。统一存储、多模态检索与规模化挖掘,让我们能够从海量数据中找到有价值的样本,持续补齐常见场景与长尾问题的覆盖。
闭环仿真,让验证速度跟上模型迭代。真实世界的反馈昂贵,一些低频场景难以反复获得。仿真把场景转化为可重复验证的条件,并通过车型、天气等变化检验模型表现。我们同时建设仿真的真实性、运行效率与评价体系,让仿真与实车验证共同为模型改进提供反馈,连接数据、训练、验证和部署。
这套体系也在向汽车之外延伸。我们同时探索了同一套模型控制汽车与机器人,并且成功将这一套物理 AI 的底层体系迁移到小鹏集团的机器人身上,实现了底层的高度复用。
不同本体有不同的动作空间和约束,但都需要完成“交互、理解、决策、执行”,也都依赖数据、模型、仿真与部署能力。已有能力能否迁移、哪些环节需要适配,可以在这套基础设施中持续验证。
这就是我们建设物理 AI 公司的技术路径:从智能汽车出发,建立可复用、可验证、可持续迭代的底层能力,再让它支撑更多产品。XOS 6.3.0 是这条路径上的一次具体实践。我们持续投入的,是让模型面对新的场景与任务时,仍能学习、验证和改进的能力。我们也期待着在不远的将来,让我们的底层物理 AI 体系能在小鹏的全系列产品线上为我们的用户提供更加可靠、安全、实用的体验。
关于小鹏集团
小鹏集团是全球领先的物理AI公司,致力于将人工智能带入物理世界,重新定义未来出行与智能生活。公司构建了全栈自研的物理AI技术体系,覆盖图灵AI芯片、物理世界基座模型以及高度整合的软硬件应用。基于统一的技术底座,小鹏集团打造了智能电动汽车、Robotaxi、人形机器人等产品,推动物理AI的规模化落地。小鹏集团总部位于中国广州,并在纽约证券交易所和香港联合交易所双重主要上市。公司拥有国际化的研发、制造、销售和服务体系,通过持续的技术创新与开放的物理AI生态,为全球用户带来更智能、更安全、更美好的生活方式。更多详情,请访问小鹏集团官网https://www.xpeng.com/。





