技术突破

小鹏第二代VLA大模型升级:AI从3D空间理解跃迁至4D时空理解,G9L首发XOS 6.3.0

2026年8月28日,小鹏集团在8月27日广州举办的物理AI分享体验日上宣布第二代VLA(Vision-Language-Action)大模型迎来首次重大升级,全新XOS 6.3.0版本将于小鹏G9L全球首发全系标配。此次模型升级的核心突破,是让AI第一次建立起对时间维度的理解——从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。

小鹏认为,传统智驾模型可以识别车辆、行人、道路和交通信号,但要真正完成复杂的物理世界决策,车辆需要具备"时间逻辑"——知道过去发生了什么、现在正在发生什么、未来可能发生什么。真实世界不是一张张静止的图片,而是一个不断变化、连续演进的动态过程。前车可能突然刹停,行人可能临时折返,旁车可能强行加塞——光"看见"远远不够,还得能预判。第二代VLA的升级通过三项核心技术实现4D时空理解:时序记忆模块(记住过去数秒的交通参与者行为轨迹)、动态场景推理引擎(理解当前各对象之间的动态关系和意图)、未来轨迹预测网络(预判未来数秒各对象可能的运动轨迹)。

从3D到4D的跃迁是自动驾驶AI架构的一次范式升级。当前大多数智驾系统本质上是"帧级感知"——每帧独立识别对象然后做决策,缺乏时间连续性。4D时空理解使得AI可以像人类驾驶员一样"读懂"交通场景的动态演变——这不仅提升安全性(能预判前车急刹、行人折返等突发情况),还能改善体验(决策更平滑自然,减少急刹急转)。小鹏选择在G9L上首发这一系统也值得关注——G9L是小鹏面向全球市场的大型SUV,将4D时空理解能力作为标配意味着小鹏在智驾能力上采取了"旗舰先行"策略。对自动驾驶行业而言,小鹏的4D时空理解代表了一个重要方向——从"看见"到"预判"、从"空间感知"到"时空理解",这可能是通向L4+自动驾驶的关键技术路径之一。

← 返回AI热点列表