更深刻了解汽车产业变革
出品:电动星球
作者:Wallace
在所谓的「L3 前夜」,大多数车企的辅助驾驶水准已经拉不开明显的差异,也由此带来一个得到广泛关注的问题:还要如何向上突破?
大体来说,是细节的比拼:防御性驾驶做得更好、系统时延更低、响应速度更敏捷、用户体感更柔和……
在这样的大前提下,车企们各出奇招,疯狂地压榨着算力、大模型的最后一丝潜力。
8 月 27 日,小鹏举行「物理 AI 日」,通用智能中心负责人刘先明,带来了他们的最新思考。
其中包括了辅助驾驶底层技术的全新设计思路,更直观的体验升级,则集中在第二代 VLA 大模型的最近进展。
更值得用户关注的信息可能是,基于第二代 VLA 大模型的全新版本,会在 9 月全量推送;能力蒸馏后的第二代 VLA Lite,则由 G9L Max 版本首发搭载。
在用户体验到最新功能之前,不妨顺着小鹏的脉络来看看,升级版的第二代 VLA 大模型加了哪些新能力;而全新的辅助驾驶系统,又是否足够为 G9L 后续的上市保驾护航。
能看懂时间的 VLA
在发布会的暖场阶段,刘先明先给在场观众打了一个预防针,表示今天的活动因为偏技术向,可能会比较「枯燥」。
实际上,要搞懂升级后的第二代 VLA 大模型有哪些核心能力并不困难,它就写在了明面上(活动主题)——TIME,时间。
小鹏表示,升级版的第二代 VLA 大模型,获得了长达 6 秒的未来预判能力。简单来说,升级后的大模型能够推演未来 6 秒的道路交通可能性,包括交通参与者的运动轨迹、路面的变化等等,能够显著提升防御性驾驶表现和应变速度。
还是数据最直观。搭载升级版第二代 VLA 大模型的 XOS 6.3.0,其辅助驾驶系统响应速度提升 300%、多维综合安全能力能够提升 20 倍。
从演示片段中我们可以见到,搭载新版大模型的测试车能够精确判断前车有三点掉头的意向而选择停车等待,避免了误判前进造成的非必要拥堵。
还有一个例子,在因道路封闭维修而不得不停车让行的场景中,我方车辆可以判断出对向车需要借道行驶,测试车会等对方彻底驶离车道后再前进,而不是抢占道路造成堵塞。
还有其他的案例也很直观,包括视野盲区的保护性减速、绕行悬空的树枝障碍物等等,都充分展示了小鹏第二代 VLA 大模型在升级后所拥有的不俗预测能力。
至于小鹏是怎么做到的?就是刘先明口中的,「比较干货」的部分。
最核心的机制是「理解时间」,系统本身除了要能理解真实世界中的三维关系外,小鹏认为还需要加上对「时间」的理解。
「理解时间」的本质,是理解物体的位移变化和速度变化。这对系统本身的要求,一方面是需要容纳更大的数据量,一方面是更高的智能——熟悉大模型的朋友知道,这跟大模型的参数量息息相关。
具体来看,小鹏的升级版第二代 VLA 大模型在多个层面做了升级,比如说在数据输入阶段引入「Infini-VLA 长时序架构」,使得模型本身能够容纳至多 30 秒的视频上下文信息,然后在数据处理阶段引入「Streaming Inference(流式自回归推理)」,使得模型可以「边看、边想、边行动」,处理效率更好。
最后则是开头提到的「6 秒预判」,依靠的是新引入的「X-Foresight 预测世界模型」,它负责结合一系列信息,对交通参与者或者道路变化做预判。
可以见到,小鹏的第二代 VLA 大模型虽说是「升级」,但其实是针对数据输入和输出多个环节的重新部署,对基座模型本身的能力提出更高要求。
这也是下文需要提到的,在端侧算力资源相对有限的前提下想要提升大模型的参数量,小鹏选择了一条在通用大模型行业中比较常见,但车载模型中相对少见的路线——混合架构。
「MoT 混合架构」是第二代 VLA 的一个重要升级点,正如通用大模型的 MoE「混合专家」架构一样,能够在运行算力相同情况下部署更多的模型参数量,从而符合 Scaling Law 的逻辑,提升模型能力。
按照小鹏的说法,「MoT」架构能够「针对不同任务动态分配模型能力,……,把不同的问题交给不同的【专家】」,以此来针对性地解决不同场景的处理需求。
在一系列的架构改进后,新的第二代 VLA 大模型端侧模型参数量提升 3.5 倍,更是主流 VLA 模型的 15 倍以上,不过具体数字小鹏没有公布。
到这里,其实小鹏的思路已经很明确了,就是要以打造通用大模型的思维来升级第二代 VLA 模型,使其模型规模、数据处理能力都符合大模型定律 Scaling Law 的曲线,得到显著提升。
同时,「更像通用模型的逻辑」也算是一个伏笔——第二代 VLA 模型的升级版,能做到的东西远不止「让辅助驾驶变得更好」。
用物理 AI 的思维做汽车
小鹏提到,以第二代 VLA 为模型基座,结合座舱上的 VLM 模型,小鹏推出了「Master Agent」座舱统一大脑。
Master Agent 需要结合 Omni 全模态模型和一些云端模型来做数据分析、语义理解和任务拆解、执行,但核心能力依然是来自第二代 VLA 大模型。
因为辅助驾驶基座大模型,和座舱基座大模型有一定重叠,也使得 XOS 6.3.0 支持了「语音靠边停车」等命令,让座舱和驾控两个域能够进一步打通。
显然,小鹏更想强调的是「泛化」二字,其含义是小鹏只需要加码核心基座大模型的训练,就能同时让辅助驾驶和座舱体验受益。
而且,这只是在「车」的领域。回到活动的主题,「物理 AI」,小鹏表示第二代 VLA 能力的泛化,同样会惠及机器人领域,「同一个基座模型控制不同的本体」,才是他们的真正追求。
在现场小鹏甚至宣布,在单颗图灵芯片上运行第二代 VLA 大模型的升级版,已经能实现约每秒 20 token 的推理对话。这意味着,这一版的 VLA 大模型在某些场景中,已经摸到了通用大模型的门槛。
还有一点值得一提,最新的第二代 VLA 大模型并非只有搭载多颗图灵芯片的车型才能体验,搭载单颗图灵芯片,甚至是 Orin 芯片的车型,也能获得第二代 VLA Lite,也就是蒸馏版能力的更新。
综合来看,小鹏通过这一次的简短发布会,披露的信息可能不算太多,也不是对现有架构的颠覆,或者路线的切换,但确实能从中看出小鹏在对待 AI 技术的思考上,和其他车企不太一样。
本质上小鹏想打造的,还是一套能适用于多个不同主体的基座平台,如果站在「AI 是产品体系中最重要能力」的角度来看,把这样的底层平台搭好,确实是最省事的方式。
只不过,如果现实地看,小鹏目前的主业毫无疑问还是智能汽车,而他们希望借助 AI 构建起的庞大智能版图,现在看还没有真正可行的商业模式。
所以,小鹏现在的投入,可能短时间内还很难见到智能汽车以外的成果;现阶段因为研究通用大模型而带来的成本提升,却是实打实地反映到报表上。
最终会如何取舍,是坚持还是转向,就要看这一次的第二代 VLA 大模型升级版,能掀起多大的波澜了。
(完)
我们正在招聘
工作地点在广州,简历请投递到 mt@ddxq.tech
← 向左滑动查看更多招聘岗位

