比亚迪发布自动驾驶论文HyWorldVLA,提出混合世界模型并在NAVSIM v1基准上取得SOTA成绩,PDMS达90.59
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
比亚迪汽车新技术研究院公开了其自动驾驶基础模型HyWorldVLA,该模型在自动驾驶公开基准NAVSIM v1上取得PDMS 90.59的成绩,达到当前公开结果中的领先水平。HyWorldVLA采用混合世界模型(Hybrid World Modeling)与Vision-Language-Action(VLA)架构,旨在结合像素级世界模型的环境细节理解能力与隐空间模型的推理效率。模型训练分为三步:先训练视频压缩器,将连续视频帧压缩为隐特征;再进行预训练,让模型同时预测未来画面token和隐特征;最后联合微调,仅输出隐特征并生成驾驶轨迹。消融实验显示,混合策略对性能贡献最大,去掉画面预测后PDMS降至87.50,去掉隐空间后降至89.91。
在雨雾场景测试中,HyWorldVLA的PDMS达到86.87,显著优于纯像素方法。
HyWorldVLA是比亚迪第一篇多模态基础模型论文,完全由比亚迪汽车新技术研究院独立完成,无外部合作署名。该团队此前还发表过EMoE-Planner(2025年)等自动驾驶相关论文。团队成员背景高度集中于哈尔滨工业大学和卡内基梅隆大学,其中Liulong Ma为多篇论文的通讯作者,其研究轨迹涵盖自动驾驶规划、机器人导航、多模态感知和世界模型。Hongbiao Zhu为EMoE-Planner第一作者,同样具有哈工大和CMU背景。这表明比亚迪新技术研究院的AI团队并非从汽车电子或ADAS工程延伸,而是吸收了顶尖计算机与机器人领域人才,形成“机器人AI派”的研发路线。
比亚迪自研AI团队的时间线指向2024年或更早启动,2025年有EMoE-Planner,2026年有HyWorldVLA,期间多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。团队构成呈现鲜明特征:成员背景高度集中于哈工大和CMU,与比亚迪同步推进的自研机器人项目形成技术呼应。HyWorldVLA所代表的VLA加世界模型路线,本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本,两者共享同一技术栈和人才基因。这一组织逻辑与特斯拉AI“机器人加自动驾驶”一体化架构相似,体现了物理AI从技术出发的第一性原理。