首页/文章/ 详情

华为、理想、特斯拉是怎么用世界模型是做智驾仿真的?

8月前浏览235
以下文章来源于公 户号:佐思汽车研究 ,作者周彦武,格式略有改变。

图片来源:论文《World Models for Autonomous Driving: An Initial Survey》

最近世界模型(World Model)很火,甚至有人说世界模型是终极自动驾驶解决方案,实际上它只是端到端大模型的一种,和VLM没有本质区别。目前的研究基本都集中在用世界模型生成视频或其他连续时间序列上的可视化数据,再用这些视频训练传统或端到端的自动驾驶模型,几乎没有人研究直接用世界模型做自动驾驶的。即便是视频生成,也还是处于实验室的学术研究阶段。
图片来源:网络

为什么要做世界模型,它实际上是端到端自动驾驶的闭环仿真,世界模型可以看做VLM的逆向工程,用prompt这些文字提示输出视频。世界模型和端到端模型是一个互相帮助的过程,世界模型生成的视频交给车端大模型,车端大模型通过它的规划执行接下来的动作,接下来的动作产生新的场景、新的视角,再通过世界模型继续生成新的数据,进行闭环仿真的测试。
图片来源:网络

不同于CARLA这些测试型仿真,世界模型是训练型仿真,它要达到海量规模才有价值。
图片来源:网络

世界模型生成视频可以是自监督的,无需3D标签,可以使用海量网络汽车驾驶视频。最重要的是它可以生成现实世界中极难采集到的长尾视频,这是其核心价值。换句话说它生成的视频价值是现实世界采集到的视频数据的价值百倍以上,但成本是其1%不到。
图片来源:网络

所谓世界模型就是视频生成加prompt控制。视频生成有四大类型,包括基于对抗网络GAN的,基于扩散模型的,基于自回归模型(基本上就是transformer)和基于掩码的。其中,扩散模型再分为Stable Video Diffusion (SVD)和Stable Diffusion (SD)两种,它们还有一种共同的称呼即隐扩散模型(Latent Diffusion Model, LDM)。目前也有结合diffusion和transformer的模型即DiT,但它本质上还是扩散模型,只不过用transformer替换了扩散模型中的Unet。大名鼎鼎的SORA则是复合型,Sora模型的核心组成包括Diffusion Transformer(DiT)、Variational Autoencoder(VAE)和Vision Transformer(ViT)。DiT负责从噪声数据中恢复出原始的视频数据,VAE用于将视频数据压缩为潜在表示,而ViT则用于将视频帧转换为特征向量以供DiT处理。据说特斯拉就是用的SVD。
基于世界模型的端到端训练,图片来源:网络

生成视频的质量分为两部分,一是视频本身的准确度,主要指标有三个,一个是FID/FVD,另一个是CLIP得分。FID(Fréchet Inception Distance)是一种用于评估生成模型,尤其是在图像生成任务中,生成图像的质量和多样性的指标。它通过比较生成图像与真实图像在特定空间内的分布来工作。这个特定的空间通常是通过预训练的Inception网络的某一层来定义的。对于生成图像集和真实图像集,分别通过Inception网络(通常是Inception V3模型)计算它们的特征表示。这一步骤会得到每个图像集的特征向量,计算每个集 合的特征向量的均值和协方差矩阵,并做对比,都是高等数学的课程,这里就不展开说了。FVD和FID接近,相当于把FID的图像特征提取网络换成视频特征提取网络,其他都差不多。最后一个是北大提出来的,就是Trajectory Agent IoU (NTA-IoU),与设定轨迹的交并比,Novel Trajectory Lane IoU (NTL-IoU),与设定车道的交并比。

二是视频本身的长度、帧率和分辨率,要尽可能与传统自动驾驶训练视频达到一致的帧率和分辨率。

目前世界模型生成视频的方向有两个,一个是追求更长、更多视角、更高分辨率,代表作有商汤的《InfinityDrive: Breaking Time Limits in Driving World Models》,华为的《MagicDriveDiT: High-Resolution Long Video Generation》,Wayve的GAIA-1,地平线的DrivingWorld。另一个是追求近乎真实的3D场景渲染,理想在这方面情有独钟,理想的Street Gaussians、ReconDreamer、DriveDreamer4D都是这个方向,也是这个领域的主要代表作。
图片来源:网络

特斯拉用的什么世界模型,自然是未知,也许它根本就没用世界模型。
注:“Ours”指的就是InfinityDrive
图片来源:商汤论文《InfinityDrive: Breaking Time Limits in Driving World Models》

图片来源:华为的MagicDriveDiT

华为不仅能生成超高分辨率,还能生成多个角度的视频。
数据来源:地平线的DrivingWorld,数据尺度比较大,分辨率也很高

我们再来看另一条3D渲染线,它的核心应该说有点偏离世界模型的本来意义了,它是追求接近真实的3D渲染,基本上是理想汽车的独角戏。三个比较有价值的模型基本都有理想汽车的身影,第一个是Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting,浙江大学和理想汽车合作,九位作者,其中来自理想汽车的作者占四位。第二个是DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation,由极佳科技联合中国科学院自动化研究所、理想汽车、北京大学、慕尼黑工业大学等单位提出,十二位作者两位来自理想汽车。第三个是ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration,总共十六位作者,其中来自理想汽车的多达八位,来自极佳科技的有六位。
图片来源:论文《ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration》

上图可以看到,理想汽车与极佳科技合作的最新成果就是ReconDremaer,纯粹StreetGaussians的话,一旦偏离中心视角,容易出现空洞或鬼影,车道线也出现扭曲。
ReconDreamer整体框架, 图片来源:论文《ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration》

除了生成视频,还有生成激光雷达点云视频,如理想与澳门大学合作的《OLiDM: Object-aware LiDAR Diffusion Models for Autonomous Driving》,还有生成语义分割图的《SynDiff-AD: Improving Semantic Segmentation and End-to-End Autonomous Driving with Synthetic Data from Latent Diffusion Models》。
OLiDM的整体框架,图片来源:论文《OLiDM: Object-aware LiDAR Diffusion Models for Autonomous D riving》

上图中,世界模型生成激光雷达点云视频,再拿这个去训练激光雷达的识别能力。
数据来源:论文《OLiDM: Object-aware LiDAR Diffusion Models for Autonomous Driving》

OLiDM的效果,能有两三个点的提升,已经是非常难得了,现在在nuScenes上0.001的提升都需要一年半以上的时间。

世界模型一点也不神秘,不仅是端到端自动驾驶,它对传统自动驾驶也有明显的提升,自动驾驶的数据成本也大幅度下降至少95%以上,那些所谓影子模式变得毫无价值,实际上没有世界模型生成视频,影子模式本身也毫无价值,这也是马斯克说他用扩散模式生成视频的原因,如果影子模式真有价值,何必多此一举?

-- END --
声明:内容源自佐思汽车研究,文中观点仅供分享交流,不代表本公众 号立场,如涉及版权等问题,请您告知,将及时处理!


来源:车路漫漫
汽车自动驾驶控制渲染
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2025-12-10
最近编辑:8月前
李慢慢
硕士 自动驾驶仿真工程师一枚
获赞 14粉丝 93文章 320课程 0
点赞
收藏
作者推荐

给自动驾驶仿真从业者的一份行业薪水调研报告-2024年度

从20万到百万:揭秘自动驾驶仿真工程师的薪资跃迁密码! 作者 | 李慢慢 编辑 | 李慢慢 出品 | 车路漫漫 大家好呀,我是李慢慢。调查自动驾驶仿真从业者的薪资水平这件事,我估计是国内头一个。毕竟薪水这个东西本来也比较敏感,学校不会教、企业不愿透露、政府不在乎,倒是我这个小小公 众号,显得极其合适。于是乎,在刚过完年不久,我就发起了这个问卷调查:《征集帖-自动驾驶仿真的待遇水平到底怎么样呢》,问卷中,我罗列了如下14个选项(前面的问题都是我认为会影响到薪水的变量,最后一个问题则是来自孙工@孙工自动驾驶 的建议,想知道从业久后大家各自的职业规划方向):您的年龄?您的性别?您的学历是?您在智驾领域的工龄是?您所在的单位是什么性质?您的工作地在哪个省份?您在公司的职位是?您现在的工程师等级为?您工作中使用的仿真软件是?您工作中所使用的编程语言是?您的工作内容是?您每周的加班时长是?您的年薪(税前)范围是?如果您想更换工作,您的意向行业是什么?意向岗位是什么? 到如今,调查结束,该问卷发给了 7565 人,有 1288 人阅读,最终有 232 人填写问卷(自动驾驶仿真是一个小圈子,能得到这个数量的反馈已经是极大的成功),截图如下:问卷期间,我也是四处邀请从业的小伙伴填写问卷。第一次群发消息给微 信好友,多有打扰,真的是非常感谢填写的朋友,这里手动笔芯,作为回报,此问卷调查结果文件可以免费提供给填了问卷的小伙伴,请凭借问卷填写截图找我领取哈。(这里也请填了问卷的小伙伴放心,此问卷是填写者匿名的,也未要求填写公司名,问卷结果我也是仔细确认了许多次,是不会暴露填写者身份的。)我相信,这是一把尺子,也是一面镜子。以尺子量化自己的市场价值,以镜子照见自己的环境短板。如果你也是这个领域的从业者,或者有意进入这个领域,那么我相信,相比于你找几个朋友打听所得的极少个例,这篇文章提供的问卷调查结果会全面的多。从宏观上来讲,可以看到仿真的整体分布情况从而判断自身的发展方向;从微观上来讲,通过表格搜索个例,你甚至可能找到你所在意的具体岗位的待遇情况。要说抱歉的是,此文调查不易,分析不易,需付费阅读。付费后,您将会看到如下内容:内容1、14道题数据结果展示,局部截图如下:内容2、薪水影响因素的正交分析。薪水可能不止受一个因素影响,我尽量给出多个影响因素下的薪水变化情况,帮助大家看到更多的可能性。通过这里的分析,我想,知道薪水的天花板只是小节,知道了工龄的尽头从而提前绸缪职业规划才是大事。相关内容:年薪与年龄的关系:我建议你的最好上下车时机年薪与工龄的关系:经验至上,稳住别浪年薪与学历职位的关系:这是本硕的天下天花板下就是我们的江湖内容3、职业进阶路线建议。这个则主要是分析大家的技能手段对职级的影响,从“钱景”出发,有针对性地控制现在的技能提升方向。内容4、彩蛋:围观一下大家对未来的考虑吧。内容5、统计表格下载,以上4部分内容均是根据该表格分析得出的结论。感兴趣的小伙伴可以根据文末的表格自行分析其它方面的数据表格,表格部分内容截图如下:来源:车路漫漫

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈