首页/文章/ 详情

自动驾驶仿真新技术,世界通用模型,让智驾路上偶遇大象/犀牛/恐龙...

5月前浏览712

本期转载一篇来自公 众号【自动驾驶之心】的文章,文章格式略有变动。


先看图:

上面这个是原始驾驶视频 👆

下面这些是仿真生成的 👇

反事实生成:道路上出现大象

反事实生成:道路上出现犀牛

反事实生成:道路上出现恐龙

然后再来看看,上面这些仿真泛化场景是怎么产生的吧。

如下。

#自动驾驶仿真 领域长期面临三大挑战:

1. 多视角数据采集成本高
2. Corner Case 覆盖困难
3. 仿真与真实场景差距大

一套多视角采集系统动辄百万级成本,而实际路测中几乎不可能系统性地覆盖"大象横穿马路"这类极端场景。


今年 2 月,Waymo 联合 Google DeepMind 重磅发布了 Waymo World Model(Waymo的世界模型),基于 Genie 3 构建,能生成超逼真的多传感器仿真数据,把行车记录仪视频变成可控仿真环境,甚至能让大象、恐龙"上路"——为 Corner Case 验证提供了全新思路。



但 Waymo World Model 依赖闭源生态,数据和模型均未开放。我们能否不依赖闭源体系,用开放数据走出另一条路?


来自中科院自动化所和 CreateAI 的 NeoVerse 给出了回答:不依赖昂贵的多视角采集设备,而是从百万级互联网单目视频中学习,构建通用的 4D 世界模型,在自动驾驶仿真中实现了单目→多视角生成、长尾物体反事实场景构建、相机轨迹与焦距控制等核心能力——并且完全开源。


论文链接https://arxiv.org/abs/2601.00393

项目主页https://neoverse-4d.github.io

开源代码https://github.com/IamCreateAI/NeoVerse


NeoVerse 自动驾驶应用展示

单目变环视:从行车记录仪视角到多目视角

环视多视角数据是感知训练和闭环仿真的基础,但现实中大量存量数据来自单目行车记录仪,难以直接用于多视角仿真


NeoVerse 能从单个行车记录仪视频出发,通过 4D 重建与新视角生成,自动产出多个视角的仿真视频。这意味着大量的行车记录仪数据可以被低成本地转化为环视仿真资源,大幅扩展仿真数据的供给。这一能力与 Waymo World Model 提出的"Dashcam to Simulation"理念不谋而合——不同的是,NeoVerse 不需要闭源多视角采集系统。


单视角生成多视角示意图



行车记录仪视角


多视角生成对比


反事实 Corner Case 生成:大象、犀牛、恐龙直接"上路"

长尾场景覆盖是自动驾驶安全验证的核心挑战。真实道路上几乎不可能采集到"大象横穿马路"或"恐龙出现在路口",但自动驾驶系统必须具备应对能力。仅靠路测来覆盖这些场景,效率极低且不可控。


Waymo World Model 展示了在仿真中生成大象、穿着恐龙衣的行人等长尾场景的能力。NeoVerse 同样可以在真实驾驶场景中插入各类长尾物体,生成高保真的反事实视频——以下是在同一段真实驾驶视频中,分别插入大象、犀牛、恐龙后的效果:


原始驾驶视频


反事实生成:道路上出现大象


反事实生成:道路上出现犀牛


反事实生成:道路上出现恐龙


这些反事实场景生成为 Corner Case 的自动化构建提供了高效方案,能够系统性地扩展自动驾驶测试场景库。


自由视角漫游:支持任意相机轨迹渲染


仿真不仅需要固定视角。传感器位姿鲁棒性测试、场景理解可视化、数据增强等任务都需要灵活的视角控制能力。


NeoVerse 支持在重建的 4D 场景中进行任意相机轨迹的渲染,用户可以自由定义视角和路径,实现驾驶场景的多角度漫游。


场景1:原始视频 vs 自由相机轨迹


场景1:相机轨迹控制结果


场景2:原始视频 vs 自由相机轨迹


场景2:相机轨迹控制结果


场景编辑:精准修改场景元素


仿真数据多样化的一个常见需求是:同一个场景,能否快速生成不同的外观变体? 例如将前方车辆从白色修改为黄色或红色。


NeoVerse 结合 SAM2 等分割工具,可以对驾驶场景中的特定目标进行精准编辑,且编辑结果在时间维度上保持一致。这一能力可用于仿真数据多样化数据增强


原始驾驶视频


编辑效果:车辆变为黄色


编辑效果:车辆变为红色


相机抖动控制:按需去抖或加抖


行车记录仪视频常因路面颠簸产生抖动,影响后续处理和标注质量。传统 2D 稳像算法仅做像素级对齐,难以保证几何一致性。另一方面,在仿真中有时也需要反向操作——在平稳视频上人为添加抖动,模拟崎岖路段的采集效果,用于测试感知算法的鲁棒性。


NeoVerse 通过 4D 重建获取全局场景结构后,可以灵活地重新规划相机轨迹:既能平滑化处理崎岖路段的抖动视频,也能在正常行驶视频上施加抖动模拟崎岖路况——两个方向的控制均基于对场景 4D 结构的理解,而非简单的像素变换。


原始抖动视频


去抖处理结果


原始平稳视频


加抖处理结果


变焦控制:支持相机焦距动态调整


除了相机位姿控制,NeoVerse 还支持对相机焦距(视场角)的动态调整。在重建的 4D 场景中,用户可以自由切换不同焦距,实现从广角(短焦、大视野)到长焦(小视野、局部放大)的连续变焦效果。这一能力可用于仿真中不同传感器配置的模拟,以及对特定区域的细节观察。


原始视频


变焦效果:默认焦距 → 短焦(广角)→ 长焦(特写)


技术方案:重建-生成混合架构


NeoVerse 的核心思想是将 4D 重建视频生成有机结合,构建"重建-生成"混合架构——让模型既能理解场景的 4D 结构,又能生成高质量的新视角视频。

框架



整体技术方案包含以下关键组件:


前馈式 4DGS 重建:基于 VGGT 构建免位姿的前馈式 4D Gaussian Splatting 重建器,输入一段单目视频,无需预估相机位姿,秒级(2-10 秒)完成 4D 场景重建。


双向运动建模:每个 4D Gaussian 额外携带双向速度、角速度和生命周期参数。通过交叉注意力机制同时建模前向(t→t+1)和后向(t→t-1)运动特征,精确描述动态场景中物体的运动。


稀疏重建 + 密集渲染:双向运动建模带来了时间插值能力——对稀疏关键帧重建后,通过双向运动对非关键帧进行 Gaussian 插值,实现密集帧渲染,显著提升训练效率。


在线单目退化模拟:要从百万级单目视频中学习,核心难题在于单目视频只有一个视角,如何构造"输入-目标"训练对?NeoVerse 通过三种机制解决:

  • 基于可见性的 Gaussian 裁剪:模拟遮挡效应
  • 平均几何滤波器:模拟飞边像素和几何畸变
  • 退化渲染条件注入:将退化后的 RGB、深度图、不透明度掩码和 Plucker 嵌入作为条件输入

     
在线单目退化模拟



这套机制使模型能够从退化的单目渲染中学习恢复出高质量的多视角输出,从而让训练可以扩展到百万级互联网单目视频——这正是 NeoVerse 数据可扩展性的关键所在。


实验亮点:速度与质量双重领先


NeoVerse 在重建和生成两个维度均取得了 SOTA 表现:

✅ 重建质量:静态和动态场景重建 benchmark 均达 SOTA

✅ 生成质量:在 400 个样例中通过 Vbench 评测全面领先现有方法

✅ 推理速度:重建 2-10 秒 + 生成 18 秒 = 总计仅需 20-28 秒

重建表1
重建表2
生成

速度与质量的双重优势,使 NeoVerse 具备了实际部署自动驾驶仿真流水线的潜力。


一句话总结


NeoVerse 证明了不依赖闭源多视角采集系统,开放数据 + 开源代码也能构建强大的 4D 世界模型。


从单目行车记录仪视频出发,NeoVerse 以"重建-生成"混合架构为核心,高效实现了 4D 重建与多视角生成、反事实 Corner Case 构建、自由视角漫游、场景编辑、相机抖动控制和变焦调整等丰富应用。它与 Waymo World Model 的技术愿景高度一致,但走出了一条开放、可扩展、完全开源的路——降低了 4D 世界模型的技术门槛,也为社区提供了可复现的基线。

    


来源:车路漫漫
通用自动驾驶控制渲染
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-20
最近编辑:5月前
李慢慢
硕士 自动驾驶仿真工程师一枚
获赞 14粉丝 93文章 320课程 0
点赞
收藏
作者推荐

自动驾驶测试的4大“显眼包”:LogSim/WorldSim/SIL/HIL,终于分清了

大家好呀,我是李慢慢。最近工作中,总是要跟各种各样的新手/外部门的同事反复解释什么是logsim,什么是HIL,和worldsim有啥区别,和SIL是什么关系,搞得我也很头大,于是写了这篇文章,下次再来问我,我就发这个文章给ta看。真省事。 搞自动驾驶相关的小伙伴,不管是做仿真的、做产品设计的,还是做算法开发的,大概都有过这样的崩溃瞬间:1)开会时别人聊LogSim和WorldSim聊得热火朝天,你在旁边假装点头,心里疯狂OS“这俩到底啥区别?”;2)被问“SIL和HIL哪个先做”,嘴巴张了半天,蹦不出一句完整的话;3)尤其是初次接触这些词汇的新手,更是听得云里雾里,甚至有人把LogSim当成SIL的“亲戚”,把WorldSim和HIL混为一谈,场面尴尬到能用脚抠出三室一厅。 其实真不怪我们笨,主要是这四个“选手”名字太像,又总被绑在一起说,乍一看就像孪生四兄弟,难辨真假。今天咱就放下专业术语的“架子”,用最接地气、最诙谐的方式,把这四位“大佬”的底细扒得明明白白,看完保证你再也不闹笑话,开会发言都能挺直腰板!先划重点:LogSim和WorldSim是“场景界的俩极端”,LogSim靠“回忆”过日子,WorldSim靠“脑补”造世界;SIL和HIL是“测试界的上下级”,SIL在电脑里“纸上谈兵”,HIL连真硬件都搬来“实战演练”。两者不是一回事,但经常组队干活,就像奶茶里的珍珠和芋圆,虽然不一样,搭在一起才够味。第一组:场景界的“真假美猴王”——LogSim vs WorldSim先给这俩定个性:它们俩的核心任务,都是给自动驾驶的“大脑”(算法)搭“练车场”,但一个是“实景回放”,一个是“虚构剧本”,差别大到离谱。LogSim:老实人实锤,只搬“真实录像”的“回放员”LogSim这名字,拆开来念就好懂:Log是“日志”,就是实车跑在路上时,传感器录下的所有数据(比如路上有多少车、行人走得多快、红绿灯怎么变);Sim是“仿真”,说白了就是把这些日志数据“回放”一遍,让算法再“走一遍”真实的路。咱举个通俗的例子:LogSim就像你开车时,行车记录仪录下了全程,事后你把录像调出来,再看一遍自己当时怎么开的、路上发生了啥。只不过这里的“观众”,是自动驾驶算法;“目的”,是让算法看看“真实世界里,我上次遇到这种情况,处理得对不对”。它的优点很明显:真实、靠谱、不掺水。毕竟数据都是实车跑出来的,路上的突发 情况(比如行人突然横穿马路、电动车逆行、前车突然急刹)、复杂路况(比如暴雨天、大雾天、堵车),都是最真实的场景,没有一点“虚构”成分。比如路测时遇到需要人工接管的危险情况,这些“惊险瞬间”都会被LogSim记录下来,后续用来迭代算法,帮算法“吸取教训”,下次再遇到就不会慌了。但缺点也很致命:死板、不灵活,不能“改剧本”。录下来的数据是啥样,回放就是啥样,你想改改“如果当时行人走得再快一点,算法 会怎么处理”?不行!想加个“路上突然出现一只小狗”的场景?也不行!它就像个老实巴交的回放员,只负责照搬录像,多一句废话、多一个动作都没有,主打一个“原汁原味”,也主打一个“墨守成规”。 WorldSim:脑洞达人,靠“脑补”造世界的“编剧+导演”和LogSim的“老实”相反,WorldSim就是个“脑洞大开的造梦师”。World是“世界”,Sim是“仿真”,意思就是它不依赖任何真实路测数据,全靠人工预设参数,“编”出一个虚拟的驾驶世界。还是举例子:WorldSim就像你玩赛车游戏,游戏里的赛道、车辆、行人、红绿灯,都是游戏开发者编的,不是真实世界里的路;你可以设置“路上只有一辆车”,也可以设置“堵车堵到怀疑人生”;可以设置“晴天”,也可以设置“暴雨+大雾”,甚至可以设置“外星人横穿马路”(虽然现实中不会有,但仿真里能用来测试算法的极限)。 它的优点正好和LogSim互补:灵活、任性、想咋改就咋改。算法需要练什么场景,就编什么场景;哪里练得不好,就反复调整场景参数,直到算法练会为止。比如要测试算法的自动紧急制动(AEB)功能,就可以用WorldSim预设“前车突然急刹”的场景,反复测试,直到算法能100%反应过来,而且还能调整前车的速度、距离,测试各种极端情况。缺点也很直接:不够真实,有点“纸上谈兵”。毕竟是人工编的场景,再逼真,也比不上真实世界里的“混乱”——真实路上的行人不会按你的预设走路,电动车不会按你的参数逆行,总有各种意想不到的突发 情况,这些都是WorldSim编不出来的。而且WorldSim有个“小前提”:默认算法的“眼睛”(感知)是正常工作的,不用测试感知的准确性,只专注于算法的决策和控制能力,这点和LogSim的“全真实回放”差别很大。总结一下LogSim和WorldSim:LogSim是“真实但死板的回放机”,WorldSim是“灵活但虚构的造梦机”;一个帮算法“复盘过去”,一个帮算法“演练未来”;实际工作中,两者往往一起用——先用WorldSim让算法“打基础”,练会各种常规场景,再用LogSim让算法“见世面”,适应真实世界的混乱,缺一不可。现在是不是觉得,这俩“显眼包”的区别,比奶茶和咖啡还明显?第二组:测试界的“上下级”——SIL vs HIL如果说LogSim和WorldSim是“练车场”,那SIL和HIL就是“考试环节”——它们的核心任务,是测试自动驾驶的“大脑+手脚”(算法+硬件)好不好使,能不能应对各种情况。但两者的“考试难度”天差地别,一个是“笔试”,一个是“实操”,而且必须先过笔试,才能进实操。先澄清一个最常见的误区:很多人把SIL和LogSim、WorldSim搞混,觉得“SIL就是用WorldSim测试”“LogSim属于HIL”,其实大错特错!SIL和HIL是“测试方式”,LogSim和WorldSim是“测试场景”——不管是SIL还是HIL,都可以用LogSim的场景,也可以用WorldSim的场景,就像不管是笔试还是实操,都可以考“基础题”,也可以考“难题”,场景是“考题”,测试方式是“考试形式”,别再弄混啦!SIL(Software-in-the-Loop):软件在环,电脑里的“纸上谈兵”选手翻译一下:Software是“软件”(就是自动驾驶的算法代码),Loop是“闭环”,合起来就是“让算法软件在一个虚拟的闭环里跑测试”。说白了,就是所有测试都在电脑上完成,没有任何真实的硬件——不用实车,不用控制器(ECU),不用传感器,就靠一台电脑,装着算法代码和仿真场景(LogSim或WorldSim),让它们“自己玩”,然后看算法的表现。 类比一下:SIL就像你想考驾照,还没摸过真实的车,先在电脑上玩“驾考模拟器”,熟悉方向盘、刹车、油门的操作,看看自己能不能顺利通过科目二、科目三。模拟器里的赛道(场景),可以是真实考场的复刻(类似LogSim),也可以是随便编的赛道(类似WorldSim);你操作的“方向盘”“刹车”,都是电脑上的虚拟按钮(类似算法代码),全程不用碰真实的车。它的核心作用,是“筛错”——把算法里最基础、最明显的错误先筛掉,比如算法分不清红绿灯、不会转弯、遇到障碍物不知道避让,这些低级错误,在SIL阶段就解决掉,不用等到后续用真实硬件测试,节省时间和成本。而且SIL测试成本极低,只要有电脑就能搞,还能一次性跑上千个场景,效率超高,堪称“算法的入门考官”。缺点也很明显:太“虚拟”,脱离现实。它只测试算法代码好不好使,不考虑真实硬件的“脾气”——比如真实的控制器(ECU)运行速度会不会跟不上算法?传感器传输数据会不会有延迟?这些问题,SIL测试完全测不出来,毕竟它连真实硬件都没有,就像你在模拟器上开得再溜,真正摸车时,还是会紧张、会出错一样。HIL(Hardware-in-the-Loop):硬件在环,搬来真家伙的“实战演练”大佬HIL比SIL高一个级别,也更“硬核”——翻译一下:Hardware是“硬件”(比如自动驾驶的控制器ECU、传感器、执行器),Loop是“闭环”,合起来就是“让真实的硬件,和虚拟的场景闭环联动,做实战测试”。 简单说,HIL就是把自动驾驶的“手脚”(真实硬件)搬过来,和电脑里的“大脑”(算法)、“练车场”(场景)连在一起,模拟真实开车的场景,让它们一起“干活”。比如,把真实的ECU(相当于自动驾驶的“大脑中枢”)连接到电脑上,电脑里运行LogSim或WorldSim的场景,场景里的红绿灯、障碍物信息,会传输给真实的ECU,ECU再发出指令,控制虚拟的车辆(或真实的执行器)做出反应,整个过程和真实开车几乎一模一样,只不过车辆和道路是虚拟的,“大脑”是真实的。类比一下:HIL就像你考驾照时,教练坐在副驾,你开着真实的车,在真实的考场里练车——你(算法)操作方向盘、刹车(真实硬件),考场(场景)是真实的,教练(测试系统)在旁边看着你,一旦出错,就及时指出来。而且HIL还能模拟各种极端情况,比如高速爆胎、突发暴雨,这些情况在真实路上测试太危险,在HIL里就能放心测,既安全又高效。它的核心作用,是“验证”——验证算法和真实硬件能不能“好好配合”,能不能应对真实世界的复杂情况。比如,ECU运行算法时会不会卡顿?传感器传输数据有延迟时,算法能不能及时反应?这些问题,只有HIL能测出来,毕竟它用的是真实的硬件,和实际装车后的情况几乎一致。而且HIL测试是自动驾驶落地前的“关键一关”,过不了HIL,就别想实车路测,更别想量产。缺点也很实在:贵、复杂。一套完整的HIL测试系统,动辄几百万、上千万,不是一般公司能承受的;而且搭建起来很复杂,需要专业的工程师调试,测试效率也比SIL低(毕竟要联动真实硬件,不能像电脑那样快速批量测试),堪称“自动驾驶测试界的奢侈品”。终极总结:一张表分清4大“显眼包”,再也不混淆怕大家记不住,咱直接上“懒人总结表”,一看就懂,收藏起来,开会忘了就偷偷瞄一眼:选手名称 身份定位 核心特点 通俗类比 LogSim 场景界·真实派 实车数据回放,真实但死板,不能改场景 行车记录仪回放录像 WorldSim 场景界·虚构派 人工预设场景,灵活但不真实,可随意改 赛车游戏里的虚构赛道 SIL 测试界·入门级 全电脑测试,只测算法,成本低、效率高 电脑上玩驾考模拟器 HIL 测试界·进阶级 真实硬件+虚拟场景,实战测试,贵且复杂 真实硬件+虚拟考场练车 最后补一句:别再乱搭CP啦!再澄清一个最容易犯的错误:LogSim≠SIL,WorldSim≠HIL!它们的正确搭配是:1. SIL测试(电脑上):可以用LogSim的真实场景,也可以用WorldSim的虚构场景,核心是“没有真实硬件”;2. HIL测试(有真实硬件):也可以用LogSim的真实场景,也可以用WorldSim的虚构场景,核心是“有真实硬件,联动测试”;3. LogSim和WorldSim:可以单独用,也可以一起用,比如先用WorldSim让算法练基础,再用LogSim让算法适应真实场景;4. SIL和HIL:必须先做SIL,再做HIL,就像先考笔试,再考实操,一步都不能少,而且两者都过了,才能进入下一步的实车路测,最终实现自动驾驶落地。所以,我们在说某种测试方法时,可以说LogSim-SIL,LogSim-HIL,也可以说WorldSim-SIL,或者WorldSim-HIL,这样描述,才能精准的表达一种测试方法。备注,要是能带上开环or闭环这样的字样,就更完美啦,关于开闭环,稍微有点复杂,我们后面再介绍哦。看到这里,相信你再也不会把这四个“显眼包”搞混了吧?其实自动驾驶仿真没那么神秘,说白了就是“给自动驾驶算法找地方练手、找地方考试”,LogSim和WorldSim是练车场,SIL和HIL是考试环节,各司其职,又相互配合,一起帮自动驾驶“从新手变成老司机”。当然啦,咱们今天聊的LogSim、WorldSim、SIL、HIL,只是自动驾驶仿真领域最基础、最常见的“入门款”。除了这四位“显眼包”,还有不少“同门师兄弟”——比如场景转换常用的log2world,还有DIL、VIL等其他测试方法,每一种都有自己的专长,也有各自的局限。自动驾驶软件质量的守护,从来不是靠某一种工具、某一个方法就能完成的,更需要每一位从业者满怀敬畏之心,不盲从、不片面,学会取长补短,把每一种工具的优势用到位,把每一处细节的漏洞堵严实,才能守住软件质量的底线,让自动驾驶真正变得安全、可靠。看到这里,相信你再也不会把这四个“显眼包”搞混了吧?以后再有人问你这四个词的区别,直接把这篇文章甩给他,或者用咱今天说的类比,通俗易懂地讲一遍,保证对方对你刮目相看!如果还有啥不懂的,评论区留言,咱再接着唠~以上。 关于自动驾驶仿真的定义 PanoSim与Autoware联合仿真-如何构建自动驾驶远程接管系统 跨越“仿真到实车”的鸿沟:如何构建端到端高置信度验证体系? 来源:车路漫漫

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈