首页/文章/ 详情

2026年,3DGS和世界模型,在自动驾驶仿真中的组合应用

6月前浏览600

 

大家好呀,我是李慢慢。

先说结论:

2026年,自动驾驶仿真赛道将持续升温。

回顾2025年,两大仿真新技术快速走进公众视野,分别是世界模型(World Model)与3DGS(3D Gaussian Splatting,3D高斯泼溅)。

关于世界模型,此前也写了挺多科普文章,甚至发布了一些视频效果,感兴趣的小伙伴可以去后台搜了看看,本文就不展开了。

而关于3DGS,我则一直觉得很神秘,因此特地做了一些探索,甚至申请到了商用软件来试用,因此本文就3DGS怎么嵌入到自动驾驶仿真流程中,做一些肤浅的探索。

1、3DGS与世界模型的路线差异

3DGS和世界模型,听起来都很“高大上”。

虽然都是在做仿真,但在我看来是两种截然不同的技术路线。本文不谈公式和理论,我们尽量用通俗的语言快速理解其核心逻辑。

一句话总结世界模型:AI 构建的数字世界模拟器,复刻现实规律,能推演事件发展与结果。例如,向世界模型输入一段视频、图片或文字描述,它就能自动生成后续连贯的视频内容。

一句话总结3DGS:这是一种基于点云优化的3D高斯分布表征技术,可实现高保真动态三维场景的快速渲染。简单来说,它是一种革新性的三维建模技术——使用者只需手持扫描设备对目标物体或场景扫描一圈,就能直接生成对应的三维模型(过程如下图所示)。这种模型的细节纹理与真实世界高度贴合,使得整个仿真过程兼具高效性与逼真度,对传统三维建模技术形成了降维打击。

图片来源:视频号-扎克力

所以,你看出来了吗?3DGS与世界模型属于两条截然不同的技术路线

3DGS是在传统仿真技术的基础上,对三维建模环节进行革新,属于“老树开新花”的迭代升级;

世界模型则走的是AIGC技术路线,通过直接生成所需仿真数据,完全跳过三维建模步骤,属于“大力出奇迹”的颠覆式创新。

前者,我愿称之为基于规则的仿真,rule-based simulation。

后者,我愿称之为基于端到端的仿真,e2e-based simulation。

没想到吧,智驾领域的技术路线之争,也在仿真赛道同步上演。

扯远了,还是来继续看看,3DGS到底能不能解决传统仿真技术中“自动驾驶感知仿真难”的痛点吧。

2、实操验证:aiSim软件的3DGS功能开箱体验

感知仿真难,也就是传感器的仿真难。

自动驾驶最重要的三类传感器:摄像头、激光雷达、毫米波雷达。其中,激光雷达与毫米波雷达的感知置信度难以量化定义,因此本文以摄像头仿真为例,直观呈现3DGS在智驾仿真中的实际效果——毕竟摄像头仿真的逼真度,可通过肉眼做个简单判断。

此前我曾介绍过一些3DGS开源工具,但这类工具的易用性普遍欠佳。而在商用仿真软件中,目前已知仅aiSim搭载了3DGS功能。为此,我特意向康谋科技(原虹科自动驾驶事业部)申请了试用许可(license),完成了初步的开箱体验。

图片:aiSim仿真界面-GUI

作者寄语:使用aiSim的感觉和传统的仿真传感器类似,也是要创建地图,然后编辑场景,然后配置主车的动力学,配置各类传感器,外接自动驾驶算法,做场景泛化和大规模仿真等等。如果你已经掌握了一个仿真软件,那么迁移到这个软件应该是非常快的,像我,就是线下找aiSim的小伙伴,花了半天就感觉已经掌握它了(有点飘了哈哈),另外,aiSim也是支持xosc和xodr的,所以历史的场景库什么的迁移也是方便。

但是,这些都不是重点,毕竟你有我有全都有,不值得说道。

但但是,aiSim集成了3DGS的功能,让我着实觉得有点开眼界了。下面的软件界面,做了一个对比,一个是调用的传统手段建模的3D地图,一个是调用的3DGS建模的3D地图。结果就是,仿真效果肉眼可见的真实了不少。以前的仿真就像是放动画片似的,调用3DGS地图后,路面和外景等就更像是我们真实在道路上看到的效果了。

图片:aiSim仿真界面-手搓地图

图片:aiSim仿真界面-3DGS地图

以前觉得3DGS很神秘,但是使用软件体验下来,发现唯一的变化竟然只是,搭建场景的时候选择什么地图

这是什么意思呢?

具体来说,aiSim中的动态场景仍通过OpenSCENARIO协议设计,而对于协议中调用的静态地图(OpenDRIVE格式),既可以选用传统工具(如RoadRunner)搭建的地图(动画感较强,真实度有限),也可以选用3DGS生成的地图(纹理细节更贴近真实场景)。以下视频将直观对比两种建模方式的仿真效果。

视频:传统建模仿真 VS 3DGS建模仿真

可见,3DGS本质上只是一种高效的建模手段。未来,它大概率会成为自动驾驶仿真软件的一个标准化组件——用户可选择3DGS生成的静态场景地图,再在此基础上定义动态场景,例如添加各类交通参与者,构建完整测试场景。

视频:3DGS建模仿真-添加交通参与者

浅尝了一下aiSim的3DGS的仿真效果,接下来畅想一下未来3DGS应用到自动还是仿真测试的流程。

如果3DGS能在解决感知仿真问题然取得突破,那么接下来的一些工程化应用将成为重点。

3、流程变革:3DGS对仿真测试工作流的优化

3.1. 传统仿真测试流程

以前的传统的仿真测试可能大概是这样的:

  1. 1. 智驾产品定义中有新的功能需求发布啦;
  2. 2. 仿真小伙伴收到需求,开始构思具体的测试用例该有哪些,以完整的覆盖产品需求;
  3. 3. 测试用例制定完毕,交给上游产品们进行评审,确认无误后就开始画场景。一般都是基于某款仿真软件徒手制作静态地图,然后定义各种动态场景,形成场景库;
  4. 4. 在仿真工具链中集成被测对象(智驾软件),然后开始进行仿真测试;
  5. 5. 跑完一轮仿真测试,输出测试报告,然后推动软件开发进行迭代;

3.2. 集成3DGS后的流程优化

无需手动绘制地图,通过3DGS快速生成——采集实景数据(如十字路口、特定车辆)导入工具,即可自动生成高精度三维模型/地图,大幅缩短场景搭建周期,降低人工成本。

流程图:3DGS在仿真测试的工作流

作者寄语: 在使用aiSim的过程中,我发现相应的地图非常大,动辄几十个G,这对于工程化部署非常不利,3DGS格式的3D地图或者3D模型,必须支持客户自定义编辑,以实现模型瘦身、局部细节调整、地图组装等功能,那么一款3DGS的可视化编辑器是非常有必要的。

4、展望:3DGS的潜力与局限

3DGS的核心价值的是解决“场景还原度与建模效率”的矛盾,未来大概率会成为自动驾驶仿真软件的标准化组件。但它能否成为感知仿真的终极破局者,仍取决于两大关键:一是海量实景数据的积累与训练,二是理论研究的深入(解决伪影、场景模糊等技术痛点)。

值得注意的是,3DGS的技术门槛较高,并非企业可轻易自研,这或将帮助头部仿真软件供应商构建核心竞争壁垒,进一步促进行业分化(各司其职-这在我看来才是一个健康的产业)。在智驾端到端技术普及的当下,唯有攻克仿真置信度难题,3DGS才能在闭环测试、训练数据生成等核心场景中发挥更大价值

3DGS和世界模型的协同

3DGS并非自动驾驶仿真的“终极答案”,但无疑是破解感知仿真置信度困境的关键突破口。3DGS和世界模型并不是“非此即彼”的单选题,而是可以组合使用,互相取长补短,形成互补。

这种互补格局的核心的是技术短板互抵、能力边界互补,围绕“高保真、高效率、全场景覆盖”的核心需求形成协同范式:

1)3DGS以实景扫描为基础,提供高保真静态场景基底,解决世界模型“虚拟失真”与“仿真-实车gap”问题,为其提供真实数据锚点;

2)世界模型则凭借逻辑推演与场景生成能力,快速拓展长尾、极端场景,弥补3DGS对稀缺场景采集成本高、覆盖不足的短板,同时借助3DGS的真实数据反哺自身优化。

随着两者技术的持续迭代与商业化落地,这种“实景基底+虚拟拓展”的协同模式,将推动自动驾驶仿真从“辅助验证工具”向“核心闭环环节”转型,为端到端智驾技术的快速落地提供核心支撑。

让我们拭目以待吧。

 


来源:车路漫漫
理论自动驾驶科普渲染
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-02-12
最近编辑:6月前
李慢慢
硕士 自动驾驶仿真工程师一枚
获赞 14粉丝 93文章 320课程 0
点赞
收藏
作者推荐

实战演练|最新版CARLA 0.9.16结合NVIDIA COSMOS进行数据合成

作者 | 张峻川编辑 | 李慢慢出品 | 车路漫漫仿真最前沿干货来袭,建议先收藏。CARLA官方最新发布的版本 《CARLA 0.9.16 发布啦》 大家都看了嘛?其中包含了和NVIDIA联合开发的三项重大前沿功能:Cos mos Transfer,SimReady和NuRec,今天笔者就Cos mos Transfer合成数据功能进行简单尝试。不知道Cos mos的小伙伴戳这个链接可以补补课《英伟达的Cos mos是个什么东东》。CARLA和Cos mos的联合仿真的官方文档可见文末参考链接[1]。首先进行整体思路介绍:1、CARLA根据保存的场景回放或新搭建场景录制数据,产生如物体边缘edge视频、深度depth视频、分割semantic_segmentation视频等;2、上面这些视频作为NVIDIA cos mos transfer1的控制条件输送给推理模型,推理模型根据提示词prompts生成所需要风格的视频数据。如下是实操过程,想看效果的请直接跳转至文末。1. CARLA视频生成安装编译CARLA 0.9.16版本软件后,根目录下包含以下脚本PythonAPI/examples/nvidia/cos mos/client/carla_cos mos_gen.py,该脚本可以读取PythonAPI/examples/nvidia/cos mos/client/example_data/logs/inverted_ai路径下CARLA提供的示例场景记录log,还原仿真场景并渲染出传感器数据,合成视频输出。命令如下:python carla_cos mos_gen.py \ -f ${PWD}/example_data/logs/inverted_ai/iai_carla_synthetic_log_1731622446_actorPOV4641_startTime3.7s_log.log \ --sensors cos mos_aov.yaml \--class-filter-config filter_semantic_classes.yaml \-c 4641 -s 0.0 -d 5.0 -o output 需要注意的是,在carla_cos mos_gen.py脚本的video_writer_worker函数中,记录视频的长度被固定成了120帧(帧率fps是24,120帧也就是5s时长),读者可按需修改。但需要注意增长时长给后面cos mos transfer1推理带来的性能压力。carla_cos mos_gen.py运行成功后,会在执行目录下保存rgb、rgb_edge、semantic_segmentation、depth、rgb_masked、instance_segmentation等视频,部分效果如图1所示。图1-CARLA仿真生成的视频2. cos mos transfer1推理部署官方文档给出了两个进行cos mos transfer1推理的option:一个是使用官方在NVIDIA Brev云服务器上部署好的服务(图2),另一个是将官方提供的推理docker部署在用户本地。图2-NVIDIA Brev云服务器CARLA官方在NVIDIA Brev配备的是H100多卡算力,价格昂贵,所以笔者决定使用第二种方法。由于笔者没有本地的高算力显卡,所以也需要在云服务器上做部署,但在云服务器中再部署docker,需要处理复杂的网络proxy问题,因此第二种方法也不太方便实现。通过研究PythonAPI/examples/nvidia/cos mos下的client和server两个文件夹下的代码,我发现,CARLA在server端使用web应用开发框架gradio实现了一个app interface,包裹了一下cos mos transfer1的模型调用代码,在client端cos mos_client.py也将通过gradio将一次推理所需的提示词、控制条件等传输给server,server再调用co s mos transfer1完成推理。cos mos_client.py的调用示例如下:python cos mos_client.py http://url_to_server:port \example_data/prompts/rain.toml \--output outputs/ \--input-video example_data/artifacts/rgb.mp4 \--edge-video example_data/artifacts/edges.mp4 \--depth-video example_data/artifacts/depth.mp4 \ # optional--seg-video example_data/artifacts/semantic_segmentation.mp4 \--vis-video example_data/artifacts/vis_control.mp4 \ # optional--seed 2048 因此我们完全可以省略官方docker和其中的gradio框架,直接将cos mos transfer1部署在所选用的云服务器上。cos mos transfer1的github链接[2]中有详细的部署步骤,在此不再赘述。[2]中的examples文件夹下有cos mos transfer1推理的详细介绍,只要和[1]进行对照,我们就可以很方便地将[1]中cos mos_client.py给server输入的参数转换成cos mos transfer1所需要的输入,直接调用模型进行推理。在此补充一些笔者实际部署时的配置:虽然官方文档中强调需要使用H100进行推理,但实践证明A100单卡也可以完成推理任务。笔者的配置是CPU 64核,96G内存,A100,80G显存。运行推理时的巅峰内存消耗在50G+,显存消耗60G。完成一个CARLA toml配置文件中的任务,合成5s视频所需时长约20分钟。关键配置参数中,减少num_steps也就是减少diffusion步数会显著缩短推理时间,但显然也会导致输出质量下降。3. cos mos transfer1合成效果最后,附上几个视频展示cos mos transfer1的视频合成效果。以下CARLA视频全部来自PythonAPI/examples/nvidia/cos mos/client/example_data/logs/中的记录,提示词等输入全部来自PythonAPI/examples/nvidia/cos mos/client/example_data/prompts/文件夹。效果1:右转效果2:左转效果3:直行参考链接:1. https://carla.readthedocs.io/en/latest/nvidia_cos mos_transfer/2. https://github.com/nvidia-cos mos/cos mos-transfer1 以上,本文完。后续,车路漫漫还会继续推出关于世界模型/3DGS等新型仿真技术的应用探索,欢迎各位小伙伴持续关注。来源:车路漫漫

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈