首页/文章/ 详情

CVIP2025 论文解读 | CARLA中的动态视觉传感器究竟有多真?

8月前浏览259



SYNKROTRON

技术分享周周见




编者荐语:

本文利用 CARLA 的动态视觉传感器(DVS),研究合成事件数据在交通物体检测中的仿真真实性,并通过与真实数据的对比,揭示了仿真与现实的差距为事件相机在交通监控中的应用提供了重要参考。该论文入选全球计算机视觉与模式识别领域顶级会议CVIP 2025。一起来速读全文,洞悉前沿技术动态!



 

 

 

     

亮点直击

  • • 首次对CARLA内置的动态视觉传感器(DVS) 模块生成的事件数据进行系统性仿真到真实差距评估。
  • • 构建了 SeTraM(Synthetic event-based Traffic Monitoring) 数据集,包含多个城市交叉路口的动态交通场景,涵盖不同天气、光照和交通密度条件。
  • • 使用 循环视觉Transformer(RVT) 模型,在不同比例的合成与真实数据组合上进行训练和测试,定量分析域差距。
  • • 实验表明,纯合成数据训练的模型在真实数据测试时性能严重下降,而真实数据比例与模型性能呈现近乎线性的正相关关系
  • • 研究结果突出了当前DVS仿真保真度的局限性,为未来神经形态视觉在交通监控中的域适应技术改进提供了基准
基于事件的视觉捕获的交通对象示例<br>左侧(黑色背景):CARLA DVS模块生成的合成事件<br>右侧(灰色背景):使用物理事件相机(Prophesee EVK 4 HD)记录的eTram数据集真实事件      

总结速览

解决的问题

事件相机在交通监控应用中具有低延迟、高时间分辨率和能效等优势,非常适合实时目标检测。然而,标注真实世界事件数据集的稀缺严重阻碍了鲁棒性事件检测模型的开发。尽管CARLA等仿真工具提供了生成合成事件数据的能力,基于事件的目标检测在仿真与真实场景间的性能差距仍缺乏系统研究。

提出的方案

本研究选择CARLA作为平台,因其内置的动态视觉传感器(DVS)模块能有效模拟真实事件相机的输出。这一特性使其不仅能支持复杂的多智能体交通交互,还能在多变的光照、天气和交通条件下进行基于事件的逼真数据采集。CARLA罕见地结合了逼真的交通模拟与原生事件相机仿真的特性,使其成为评估交通监控场景中合成数据的理想平台。
基于此,本研究训练了一个完全基于CARLA DVS生成的合成数据的循环视觉Transformer模型(RVT)。为了系统量化评估合成数据与真实数据之间的差距,研究构建了SeTraM数据集,设计了七组不同比例的合成/真实事件流数据组合进行测试,定量分析了模型性能随真实数据比例的变化规律。

应用的技术

  • • 事件相机仿真:使用CARLA的sensor.camera.dvs蓝图,通过检测像素亮度的对数变化来模拟事件生成。
  • • 数据集构建:创建SeTraM数据集,包含4个不同城市交叉路口的固定视角交通场景,5个白天和2个夜间序列
  • • 模型选择:采用RVT(Recurrent Vision Transformer) 模型,专门为处理异步事件流的稀疏时空数据而设计。
  • • 数据对齐:采用基于时间的标准化方法,确保合成和真实数据的公平比较。

达到的效果

  • • 定量证明了纯合成数据训练的模型在真实数据上表现不佳(mAP仅4.26%)。
  • • 发现模型性能与训练集中真实数据比例呈近乎线性关系,平均斜率为0.115 mAP/单位真实数据比例
  • • 在验证集上,包含适度真实数据(30%-70%)的混合训练集取得最佳性能(mAP达33.16%)。
  • • 为未来改进仿真保真度和域适应技术提供了定量基准

方法:基于事件的交通监控仿真评估

CARLA DVS工作原理

CARLA通过sensor.camera.dvs蓝图提供对基于事件视觉的原生支持。与传统相机不同,DVS异步捕获每个像素的亮度变化,输出编码为**e = ⟨x,y,t,p⟩**的事件流,其中(x,y)是像素位置,t是时间戳,p是极性(+1或-1)。

当像素点的对数强度变化超过预设阈值时触发事件:

其中C是对比度阈值。CARLA的DVS通过以高频采样连续帧之间的差异来模拟这种行为,在快速运动或动态光照下会生成更多事件。

CARLA DVS生成的事件帧(上行)及其对应的RGB帧(下行)<br>展示了不同视点下的交通对象      

SeTraM数据集构建

SeTraM数据集快照,展示白天、夜间场景和标注实例。      

SeTraM数据集通过以下流程生成:      
  1. 1. 交通仿真:使用CARLA的Python API构建动态城市场景,包含移动的车辆和行人。选择四种交叉路口布局,随机化交通行为以确保多样性。
  2. 2. 传感器部署:在每个交叉路口的角落放置固定观测点,配置RGB和DVS传感器,分辨率设置为1280×720
  3. 3. 数据记录:模拟器以同步模式运行,通过world.tick()逐帧推进。初始化两个队列记录RGB帧和DVS时间戳。
  4. 4. 边界框处理:计算速度超过0.1 m/s的移动目标(车辆和行人)的边界框,确保只标注会触发事件的对象。
  5. 5. 数据存储和格式化:DVS事件流初始保存为.csv文件,随后转换为**.npy和.h5格式**以兼容RVT模型。
训练集数据生成流程:<br>来自CARLA模拟器的四向十字路口场景及真实世界eTram数据集      

实验设计

构建了七个训练数据集,每个数据集保持相同的总时长(约2300秒),但合成(SeTraM)和真实(eTram)数据的比例不同:

数据集ID          
eTram(真实数据)          
SeTraM(合成数据)T          
总时长          
数据集#1          
0%(0秒)          
100%(约2300秒)          
约2300秒          
数据集#2          
15%(约300秒)          
85%(约2000秒)          
约2300秒          
数据集#3          
30%(约600秒)          
70%(约1600秒)          
约2300秒          
数据集#4          
45%(约1000秒)          
55%(约1300秒)          
约2300秒          
数据集#5          
55%(约1300秒)          
45%(约1000秒)          
约2300秒          
数据集#6          
70%(约1600秒)          
30%(约600秒)          
约2300秒          
数据集#7          
85%(约2000秒)          
15%(约300秒)          
约2300秒          

验证集和测试集在所有实验中保持固定,包含52.9%的真实数据47.1%的合成数据

实验与分析

实验设置

使用RVT-Small架构在两个A100 GPU上训练七个模型。训练配置包括:

  • • 每个GPU批量大小为5
  • • 训练6个数据加载工作线程,评估2个
  • • 学习率固定为0.0002236
  • • 最大训练步数400K

验证集性能分析

不同真实数据比例模型的验证集mAP对比      

实验结果显示,使用平衡的合成和真实数据混合训练的模型(数据集#3到#6)表现显著优于纯合成(数据集#1)或主要真实(数据集#7)数据训练的模型。性能在数据集#5附近达到峰值,之后验证mAP下降。

不同训练配置的验证损失曲线      
每个数据集配置的训练损失与轮次关系      

测试集性能评估

随着真实世界数据比例增加,验证mAP的变化情况      

在完全真实的测试数据上,性能与训练数据中真实数据的比例呈现更线性的关系。模型在混合(白天+夜间)测试集上的性能普遍高于仅夜间测试集,表明光照条件等特定领域的变化仍然对仿真到真实的迁移构成挑战。

定性结果展示

模型1到7的预测定性可视化<br>底行显示真实标签,顶行显示模型预测      

定性结果清楚地展示了随着训练数据中真实数据比例的增加,检测质量逐步提升。纯合成数据训练的模型(模型1)几乎无法检测到真实场景中的对象,而包含更多真实数据的模型显示出逐步改善的检测能力。

讨论与结论

实验结果揭示了几个关键发现

  1. 1. 线性改进趋势:模型性能随训练集中真实世界数据比例的增加呈现近乎线性的改进,平均斜率为0.115 mAP/单位真实数据比例
  2. 2. 显著的域差距:尽管利用了CARLA DVS的高保真合成数据,但仅用合成数据训练的模型在真实数据评估中表现不佳
  3. 3. 验证损失不稳定:验证损失的不稳定性表明由于数据分布不匹配导致泛化能力差。
  4. 4. 性能上限:即使使用最先进的RVT-base模型,最大性能仍然有限,纯合成训练无法超过适度的基准

本研究证明了CARLA DVS模块生成的合成事件数据在目标检测任务中无法替代真实世界事件相机数据。尽管取得了一些性能提升,但可测量的仿真-现实领域差距仍然存在,限制了泛化能力和整体模型准确性。

研究结果强调需要:

  • • 更好的仿真保真度
  • • 增强的噪声建模
  • • 与真实传感器行为的对齐
  • • 先进的域适应方法

尽管SeTraM提供了有价值的基准,但真实数据对于高性能基于事件的感知仍然不可或缺。未来的工作应该探索先进的域适应方法、多样化的架构,以及数据特征的差异(如事件稀疏性、真实噪声的缺失以及合成流中时间采样的均匀性),以进一步弥合仿真-现实的差距,提高神经形态视觉系统在真实世界中的实用性。  

来源:车路漫漫
Systempython控制渲染
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2025-12-11
最近编辑:8月前
李慢慢
硕士 自动驾驶仿真工程师一枚
获赞 14粉丝 93文章 320课程 0
点赞
收藏
作者推荐

转型经验分享-从仿真开发到仿真产品,要转变打工思维为老板思维

作者 | X编辑 | X出品 | 车路漫漫大家好,我是X。感谢李慢慢的邀请,我这里也将最近从智驾仿真开发者转型为智驾仿真产品经理的一些思考整理成文字,发出来和大家一起聊聊。这里不谈及个人履历信息和具体产品,仅谈及两份工作给我带来的一些思维的转变,不喜轻喷,也欢迎留言探讨,感谢。以下。跳槽已经一年多了,从仿真平台开发,变成了仿真平台产品。先聊一点,为什么会想上这条路。哈哈,其实就是想见更多的世面,见得够多,才能遇到真的喜欢的那个。需求是什么,怎么实现,是过去一年考虑最多的问题。现在考虑最多的问题是,用户需要完成某某任务,那么平台可以通过什么方式帮助用户完成任务,以及这个方式对于前后端能否实现。这还远远不够,但是已经在路上了,了解更上层的需求,并且评估已有能力能否实现。更完整的链路是,洞察需求的源头,这个任务能帮老板解决什么问题。为什么“洞察需求的源头,了解这个任务能帮老板解决什么问题”是重要的:它是商业的逻辑,而非打工的逻辑。它让你开始思考用户、真实需求、如何提供服务满足需求,进而获取收益;而打工且不想着跳槽的逻辑是,只要我在工位 N 个小时,听别人安排做些事情,我就可以获得一份工资;想着跳槽的时候,那思虑稍微多一些,比如怎么打造简历,怎么获取特定的经验,最终把自己的时间卖个更好的价格。这不是一蹴而就的事情,无论是从洞察行为本身的实施,还是洞察结果的准确性上,都是我们需要持续精进的点。在实施洞察行为的维度,同学一般没有时间和精力在每个需求上都实践洞察行为,我们可以先在心里种下一颗种子,起初可能看手机的时候有这样的一篇帖子顺手点进去看两眼,慢慢地可以演变成有意识地留半小时做思考,再后来在接到任务的时候都可以有意识地跟领导或上游讨论需求的由来。在洞察结果准确性的维度,一开始那就是胡思乱想天马行空,跟实际差距巨大,在跟同领域的人交流后慢慢抽丝剥茧,了解得更多捋得更清楚,再跟其他人交流能 get 的信息就更深层,慢慢洞察事物的根本。ps.我做开发时,看产品就是:我靠,又接需求,手上的还没完呢;跟需求方沟通的时候,这也也能做,那个也没问题,我哪里来的时间做呀!!!就知道压榨人。后来我做产品了,也变成了这般舔狗模样,但我知道这么做是要稳住客户,而不是直接拒绝需求,这算维护客户关系的一部分,所以产品跟开发不在一起办公是有必要的...有助于关系和谐。以上,本文完。来源:车路漫漫

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈