SYNKROTRON
技术分享周周见
编者荐语:
本文利用 CARLA 的动态视觉传感器(DVS),研究合成事件数据在交通物体检测中的仿真真实性,并通过与真实数据的对比,揭示了仿真与现实的差距,为事件相机在交通监控中的应用提供了重要参考。该论文入选全球计算机视觉与模式识别领域顶级会议CVIP 2025。一起来速读全文,洞悉前沿技术动态!
事件相机在交通监控应用中具有低延迟、高时间分辨率和能效等优势,非常适合实时目标检测。然而,标注真实世界事件数据集的稀缺严重阻碍了鲁棒性事件检测模型的开发。尽管CARLA等仿真工具提供了生成合成事件数据的能力,基于事件的目标检测在仿真与真实场景间的性能差距仍缺乏系统研究。
本研究选择CARLA作为平台,因其内置的动态视觉传感器(DVS)模块能有效模拟真实事件相机的输出。这一特性使其不仅能支持复杂的多智能体交通交互,还能在多变的光照、天气和交通条件下进行基于事件的逼真数据采集。CARLA罕见地结合了逼真的交通模拟与原生事件相机仿真的特性,使其成为评估交通监控场景中合成数据的理想平台。
基于此,本研究训练了一个完全基于CARLA DVS生成的合成数据的循环视觉Transformer模型(RVT)。为了系统量化评估合成数据与真实数据之间的差距,研究构建了SeTraM数据集,设计了七组不同比例的合成/真实事件流数据组合进行测试,定量分析了模型性能随真实数据比例的变化规律。
CARLA通过sensor.camera.dvs蓝图提供对基于事件视觉的原生支持。与传统相机不同,DVS异步捕获每个像素的亮度变化,输出编码为**e = ⟨x,y,t,p⟩**的事件流,其中(x,y)是像素位置,t是时间戳,p是极性(+1或-1)。
当像素点的对数强度变化超过预设阈值时触发事件:
其中C是对比度阈值。CARLA的DVS通过以高频采样连续帧之间的差异来模拟这种行为,在快速运动或动态光照下会生成更多事件。
构建了七个训练数据集,每个数据集保持相同的总时长(约2300秒),但合成(SeTraM)和真实(eTram)数据的比例不同:
验证集和测试集在所有实验中保持固定,包含52.9%的真实数据和47.1%的合成数据。
使用RVT-Small架构在两个A100 GPU上训练七个模型。训练配置包括:
实验结果显示,使用平衡的合成和真实数据混合训练的模型(数据集#3到#6)表现显著优于纯合成(数据集#1)或主要真实(数据集#7)数据训练的模型。性能在数据集#5附近达到峰值,之后验证mAP下降。
在完全真实的测试数据上,性能与训练数据中真实数据的比例呈现更线性的关系。模型在混合(白天+夜间)测试集上的性能普遍高于仅夜间测试集,表明光照条件等特定领域的变化仍然对仿真到真实的迁移构成挑战。
定性结果清楚地展示了随着训练数据中真实数据比例的增加,检测质量逐步提升。纯合成数据训练的模型(模型1)几乎无法检测到真实场景中的对象,而包含更多真实数据的模型显示出逐步改善的检测能力。
实验结果揭示了几个关键发现:
本研究证明了CARLA DVS模块生成的合成事件数据在目标检测任务中无法替代真实世界事件相机数据。尽管取得了一些性能提升,但可测量的仿真-现实领域差距仍然存在,限制了泛化能力和整体模型准确性。
研究结果强调需要:
尽管SeTraM提供了有价值的基准,但真实数据对于高性能基于事件的感知仍然不可或缺。未来的工作应该探索先进的域适应方法、多样化的架构,以及数据特征的差异(如事件稀疏性、真实噪声的缺失以及合成流中时间采样的均匀性),以进一步弥合仿真-现实的差距,提高神经形态视觉系统在真实世界中的实用性。