hdy 发表于 2025-6-9 23:00

实时3D检测大飞跃:RCAlign以DRA和RFE模块,NDS提升4.3%、mAP提升8.4% !


近年来,基于雷达和相机融合的3D目标检测算法表现出优异的性能,为它们在自动驾驶感知任务中的应用奠定了基础。现有方法主要集中于处理雷达与相机之间因领域差异导致的特征错位问题。然而,现有方法要么在对齐过程中忽略了跨模态特征的交互,要么未能有效对齐跨模态同一空间位置的特征。为缓解上述问题,作者提出了一种新的对齐模型,称为雷达相机对齐(RCAlign)。具体而言,作者设计了一个基于对比学习的双路对齐(DRA)模块,用于对齐和融合雷达与相机的特征。此外,考虑到雷达BEV特征的Sparse性,作者提出了一个雷达特征增强(RFE)模块,利用知识蒸馏损失来提高雷达BEV特征的稠密化。实验表明,RCAlign在公共nuScenes基准数据集上实现了雷达相机融合3D目标检测的新最优性能。此外,与最新的最优方法(RCBEVDet)相比,RCAlign在实时3D检测中实现了显著的性能提升(NDS提升4.3%,mAP提升8.4%)。一 引言一种可行的解决方案。因此,准确感知车辆周围的环境至关重要。三维目标检测是自动驾驶感知领域的一个重要研究方向,它能够对周围环境中的物体进行精确的定位和分类。近年来,多视角三维目标检测, , , , , 在性能上取得了显著进展。目前,摄像头被广泛用作三维目标检测的主要采集设备。然而,摄像头在恶劣环境下表现不佳,且对物体深度的建模效果不佳。雷达被用作辅助传感器,因为它适用于解决上述问题,且成本较低。通过结合相机提供的丰富语义信息与雷达捕获的精确深度信息,可以提升三维目标检测的鲁棒性和可靠性。然而,由于模态间的领域差异,如何精确对齐雷达获取的同一物体,是一个挑战。手稿创建于2020年10月;该工作由IEEE出版技术部门开发。该工作根据项目公共许可证(LPPL)( http://www.latex-project.org/ )版本1.3发布(LPPL版本1.3的副本包含在所有于2003/12/01或之后发布的基础IAIgX文档中)。此处表达的观点完全属于作者本人。不作任何明示或暗示的保证。用户承担所有风险。在融合过程中,相机传感器非常关键。为了更好地对齐这两种模态的数据,研究行人提出了一系列对齐方法,这些方法可以大致分为两类:密集鸟瞰图(BEV)对齐方法和SparseBEV对齐方法。密集BEV对齐方法使用可变形注意力机制来更新一种模态的特征。如图1(a)所示,这些方法使用图像BEV特征( Query )通过可变形注意力机制在雷达BEV特征(值)中找到代表同一目标的特征,然后用于更新相应的图像BEV特征。上述过程同样应用于雷达BEV特征( Query )。可变形注意力机制在关联代表不同模态的同一目标的特征方面是有效的,但它不能保证两种模态的更新特征在相应位置精确地代表同一目标。当使用融合块来融合它们时,这是次优的。与这些方法不同,SparseBEV对齐方法、、使用可变形注意力机制分别从两种模态数据中提取特征,然后用于更新Sparse Query 。具体来说,如图1(b)所示,这些方法使用Sparse Query 对环境中的目标进行建模,然后使用可变形注意力机制分别找到图像特征和雷达BEV特征中的相关特征来更新Sparse Query 。使用Sparse Query 作为中间枢纽可以对齐雷达和图像中代表同一目标的特征。然而,它们没有考虑模态间的特征交互。总之,现有的对齐方法要么在对齐过程中没有考虑模态间的特征交互,要么无法有效对齐跨模态的同一空间位置的特征。基于上述分析,作者重新设计了Sparse Query 在SparseBEV对齐方法中的路由路径,并提出了一种名为RCAlign的新型雷达相机对齐模型,用于三维目标检测。RCAlign不仅能在对齐过程中实现模态间的特征交互,还能保证跨模态表示同一目标的特征的对齐,从而确保特征表示的一致性和准确性。具体而言,如图1(c)所示,作者开发了一个双路对齐(DRA)模块,该模块通过两条路由路径分别更新Sparse Query 。随后,使用对比损失对两条路径更新后的Sparse Query 进行对齐。此外,考虑到雷达BEV特征的Sparse性,作者提出了一个雷达特征增强(RFE)模块,该模块通过知识蒸馏损失增强雷达BEV特征的表示能力,并允许其与图像特征进行更有效的融合。在nuScenes基准数据集上的实验结果表明了RCAlign的有效性。与现有工作相比,作者的工作具有以下贡献。作者提出了一种基于Sparse鸟瞰图(BEV)对齐方法的三维目标检测雷达相机对齐模型,称为RCAlign。在adas-RCAlign_2504中,提出了一种双路径对齐模块,以更高效地对齐两种模态的特征,并在对齐过程中执行跨模态交互。作者设计了一个雷达特征增强(RFE)模块,通过知识蒸馏损失来获取增强的雷达BEV特征,以便更好地与图像特征融合。大量实验表明,RCAlign在nuScenes基准测试上取得了新的最先进性能,在nuScenes测试集上的结果为67.3% NDS。相关工作在本节中,作者简要介绍了与作者的研究相关的近期发展,重点关注三个主题:基于相机的三维目标检测、雷达-相机三维目标检测以及对比学习。基于相机的三维目标检测近期3D目标检测的研究重心已从基于像素值(PV)的方法、、、、转向基于鸟瞰图(BEV)的方法、、、、、,这是由于PV方法在遮挡、视角变换等方面面临诸多挑战。基于BEV的方法可分为密集型BEV方法、、、、、、和基于 Query 的方法、、、、。密集型BEV方法通常采用提升-喷溅-射击(LSS)将图像特征转换至BEV空间。BEVDet系列、、成功将LSS引入3D目标检测并取得优异性能。考虑到LSS在深度估计上的不准确性,BEVDepth引入激光雷达对预测深度进行监督。随后,为获取更精确的速度信息,引入时序信息、、进一步提升了3D目标检测性能。基于 Query 的方法通常预先定义一些Sparse Query 来建模目标,再利用 Query 索引相关图像特征。在DETR3D首次引入3D目标检测Sparse Query 后,涌现出大量基于Sparse Query 的方法。PETR采用3D位置编码将图像特征转换为3D位置感知特征,实现端到端3D目标检测。在StreamPETR中,设计了一种包含Sparse Query 的记忆队列来存储时序信息。鉴于基于 Query 的方法无需建模背景且相较于密集型BEV方法效率更高,本研究基于基于 Query 的方法设计了RCAlign。B. 雷达-相机三维目标检测雷达在获取目标的多普勒速度和距离方面表现出色,几乎不受复杂环境条件的影响,且具有成本效益。因此,雷达可以作为相机的优秀辅助传感器,用于低成本三维目标检测。近年来,基于雷达与相机融合的三维目标检测算法、、、、、已被证明是有效的,并取得了显著的性能。类似于多视角图像三维目标检测的研究方向,研究行人最初专注于研究PV空间、、。他们建立了将雷达点与图像中物体相关联的方法。CenterFusion使用 Frustum 将雷达点与物体相关联。考虑到雷达投影位置的误差,RADIANT校正了雷达点投影位置,并设计了特定的规则,使用欧几里得坐标将雷达点与图像中的物体相关联,而CRAFT则使用极坐标进行这种关联。对于基于BEV的方法,为了获得更精确的图像BEV特征,CRN利用雷达辅助将图像特征从PV转换为BEV。之后,他们将雷达特征和图像特征连接起来作为Sparse Query ,并采用可变形注意力来对齐两种模态的特征。与CRN通过Sparse Query 获得不同,SparseFusion3D使用预定义的Sparse Query 作为中间状态来对齐两种模态的特征。这类方法在对齐过程中不进行跨模态交互。RCBEVDet设计了一个新的 Backbone 网络来提取雷达特征,然后使用雷达特征或图像特征作为Sparse Query 来 Query 另一种模态的特征以对齐特征。然而,它们未能实现不同模态特征之间的真正对齐。为了缓解上述问题,作者设计了一个具有对比损失的 双路对齐模块,该模块能有效对齐跨模态表示同一物体的特征。C. 对比学习对比学习, , 旨在将同类样本拉近,同时将不同类样本推远。该方法已应用于目标检测领域,以拉近表示同一目标的特征。SoCo采用对比学习来最大化通过不同增强方法获取的表示同一目标的特征的相似性。为了获得对比感知的候选嵌入,FSCE设计了对比分支,利用对比学习来最大化类内一致性及类间差异性。CAT-Det在点 Level 和目标 Level 利用对比学习进行数据增强,显著提高了检测精度。因此,使用对比学习能够增强表示同一目标的特征的相似性。在此,作者利用对比学习来对沿两条路由路径更新后的Sparse Query 进行对齐。III. 提出方法如第一部分所述,现有的雷达与相机融合对齐方法要么在对齐过程中忽略了模态间特征的交互,要么无法在对应位置对齐特征。因此,作者提出了一种新颖的对比学习雷达相机对齐方法(RCAlign),以缓解上述问题。在本节中,作者首先描述RCAlign的整体结构。随后,分别详细介绍了RCAlign中的多模态特征提取以及所提出的DRA和RFE模块。A. 整体架构如图2所示,所提出的RCAlign包括图像主干网络、雷达主干网络、雷达 Head 、双路对齐模块、雷达特征增强模块和3D检测 Head 。在多模态特征提取阶段,图像主干网络和雷达主干网络分别用于提取多视角图像PV特征和雷达BEV特征。随后,雷达BEV特征通过雷达 Head 进行处理,以获得3D框中心和雷达热力图。接着,从雷达热力图中获取的top 概率值对应的雷达点被提取作为Sparse Query 的一部分。除了雷达 Query 外,Sparse Query 还包含初始 Query 和时间 Query 。Sparse Query 、图像PV特征和雷达BEV特征被输入到所提出的DRA模块中,以对齐和融合两种模态的特征。之后,融合特征用于预测类别和3D框。最后,考虑到雷达BEV特征的Sparse性,作者将预测的3D框中心投影到BEV网格中作为占用特征,占用特征和雷达BEV特征被输入到RFE模块中,以获得增强的雷达BEV特征。增强的雷达特征用于蒸馏原始雷达特征,引导网络优化以获取更密集的雷达特征。B. 多模态特征提取对于图像分支,给定从个视图中获取的图像 I E RNCHW,作者使用 Backbone 网络和FPN 来提取多视图图像PV特征。对于雷达分支,给定与图像对应的雷达数据,作者首先聚合五个连续的雷达帧。在聚合过程中,作者引入速度来补偿先前帧中雷达点位置坐标。具体而言,对于位于帧的雷达点,作者使用以下公式进行位置补偿:点和分别代表注意力权重和采样偏移。 和表示线性层的权重。作者将更新后的Sparse Query 表示为 。对于图像PV特征 ,使用对进行聚合可以表示如下:其中和分别表示雷达点在时间和的坐标, 和分别表示雷达点在时刻的速度以及时间和之间的时间间隔。最后,作者使用 PointPillar 提取雷达 BEV 特征。C. 双路对齐为了更好地对齐两种模态的特征,并在对齐过程中进行跨模态特征交互,作者提出了双路对齐(Dual-Route Alignment,DRA)模块。DRA通过将图像PV特征和雷达BEV特征聚合到Sparse Query 上,实现对齐和融合。如图3(a)所示,DRA包括两条路由路径,每条路径都经过两次可变形注意力进行跨模态特征交互。随后,两条路径更新后的Sparse Query 使用融合模块进行对齐和融合。具体而言,对于上述路径,给定Sparse Query ,雷达BEV特征和参考其中和表示线性层的权重, 和分别表示注意力权重和采样偏移。更新后的Sparse Query 用表示。对于下一条路径,执行相同的操作,但在雷达BEV特征之前对图像PV特征进行聚合。更新后的Sparse Query 用表示。经过上述操作后, 和被设计为在相应位置表示同一物体,它们的特征应该具有相似的语义。因此,作者引入对比学习来对齐和在相应位置的特征,其计算公式为:其中和表示归一化特征。、 和分别代表矩阵乘法、logit尺度化和目标矩阵。 表示交叉熵损失。最后,作者使用逐元素加法得到融合 Query,这些 Query 用于3D目标检测任务。D. 雷达特征增强雷达数据是通过聚合五个连续帧获得的,但与激光雷达相比,它们仍然Sparse。考虑到融合 Query 的数量远超真实地面框的数量,会出现多个 Query 预测同一框的情况。由于大多数预测框代表同一目标时具有较低的分类概率,它们相对于真实地面框存在一定偏差,但也包围了它们。因此,利用3D框的预测中心来增强雷达特征是可行的。基于此,作者设计了雷达特征增强模块。如图3(b)所示,原始雷达BEV特征和占用特征被输入到RFE中以获得增强的雷达特征。具体来说,作者首先将融合 Query 预测的3D框中心转换为BEV网格以获取占用特征。随后,雷达BEV特征和占用特征在通道维度上进行拼接,拼接后的特征被输入到一个3层卷积块中以获得增强的雷达BEV特征。该卷积块由一个卷积层、批归一化和ReLU组成。获得增强的雷达BEV特征后,一方面,它们被输入到雷达头中作为第二个辅助任务,与第III-A节中提到的雷达头共享参数。另一方面,它们被用于通过知识蒸馏蒸馏原始雷达特征,引导网络优化到能够获得增强雷达特征的方向。知识蒸馏过程可以计算如下:其中和分别表示雷达BEV特征的身高、宽度和通道数。 表示增强的雷达BEV特征。E. 损失函数在此,作者总结包含三维目标检测任务损失、对应两个雷达头的损失和、对比损失以及知识蒸馏损失的损失函数。最终的优化目标可以表示为:其中和是超参数。IV. 实验在本节中,作者使用nuScenes数据集对RCAlign进行了广泛的实验。首先,作者将RCAlign与其他相关的基于相机和雷达相机融合方法在3D目标检测和跟踪任务中进行比较。随后,作者进行了严格的消融实验,以验证所提出模块的有效性。接着,作者进行了可能影响模型性能的关键参数分析。最后,作者进行了鲁棒性分析实验。上述实验结果验证了所提出模型的有效性。A. 实验设置数据集与指标。nuScenes数据集是一个公开的大型自动驾驶数据集,包含1000个驾驶场景。其中750个场景用于训练,150个用于验证,剩余150个用于测试。nuScenes数据集中的每个场景持续时间为20秒,并以2~Hz的频率进行标注。每个场景的数据由6个提供360度全景视野的摄像头、5个雷达和1个激光雷达捕获。标注的3D框最初分为23个类别,在评估期间聚合为10个类别以进行3D目标检测任务。平均平均精度(mAP)、nuScenes检测分数(NDS)、平均平均平移误差(mATE)、平均平均尺度误差(mASE)、平均平均方向误差(mAOE)、平均平均速度误差(mAVE)和平均平均属性误差(mAAE)用作3D目标检测的评估指标。作者将3D目标跟踪的平均多目标跟踪精度(AMOTA)、平均多目标跟踪精度(AMOTP)、假阳性(FP)数量、假阴性(FN)数量和身份切换(IDS)数量与其他方法的3D目标跟踪结果进行比较。实现细节。作者使用ResNet50 、ResNet101和V2-99 作为 Backbone 网络来提取图像特征。R50和R101用于nuScenes验证集,它们在ImageNet 和nuImages 上进行了预训练。V2-99用于nuScenes测试集,并从DD3D 初始化。作者使用作为雷达特征。点云范围在X和ΔY轴上设置为[-51.2m, 51.2m],在Z轴上设置为[-5.0m, 3.0m]。雷达 Backbone 网络遵循FUTR3D 的架构。雷达 Head 采用CenterNet ,作为辅助任务,作者将其简化为仅保留 Heatmap 和3D框中心的预测。3D检测 Head 与DETR3D 相同。在训练过程中引入了二维监督损失和 Query 去噪。所有实验均未使用CBGS和TTA策略。对于图像和BEV数据增强,作者遵循PETR,雷达数据对应于执行BEV数据增强时的变换。与其他最先进方法相比,参照StreamPETR,该模型训练60个epoch。在消融实验中,模型训练24个epoch。使用AdamW优化器优化模型,学习率设置为4e-4。采用余弦退火策略更新学习率。模型进行端到端训练。雷达 Query 数量设置为30。和设置为1,设置为5。作者通过mmdetection3D框架实现RCAlign,并在NVIDIA 3090 GPU上进行训练。表1 NUSCENES VAL 集合上的比较。'C' 和 'R' 分别代表相机和雷达。 主干网络受益于视角预训练。表2 NUSCENES VAL 集合上按类别平均精度(AP)的比较.'C.V., PED., M.C., 和 T.C. 分别表示施工车辆、行人、摩托车和交通锥。B. 与当前最先进方法的比较在本节中,作者首先展示了RCAlign及其他最先进方法在nuScenes验证集和测试集上的3D目标检测结果。随后,展示了RCAlign在nuScenes验证集上的可视化结果。最后,作者给出了RCAlign在3D目标跟踪中的结果。在验证集上进行3D目标检测。作者在表1中将RCAlign与nuScenes验证集上的最先进方法进行了比较。 (1) 使用R50 主干网络和输入分辨率,RCAlign在基于相机的方法和雷达相机融合方法中均表现优异,包括最新的最先进方法CRN 和RCBEVDet 。与RCBEVDet相比,NDS和mAP均有显著提升,分别提高了和。 (2) 据作者所知,这是首个在实时3D目标检测中实现NDS超过的雷达相机融合算法。 (3) 此外,使用R50主干网络的RCAlign甚至在使用R101主干网络和输入分辨率的情况下,也能超越CRN。 (4) 当模型大小和图像大小增加到R101和时,RCAlign仍然可以超越所有之前基于相机的方法或雷达与相机融合方法。除了NDS和mAP的显著提升,mAVE也取得了显著进步。mAVE的提升归因于雷达能够捕获有关物体速度的信息。课前在验证集上的平均精度(AP)分析。为了更好地展示RCAlign的性能,作者对表2中雷达和相机融合模型的课前AP进行了分析。从表中可以看出,除了障碍物类之外,所有其他类别的性能都得到了提升。特别是对于行人,这类目标通常较小或成簇,与CRN相比,性能显著提升,提高了11.5%。对于障碍物类别,与CRN相比,性能几乎相同。在mAP方面,与其他雷达和相机融合方法相比,作者也观察到显著的提升。3D目标检测在测试集上的表现。对于nuScenes测试集,作者使用V2-99 Backbone 网络,输入分辨率为。表3表明RCAlign在现有最先进方法上取得了显著进步。与RCBEVDet相比,NDS指标提升了,mAP指标提升了。此外,RCBEVDet 将 Baseline (BEVDepth)结果的NDS指标提升了,mAP指标提升了。相比之下,RCAlign将 Baseline (StreamPETR)结果的NDS指标提升了,mAP指标提升了,超越了RCBEVDet。以上分析表明RCAlign能够取得优异结果,从而验证了所提出模型的有效性。表3 在NUSCENES测试集上的比较。'C'和'R'分别代表相机和雷达。图4. Rg. Th e nd ida 地形与概率分布图。图a和图b分别展示了密集种群中预测的成功与失败案例。GT表示真实情况。表4 NUSCENES测试集上3D物体跟踪的比较可视化结果。作者在图4中展示了相机视图(左侧)和鸟瞰视图(右侧)的可视化结果。在鸟瞰视图中,RCAlign能够呈现优异的检测结果,特别是在橙色圆圈中突出显示的密集人群区域。然而,正如绿色圆圈所示,存在一些失败案例,其中某些物体要么被误检,要么被漏检。这可能是由于车辆距离较远导致检测效果较差所致。图5提供了不同天气条件下的更多可视化结果。从图中可以看出,RCAlign在各种天气条件下都能获得更接近真实情况的检测结果。在测试集上的3D目标跟踪。如表4所示,与采用V2-99主干网络的其它最先进方法相比,RCAlign在AMOTA和AMOTP上均取得了最佳性能。与BEVNext相比,AMOTA提升了2.7%。在添加ConvNext-B主干网络后,RCAlign在AMOTA上仍表现最佳,这是nuScenes测试集上3D目标跟踪最主导的评价指标。与CRN相比,RCAlign在AMOTA上提升了3.6%。对于其它指标,RCAlign取得了最佳或接近最佳的性能。表5 提出DRA和RFE的消融研究。C、R、DA、SDA、RH和SRH分别表示相机分支、雷达分支、可变形注意力、二次可变形注意力、雷达头和二次雷达头。表6 使用不同采样方法选择雷达点的比较 SM和FPS分别表示采样方法和最远点采样表7 使用不同对齐损失(AL)对齐来自两个路径的Sparse Query 的比较。COS 和 CL 分别表示余弦损失和对比损失。C. 消融研究为了验证RCAlign的重要组件的有效性,在本部分中,作者对DRA、REF及其包含的子模块进行了消融实验。DRA的有效性。在表5 (a)中,作者验证了DRA每个子模块的有效性。(1) 首先,作者在第一行呈现了StreamPETR 与可变形注意力( Baseline )的结果。然后,向 Baseline 添加一个雷达分支(Rbaseline),并使用可变形注意力聚合两种模态的特征,从而在NDS上提升了5.1%,在mAP上提升了7.4%。这部分证明雷达确实可以辅助3D目标检测以获得更好的性能。(2) 接着,向Rbaseline添加对比损失或第二个可变形注意力,从第3行和第4行可以看出,添加DRA的任何子模块都可以在NDS和mAP上提升Rbaseline的性能。对于mATE和mAOE,观察到相同的结果。上述结果表明,所提出的对齐策略和跨模态特征交互对Rbaseline是有益的。(3) 最后,将两个子模块都添加到Rbaseline,从而进一步提升了性能。(4) 总之,通过添加DRA,模型在NDS上优于 Baseline 6.6%,在mAP上优于 Baseline 9.5%,并超越Rbaseline在NDS上1.5%,在mAP上2.1%。nuScenes数据集上的实验结果验证了DRA的有效性。RH和RFE的有效性。作者对雷达头(RH)和RFE模块进行了消融实验,结果展示在表5(b)中。(1)作者首先介绍基于DRA模块的RH模块,这带来了NDS提升0.2%。(2)随后,作者使用第二个雷达头(SRH)对增强的雷达BEV特征进行分类和回归,NDS和mAP可以进一步改进,分别提升了0.2% NDS和0.4% mAP。(3)此外,通过利用知识蒸馏损失,NDS和mAP分别提升了0.4%和0.7%。在添加RH和RFE后,NDS和mAP均增加了0.8%。因此,RH和RFE的有效性得到验证。(4)值得注意的是,与 Baseline 相比,提出的RCAlign将NDS提升了7.4%,mAP提升了10.3%。即使是针对设计的Rbaseline,RCAlign也实现了显著改进,NDS和mAP分别提升了2.3%和2.9%。D. 参数分析在此,作者分析了模型中的重要参数。这包括不同雷达点采样方法的影响、不同对齐损失的影响,以及对比损失和蒸馏损失权重的影响。采样方法的影响。如图2所示,雷达点在雷达头之后被选中作为Sparse Query 的一部分。在此,作者分析了不同雷达点采样方法对实验结果的影响。如表6所示,(1)作者首先采用随机采样方法,NDS和mAP都表现很差。(2)随后,作者使用最远点采样(FPS),该方法在PointNet++中被采用,作者选取雷达点中对应最高概率值的点作为初始点。与随机采样相比,NDS和mAP有所改善,但mATE和mAOE有所下降。(3)最后,作者尝试选取雷达 Heatmap 中对应前k个概率值(Topk)的雷达点。与前两种方法相比,这种方法在NDS、mAP、mATE和mAOE上均有所提升。(4)因此,作者选择Topk作为雷达点的选择方法。表8 拉伸损失权重的影响对齐损失的影响。作者实验了三种不同的对齐损失,用于在两条路由路径之后对Sparse Query 进行对齐。如表7所示,(1)作者最初使用L1损失来对齐DRA中的两个Sparse Query ,但结果较差。(2)当对齐损失改为余弦损失时,整体指标有显著提升。这是由于尽管两条路由路径采样的特征相同,但不同的采样顺序意味着最终的特征表示应该只有语义相似性,而不是强制特征值也完全相同。(3)之后,作者将对齐损失修改为对比损失,可以看到所有指标都进一步得到提升。与余弦损失相比,对比损失不仅拉近相同位置特征的相似性,还同时在一定程度上将不同位置的特征推远。(4)基于以上分析,作者选择对比损失用于两条路由路径的对齐。 的影响。作者进行了实验,研究对比损失权重和知识蒸馏损失权重如何影响模型在公式6中的性能。如表8所示,随着的增加,所有指标先增加后减少,当对比损失的权重设置为1时,模型达到最佳性能。同样,表9显示,当知识蒸馏损失的权重设置为5时,模型表现最佳。E. 鲁棒性分析表10 不同光照和天气条件下的鲁棒性分析使用MAP指标一个稳健的检测算法对于提升自动驾驶中的车辆安全性至关重要。因此,作者在不同的天气和光照条件下进行了稳健性实验。遵循CRN ,作者使用R101 Backbone 网络和输入分辨率,如表10所示,与雷达相机融合方法相比,RCAlign在各种天气和光照场景中均实现了最先进的性能。此外,由于雷达不受天气或光照条件的影响,RCAlign甚至在雨天和夜间场景中优于基于激光雷达的方法(CenterPoint)。上述实验结果表明,RCAlign在不同天气条件下既有效又稳健。表9 蒸馏损失权重的影响V. 结论在本文中,作者提出了一种用于雷达与相机融合的新型对齐模型RCAlign。首先,作者设计了DRA,它包含两个可变形注意力机制和一个融合模块。这两个可变形注意力机制用于跨模态特征交互。融合模块利用对比损失对齐特征,并通过逐元素相加融合来自两种模态的特征。随后,考虑到雷达特征的Sparse性,作者设计了一个雷达特征增强模块,该模块通过知识蒸馏损失利用预测的3D边界框中心来密集化原始雷达特征。此外,作者引入了一个作用于原始雷达特征和增强雷达特征的雷达 Head ,作为辅助任务。最后,通过结合上述损失和3D目标检测任务损失来优化所设计的模型。在nuScenes基准数据集上进行的广泛实验表明,所提出的RCAlign目前达到了最先进的性能。同时,严格的消融实验验证了作者提出的DRA和RFE的有效性。

页: [1]
查看完整版本: 实时3D检测大飞跃:RCAlign以DRA和RFE模块,NDS提升4.3%、mAP提升8.4% !