hdy 发表于 2025-6-11 23:47

ALN-P3:统一协同蒸馏框架,用于自动驾驶感知、预测和规划的统一语言对齐,提升决策与推理能力 !

近期研究探索了将大语言模型(LLMs)集成到端到端自动驾驶系统中,以增强泛化能力和可解释性。然而,现有大多数方法仅限于驾驶性能或视觉-语言推理,难以同时实现这两方面。本文提出ALN-P3,一个统一的协同蒸馏框架,引入了"快速"视觉自动驾驶系统与"慢速"语言驱动推理模块之间的跨模态对齐。ALN-P3包含三种新颖的对齐机制:感知对齐(P1A)、预测对齐(P2A)和规划对齐(P3A),这些机制明确地将视觉 Token 与感知、预测和规划全栈中的相应语言输出对齐。所有对齐模块仅在训练阶段应用,在推理阶段不产生额外成本。在nuScenes、NuX、TOD3Cap和nuScenes QA四个具有挑战性的基准测试上的大量实验表明,ALN-P3显著提升了驾驶决策和语言推理能力,取得了最先进的结果。1 引言端到端自动驾驶系统,集成了感知、预测和规划(统称为P3栈),近年来取得了显著进展(Hu等人,2022年,2023年;Jiang等人,2023年;Weng等人,2024年;Jia等人,2025年)。这些系统因其低延迟性能常被描述为“快速”,适用于在现实世界环境中进行实时部署。然而,它们在推理、泛化能力和可解释性方面面临显著局限,因为它们通常仅基于多视角相机输入运行,并且缺乏基于常识知识的理解。为解决这些不足,近期研究探索了在自动驾驶流程中使用基础模型,例如大语言模型(LLMs)和视觉语言模型(VLMs)(Hwang等人,2024;Sima等人,2024;Ma等人,2025;Renz等人,2025;Wang等人,2025)。这些模型结合了视觉和语言信息来执行P3任务,并提供了更强的推理和解释能力(Hwang等人,2024)。然而,由于推理时间长,这些模型通常被称为“慢速”系统,这仍然是实际部署的主要障碍。自动驾驶研究中的另一个重要方向是"快慢"系统的开发(Tian等人,2024b)。在该范式下,"快"系统负责处理核心P3任务,如规划,而"慢"系统并行运行,为所采取的行动提供可解释性和推理能力。尽管这种架构为可解释性方面的长期挑战提供了一种有前景的解决方案,但两个系统之间的交互尚未得到充分利用,以使两个数据流都能受益。在现有研究中,"快速"系统中的预训练特征被简单地传递到"缓慢"系统中以增强其语言输出(Ding等人,2024)。然而,很少关注明确地将"快速"系统的感知、预测和规划组件与"缓慢"系统的推理进行对齐。因此,当前的"快-慢"系统往往在两个分支之间存在不一致性,导致在现实世界自动驾驶系统中性能欠佳。为应对这些挑战,作者提出了ALNP3,这是一个集成了视觉和语言对齐的新框架,覆盖了整个自动驾驶流程。ALN-P3是一种仅用于训练的联合蒸馏策略,通过使"慢速"和"快速"系统对齐来提升两者的性能,同时在推理时不对"快速"系统引入任何额外的计算成本。这种设计使ALN-P3适用于实际部署,其中低延迟决策对于实用性至关重要。具体而言,ALN-P3引入了三个对齐模块:感知对齐(P1A)、预测对齐(P2A)和规划对齐(P3A)。这些模块将基于BEV的视觉表示从“快速”系统与其对应的基于语言的表示从“慢速”系统连接起来。具体来说,P1A将实例级BEV特征与目标级字幕对齐,P2A将预测的运动轨迹与以Agent为中心的语言输出对齐,最后P3A将ego车辆计划与与规划相关的自然语言响应对齐。所有对齐模块仅在训练过程中应用,在推理时不会增加任何计算成本。这使得ALN P3适用于自动驾驶系统的实时部署。作者在四个具有挑战性的基准数据集上进行了广泛的评估研究:nuScenes、NuX、TOD3Cap和nuScenes QA。ALN-P3始终提升了"快速"系统中的规划性能和"慢速"系统中的推理准确率。例如,与先前的规划器相比,它将平均碰撞率降低了27%,并在Nu-X驾驶解释任务上将CIDEr得分提高了28%。作者的主要贡献总结如下:
[*]作者提出了ALN-P3,一种新颖的协同蒸馏框架,该框架在整个自动驾驶感知、预测和规划(P3)堆栈中引入了“慢速”系统和“快速”系统之间的对齐。
[*]ALN-P3集成了三个对齐模块——感知对齐(P1A)、预测对齐(P2A)和规划对齐(P3A),用于在每个核心驾驶任务中明确对齐两个系统之间的视觉和语言表征。
[*]ALN-P3是一种仅用于训练的方法,在推理过程中不会产生额外的计算成本,因此高效且适用于自动驾驶系统的实时部署。
[*]在四个具有挑战性的基准测试上的大量实验表明,ALN-P3在规划和推理任务上始终优于现有方法,验证了所提出的跨系统共蒸馏策略的有效性。
2 相关工作2.1 端到端自动驾驶自动驾驶系统由感知、预测和规划任务(P3)组成。虽然这些任务传统上被分别训练和优化,但联合训练和优化所有三个任务的端到端系统已引起更多关注,因为它们显示出显著的性能提升(Chen等人,2024a;Hu等人,2023;Jiang等人,2023;Li等人,2024;Weng等人,2024)。这些仅依赖视觉的方法通常被称为“快速”系统,因为它们具有低延迟推理能力(Tian等人,2024b)。在这些工作中,UniAD在端到端自动驾驶系统的快速涌现和采纳中发挥了关键作用。具体而言,UniAD采用光栅化表示并执行面向规划的优化,用于端到端自动驾驶(Hu等人,2023)。随后,VAD提出了一种矢量化表示以降低计算成本(Jiang等人,2023)。在另一项工作中,PARA-Drive和DriveTransformer引入了并行架构,以进一步提升端到端自动驾驶系统的效率(Weng等人,2024;Jia等人,2025)。2.2 自动驾驶的视觉语言模型视觉语言模型(VLMs)已成为端到端自动驾驶的一种替代方案。这些模型利用视觉和语言信息,因其推理时间较长(Tian et al., 2024b)而被称为"慢速"系统。值得注意的是,由Waymo开发的EMMA(Hwang et al., 2024)对Gemini(Google, 2024)的多模态大语言模型进行了微调,用于自动驾驶任务。EMMA处理原始相机输入和文本数据,生成多种驾驶输出,包括规划轨迹、感知目标和道路图元素。通过将非传感器输入和输出表示为自然语言文本,EMMA最大限度地发挥了预训练大语言模型的世界知识效用,使其能够在统一的语言空间中联合处理各种驾驶任务。其他值得关注的基于视觉语言模型(VLM)的自动驾驶模型包括DriveVLM(Tian等人,2024b)、DiMA(Hegde等人,2025)、SimLingo(Renz等人,2025)、OmniDrive(Wang等人,2025)和TOKEN(Tian等人,2024a)。这些模型探索了不同的策略,用于整合视觉和语言信息,以提升驾驶性能和推理能力。2.3 对齐机制对齐机制已被提出以弥合多模态模型中不同模态之间的差距(Chen等人,2024b;Radford等人,2021;Khattak等人,2023;Yu等人,2025)。CLIP(Radford等人,2021)引入了一种对比学习方法,以在共享嵌入空间中对齐图像和文本表示。表示对齐(REPA)是一种正则化技术,旨在通过将对噪声输入隐藏状态在去噪网络中的投影与从外部预训练视觉编码器获得的干净图像表示对齐,来提高扩散模型训练的效率和生成质量(Yu等人,2025)。当应用于流行的扩散模型和基于流的 Transformer 时,REPA在训练效率和生成质量方面均显示出显著改进。这些对齐技术指导了作者提出的对齐模块(P1A、P2A、P3A)在ALN-P3中的设计,这些模块旨在在整个感知、预测和规划堆栈中明确地将视觉 Token 与相应的语言输出对齐。3 方法论概述。ALN-P3的整体框架引入了跨全自动驾驶栈的多模态对齐——包括感知、预测和规划——以提升驾驶性能和语言推理能力。框架的概述如图1所示。方法论部分的结构安排如下。在3.1节中,作者介绍了P3自动驾驶栈和QA模块。在3.2节、3.3节和3.4节中,作者提出了所提出的对齐模块:感知对齐(P1A)、预测对齐(P2A)和规划对齐(P3A)。3.1 预备知识P3模块。自动驾驶栈遵循基于视觉的感知-预测-规划(P3)流程(Hu等人,2022,2023)。对于多视角图像输入,BEV编码器通过融合多摄像头信息到统一的时空表示中,提取鸟瞰视图(BEV)特征图(Li等人,2022)。在感知阶段,可学习的轨迹 Token    Query 鸟瞰图特征图以检测和跟踪Agent,其中表示Agent Query 的数量, 是 QueryToken 的维度。这些 Token 编码了周围物体的位置历史轨迹特征。预测阶段引入运动 Token   来建模Agent间以及Agent与地图的交互,为每个Agent预测未来轨迹 。在规划阶段,使用ego车辆 Token   来推理ego车辆的轨迹 Vego。问答模块。问答模块根据任务特定的 Prompt (Hwang et al., 2024)生成自然语言响应,以应对各种驾驶任务。由于大语言模型(LLMs)无法直接处理视觉特征,通常采用中间件编码器 ,例如QFormer(Li et al., 2023),将视觉表征投影到语言空间。具体而言,作者采用Holistic Token Mixer(Ding et al., 2024)将驾驶情境投影到MLLM空间:轨迹和运动 Token 被融合成实例级表示,这些表示封装了每个周围Agent历史上的和预测的轨迹。给定任务 Prompt   和多模态驾驶情境,MLLM 通过自回归解码器生成语言输出序列:$$$P_r(\mathbf{O}|\mathbf{P},\mathbf{C}) = \prod_{i=1}^n P_r(o_i|o_{<i},\mathbf{p},\mathbf{c})$ $$="" 其中 <span data-formula="\scriptstyle o _ { <span data-formula="\scriptstyle o _ {表示先前生成的token序列。问答模块使用标准的语言模型损失进行训练。
3.2 感知对齐感知对齐的目标是弥合P3模块所使用的场景表征与MLLM的语言推理能力之间的差距。然而,现成的MLLM并未经过训练以处理特定于驾驶的视觉表征,这使得它们难以理解或推理此类输入。与通用领域MLLM的视觉 Token 相比,这种不匹配尤为明显(Chen等人,2024b)。为应对这一挑战,作者提出一种感知对齐模块(P1A),该模块明确地将实例级感知特征——即捕获每个目标相关视觉和上下文信息的特征——与其对应的真实语言描述进行对齐。这种对齐有助于MLLM更好地理解和推理感知层级的语义。形式上,给定一组真实物体描述 ,作者使用预训练的CLIP文本编码器 (Radford等人,2021)计算它们的文本嵌入。实例 Level 的视觉特征stance 通过可训练的MLP Head   投影到语言空间。然后作者使用均方误差(MSE)损失来强制对齐:这种对齐损失促使模型生成与语言对应项在语义上保持一致的感知特征,从而促进更有效的跨模态理解。3.3 预测对齐在当前的集成大语言模型(LLM)的自动驾驶系统中,驾驶性能和视觉语言推理通常独立优化。这种解耦可能导致次优结果,并导致基于视觉的轨迹预测与由多模态语言模型(MLLM)生成的语言输出(例如,标题或答案)之间出现不一致。为解决这一问题,作者提出了一种预测对齐模块(P2A),该模块明确地弥合了预测运动轨迹与语言输出之间的差距。主要挑战在于这些模态的异构性:轨迹预测由连续值的空间航路点组成,而语言输出则表示为离散的token logits。若简单地对齐这些模态,可能会导致预测和生成任务的性能下降。为克服这一问题,作者采用了一种跨模态 Prompt 策略。作者引入了一组个可学习的 Prompt 词 Token,这些 Token 定义了一个共享的嵌入空间,用于对齐预测和语言特征。令表示P3模块预测的第个Agent的未来轨迹,其中是未来时间步的数量。其中表示来自MLLM的输出logits。为了对齐这些嵌入,作者采用了一种CLIP风格的对比损失(Radford等人,2021年):在此,对于场景中的每个个Agent,均计算 ,从而实现预测运动与相应语言描述之间精细粒度的Agent级对齐。通过最小化,P2A模块促使轨迹分支和语言分支在共享嵌入空间中收敛,从而提升跨模态一致性并减少语义漂移。3.4 规划对齐预测对齐模块(P2A)虽然促进了Agent级运动预测与语言推理之间的一致性,但并未直接监督自主车辆决策过程,而决策过程是自动驾驶最关键的部分。为解决这一不足,作者引入了规划对齐模块(P3A),该模块将自主车辆的规划轨迹与对规划相关 Query 生成的语言输出进行对齐。这种对齐基于P3模块生成的预期ego车辆未来轨迹 。为了弥合计划轨迹与相应语言输出之间的模态差距,两者都使用一组可学习的 PromptTokenP3 E RN3xD3 投影到一个共享的表示空间中。使用基于注意力的池化算子 A,作者得到:其中表示针对规划相关 Prompt 的MLLM输出logits。为了对齐这两种表示,作者采用负余弦相似度损失,这是一种经验上有效的对齐目标(Yu等人,2025):由于场景中只有一个ego车辆,该损失在场景 Level 进行计算。最小化促使ego车辆的规划轨迹的语义嵌入与其基于语言的描述保持一致,从而增强P3模块的决策输出与QA模块生成的解释或命令之间的连贯性。P3A与感知模块(P1A)和预测模块(P2A)共同完成了对整个感知-预测-规划(P3)堆栈的监督。这种全面的模块对齐促进了自动驾驶流程所有阶段的连贯、可解释和语义基础的推理。重要的是,所有三个对齐模块P1A、P2A和P3A仅在训练期间激活,并在推理时间不引入任何额外的计算开销,这对于需要低延迟决策的真实世界自动驾驶应用至关重要。此外,在训练期间,激活的具体对齐策略根据训练数据中 Prompt 问题的类别动态确定。 Prompt 类别——感知、预测和规划——遵循DriveLM(Sima等人,2024年)中提出的分类法定义。4 实验与结果4.1 数据集和指标作者在四个不同的数据集上评估了所提出的ALN-P3框架和 Baseline 模型,以确保在驾驶和语言任务之间进行全面且公平的比较。nuScenes(Caesar等人,2020)是自动驾驶领域广泛采用的基准数据集。该数据集包含1000个20秒的驾驶场景,以2Hz的频率进行标注,并从覆盖全360°视场的六个摄像机中采集了140万个三维边界框。作者使用在1秒、2秒和3秒预测范围内的碰撞率来评估端到端的规划性能。Nu-X(Ding等人,2024)是一个基于nuScenes构建的大规模、人工标注的驾驶解释数据集。它包含34,000个关键帧,具有细粒度的叙述和推理,捕捉了驾驶行为的“是什么”和“为什么”两个方面。作者使用标准的字幕生成指标评估生成的字幕:CIDEr(C)(Vedantam等人,2015)、BLEU-4(B)(Papineni等人,2002)、METEOR(M)(Banerjee和Lavie,2005)以及ROUGE-L(R)(Lin,2004),这些指标共同评估了流畅性、相关性和多样性。TOD3Cap(金等人,2024)是一个3D密集描述数据集,提供目标 Level 的文本描述,涵盖外观、运动和空间关系等属性。评估采用与Nu-X相同的描述指标,使作者能够在目标 Level 测量定位性能。nuScenes-QA(钱等,2024)是一个基于34,000个nuScenes关键帧构建的视觉问答数据集。它包含五种问题类型:存在性、计数、 Query 目标、 Query 状态和比较。作者报告了零跳、一跳和所有问题类型的准确率,这些准确率反映了模型在视觉上下文中的推理能力。4.2Baseline 模型为评估所提出的ALN-P3框架的有效性,作者将其与一系列基准进行比较,包括传统的自动驾驶流程、视觉语言模型以及最先进的多模态大语言模型。每个基准都在第4.1节中描述的四个目标任务上进行评估。ST-P3(Hu等人,2022年)、UniAD(Hu等人,2023年)和VAD(姜等人,2023年)是领先的端到端视觉感知-预测-规划(P3)模型。这些模型从多视角输入中预测ego车辆的轨迹,并作为nuScenes规划任务的强 Baseline 。然而,它们不支持语言输出,因此未在推理、字幕或VQA任务中进行评估。DriveVLM(Tian等人,2024b)提出了一种混合框架,该框架将视觉语言模型与传统的AD堆栈相结合。它提供了对驾驶上下文的语言推理能力,但在中间输出上缺乏细粒度对齐。TOD3Cap(金等人,2024)是一种结合基于BEV的检测和LLM解码器生成以目标为中心的描述的3D密集字幕模型。然而,其语言输出并未与运动或规划表示明确对齐,这限制了其在下游任务中的可解释性。GPT-4o(OpenAI,2023)和Gemini-1.5(Google,2024)是专有的多模态大语言模型。作者在零样本设置下,使用多视角相机图像和手动构建的 Prompt 对它们进行评估。尽管它们提供了强大的通用推理能力,但它们独立于任何AD堆栈运行。Hint-AD(Ding等人,2024)通过一个整体性token混合器将AD模型的中间输出整合到LLM解码器中。它支持多种推理任务,并比声明性 Baseline 提供更强的基础,但并未在所有三个P3阶段提供明确的对齐。4.3 实现细节为了进行公平比较,作者遵循Hint-AD(Ding等人,2024)相同的实验设置。ALNP3采用相同的基座架构,差异在于集成了作者提出的对齐模块(P1A、P2A、P3A)。作者使用VAD-base(Jiang等人,2023)作为预训练的P3模块。对于语言生成器,作者采用基于预训练的LLaMA-2-7B(Touvron等人,2023)构建的LLaMA-AdapterV2(Zhang等人,2024)。所有模型均在包含所有四个数据集的混合数据集上进行5个epoch的训练。基础学习率设置为。在训练过程中,LLaMA模型保持冻结状态, Adapter 和P3参数进行更新。所有实验均在两块NVIDIA H200 GPU上进行。作者在P3堆栈中应用所有训练目标,同时结合语言建模损失和所有提出的对齐损失。所有损失项均以默认权重1进行同等加权,由于资源限制,未对这些项进行额外调整以平衡它们。驾驶解释与推理解码叙述:汽车继续沿路直行解码推理:因为前方的路径没有障碍物或交通GT旁白:汽车自信地行驶在开阔的道路上全局推理:由于前方空间清晰,允许不间断的前进解码旁白:汽车在湿滑的街道上以恒定速度行驶解码推理:由于交通顺畅无阻碍全局叙述:汽车坚定地沿着道路前进前方的交通信号灯显示清晰的信号,且没有障碍物阻挡其路径 解码旁白:汽车在十字路口停车解码推理:因为交通信号灯是红色,需要车辆停止GT叙述:汽车停放在繁忙的城市街道中央颜色交通信号灯指示明确的暂停需求,防止任何前进运动4.4 实验结果作者报告了在四个任务上的全面结果:端到端规划(nuScenes)、驾驶解释与推理(Nu-X)、三维密集描述(TOD3Cap)以及视觉问答(nuScenes-QA)。表1展示了与当前最佳 Baseline 和多模态大语言模型(LLM)的定量比较。4.4.1 端到端规划作者在nuScenes数据集上使用1秒、2秒和3秒时间范围内的碰撞率来评估规划的鲁棒性。如表1所示,ALN-P3在所有时间范围内均实现了最低的碰撞率(0.05%、0.09%和0.35%),优于所有 Baseline 方法,包括基于视觉的强规划器如UniAD和VAD。值得注意的是,adas-ALN-P3_2505平均碰撞率为0.16%,相较于先前最佳模型VAD(0.22%)提升了27%。这表明引入多模态对齐可以提升Low-Level规划性能。4.4.2 驱动解释与推理ALN-P3在评估自动驾驶中语言推理能力的NuX数据集上取得了最先进的结果。与Hint-AD相比,adas-ALN-P3_2505将CIDEr从22.4提升至28.6,BLEU-4从4.18提升至5.59。这些提升表明生成的驾驶解释更加信息丰富、流畅且与上下文紧密相关。与缺乏自动驾驶集成的GPT4o和Gemini-1.5相比,ALN-P3展现出显著改进。表2展示了解码输出与真实标签的定性对比示例,证明ALN-P3能够生成连贯且准确的ego车辆行为及其内在推理的解释。4.4.3 三维密集描述在目标级字幕生成任务中,ALN-P3取得了341.9的CIDEr得分,创下了新的当前最佳结果。与Hint-AD(263.7 CIDEr)和TOD3Cap(120.3 CIDEr)相比,ALN-P3在所有指标(包括BLEU和ROUGE-L)上均实现了显著提升。这些改进源于感知与预测对齐模块,该模块紧密耦合了视觉 Token 和Agent级动作与描述性语言。定性分析进一步验证了这些定量结果,具体如表3所示。4.4.4 视觉问答在nuScenes-QA数据集上,作者报告了零跳(H0)、单跳(H1)和所有问题的准确率。ALN-P3实现了最佳总体准确率,大幅超越了Hint-AD,以及GPT40和Gemini-1.5。该模型在更具挑战性的单跳问题上表现尤为出色,展示了其通过利用对齐的规划和运动上下文进行多线索推理的能力。ALN-P3推理能力的定性示例在表4中提供。4.4.5 与通用多模态LLM的比较尽管GPT-4o和Gemini-1.5具备强大的通用视觉语言能力,但由于其与底层AD(抽象离散)堆栈缺乏对齐,导致输出结果不一致或流于表面。这些模型在结构化推理任务(如VQA和驾驶解释)上的表现不佳。相比之下,ALNP3明确将语言生成与中间层AD表示相结合,提供了更优越的可解释性、一致性和安全性。在所有任务中,ALN-P3始终优于先前的视觉语言模型和传统AD规划器,在驾驶安全性和语言推理方面均取得了最先进的结果。这些结果验证了将感知、预测和规划与语言对齐的好处。5 结论本文介绍了ALN-P3,一个实现语言模型与自动驾驶系统中感知-预测-规划(P3)堆栈之间整体对齐的统一框架。通过设计专门的对齐模块——感知对齐(P1A)、预测对齐(P2A)和规划对齐(P3A),ALN-P3弥合了空间推理与自然语言生成之间的差距。在规划、驾驶解释、3D密集描述和问答(VQA)任务上的大量实验表明,ALN-P3在驾驶安全性和多模态推理方面均显著优于现有最优 Baseline 。ALN-P3的一个关键优势在于所有对齐机制仅在训练过程中应用,在推理时间不会引入额外的延迟或计算开销。这种设计确保了实时性能,同时提升了基础和一致性。

页: [1]
查看完整版本: ALN-P3:统一协同蒸馏框架,用于自动驾驶感知、预测和规划的统一语言对齐,提升决策与推理能力 !