摘要

视觉-语言模型(VLM)在端到端自动驾驶领域展现出巨大潜力。然而,如何充分利用其能力以实现安全可靠的车辆控制,仍然是一个悬而未决的研究挑战。为了系统地研究VLM在驾驶任务中的进展与局限,我们引入了LightEMMA,一个用于自动驾驶的轻量级端到端多模态模型。LightEMMA提供了一个统一的、基于VLM的自动驾驶框架,无需特别的定制,从而能够轻松集成和评估不断发展的、最先进的商业及开源模型。我们使用多种VLM构建了十二个自动驾驶代理,并在nuScenes预测任务上评估了它们的性能,全面评估了推理时间、计算成本和预测准确性等指标。示例说明,尽管VLM具有强大的场景理解能力,但其在自动驾驶任务中的实际性能仍然堪忧,这凸显了进一步改进的必要性。代码可在 https://github.com/michigan-traffic-lab/LightEMMA 获取。


I.引言

多年来,自动驾驶汽车(AV)取得了巨大进步,提升了安全性、舒适性和可靠性。传统方法依赖于模块化设计、基于规则的系统和预定义的启发式方法 [1], [2]。虽然这种结构化的方法论确保了行为的可解释性和可预测性,但它限制了解读复杂场景和做出灵活的、类人决策的能力。

一种更新的方法是基于学习的端到端驾驶,它将原始传感器输入——连同高清地图和环境上下文——直接映射到驾驶轨迹 [3]–[8]。与模块化流程不同,端到端模型旨在从数据中学习统一的表示,从而实现更全面且可能更高效的驾驶决策。然而,它们通常是可解释性有限的“黑箱”,在关键场景中引发了安全担忧 [9],并且它们需要大量、多样化的数据,这使得它们容易受到数据不平衡和“稀有性诅咒”[10]的影响。

在应对这些挑战方面,一种有前景的新兴方法是视觉-语言模型(VLM)的发展。通过在包含文本、图像和视频的大量数据集上进行训练,VLM展现出类似于人类认知的强大推理能力。近期的研究已经探索了基于VLM的端到端自动驾驶系统,[11]中提供了一份全面的综述。然而,现有研究主要强调VLM在驾驶环境中的场景理解能力,而没有全面评估其优势和局限性。此外,许多应用涉及商业车辆部署,但没有可访问的源代码或详细的实现,这限制了它们在更广泛的研究和协作中的可用性。

受EMMA [12]的最新进展和一个开源实现项目OpenEMMA [13]的启发,我们引入了LightEMMA——一个用于自动驾驶的轻量级、端到端多模态框架。LightEMMA采用零样本(zero-shot)方法,并充分利用现有VLM的能力。我们的主要贡献如下:

  1. 我们为端到端自动驾驶规划任务提供了一个开源的基线工作流,其设计旨在与最新的VLM无缝集成,从而实现快速原型设计,同时最大限度地减少计算和传输开销。
  2. 我们使用来自nuScenes预测任务的150个测试场景,对十二个最先进的商业和开源VLM进行了全面评估。我们的分析突出了当前基于VLM的驾驶策略的实际优势和局限性,并对其能力和未来潜在的改进领域进行了详细讨论。

II. 相关工作

EMMA [12] 基于 Gemini [14] 构建,通过自然语言统一表示输入和输出,将摄像头数据直接映射到驾驶输出,实现了最先进的运动规划。OpenEMMA [13] 在此基础上进行了扩展,引入了一个使用经由思维链(CoT)推理增强的VLM的开源框架,提升了性能和泛化能力。DriveGPT4 [15] 是一个基于LLaMA2的VLM,它在BDD-X数据集上进行训练,并使用ChatGPT数据进行微调,支持多帧视频理解、文本查询和车辆控制预测。DOLPHINS [16] 使用指令微调(instruction tuning)进行情境学习(in-context learning)、适应和错误恢复。DriveMLM [17] 通过整合驾驶规则、用户输入和传感器数据,将VLM融入行为规划,并在CARLA的Town05 [18] 中进行了评估。

有多个开源数据集可用于训练和评估自动驾驶系统,其中最著名的是Waymo开放数据集 [19] 和nuScenes [20]。像nuScenes-QA [21]、nuPrompt [22]、LingoQA [23] 和 Reason2Drive [24] 这样的扩展基准测试进一步支持了对语言和推理能力的评估。


在这里插入图片描述

III. 研究方法

LightEMMA架构的概览如图1所示。下面概述了其简要工作流程,详细描述见后续小节。

在每个推理周期中,当前的前视摄像头图像和车辆的历史驾驶数据被输入到VLM中。为了增强可解释性并促进结构化推理,我们采用了一种思维链(CoT)提示策略,其最后阶段明确输出一个预测的控制动作序列。这些动作通过数值积分生成预测轨迹,然后与真实轨迹(ground truth)进行比较。所有VLM都使用一致的提示和评估程序进行统一评估,没有针对特定模型进行调整。

A. VLM选择

我们从开源和商业产品中选择了最先进的VLM,涵盖6种模型类型,共计12个模型。对于每种模型类型,我们评估了两个变体:一个基础版本和一个高级版本。所使用的所有模型都是(截至本项目结束时)最新公开发布的版本,支持文本和图像输入。这种设置使得我们能够对不同模型之间以及同一模型家族内部不同变体之间进行全面的性能比较。所选模型包括:GPT-4o、GPT-4.1 [25]、Gemini-2.0-Flash、Gemini-2.5-Pro [14]、Claude-3.5-Sonnet、Claude-3.7-Sonnet [26]、DeepSeek-VL2-16B、DeepSeek-VL2-28B [27]、LLaMA-3.2-11B-Vision-Instruct、LLaMA-3.2-90B-Vision-Instruct [28]、Qwen2.5-VL-7B-Instruct 和 Qwen2.5-VL-72B-Instruct [29]。

对于商业模型,我们通过付费API进行访问。这种方法简化了部署,因为无需管理本地硬件、软件更新和可扩展性,这些任务由提供商直接处理。

对于开源模型,我们从HuggingFace下载并在本地使用H100 GPU进行部署。大多数模型仅需单个H100 GPU,但更大的模型可能需要更多;我们在表I中报告了所需的最少GPU数量。为了方便多GPU部署,我们利用PyTorch的自动设备映射功能来实现高效的GPU利用。

B. 摄像头输入

当将前视摄像头图像输入VLM时,我们不使用任何视觉编码器(如CLIP [30]),也不在将图像输入模型前应用预处理技术对其进行修改。我们的研究结果表明,VLM能有效地描述场景并直接从原始视觉输入中准确识别物体,显示出处理未处理视觉数据的鲁棒性。

与此设计方法一致,我们也选择仅使用当前的驾驶场景图像作为输入,而不是像以往研究[13], [15]那样拼接多个过去帧。我们的初步实验表明,加入额外的帧并未带来明显的性能提升。相反,模型倾向于在多个帧中冗余地提取相同的特征,而不是捕捉有意义的时空动态。此外,增加更多帧会导致处理时间和计算成本大致呈线性增加,而没有明确的性能优势。

另外,像VideoBERT [31]和VideoMAE [32]这样的模型通过专门的时间编码来支持视频输入,而不是简单地将视频视为帧序列。这类模型天生采用不同的架构,并可能捕捉到更丰富的时序信息。然而,探索这些专门面向视频的模型超出了我们当前研究的范围。

C. 驾驶历史输入

我们的工作使用速度和曲率来表示车辆动作,这是一种可解释的格式,其中速度捕捉纵向运动,曲率描述横向运动。我们采用这种表示方式,而不是明确的轨迹点,因为VLM通常难以对涉及隐式物理约束的坐标进行有效推理。

D. VLM提示

我们采用一种直接的CoT方法来引导VLM进行场景理解和动作生成,其中每个阶段的输出与附加提示一起被整合到后续阶段:

  1. 场景描述:VLM接收一张图像作为输入,并被提示解读整个场景,包括车道线、交通灯、车辆、行人活动以及其他相关物体。
  2. 高层驾驶意图:生成的场景描述与自车的历史驾驶动作相结合,使VLM能够在当前场景背景下解读过去的行为,并预测下一个高层驾驶动作。
  3. 低层驾驶指令:场景描述和生成的高层指令被用来提示VLM以指定格式输出一个结构化的低层驾驶动作列表,格式为 [(v1, c1), (v2, c2), (v3, c3), (v4, c4), (v5, c5), (v6, c6)],不带有多余的文本或解释。

E. 示例工作流

在本节中,我们使用图1所示的图像,演示了CoT过程的一个示例工作流和结果。响应和轨迹由Claude-3.7-Sonnet生成。由于篇幅限制,我们保留了原文的措辞,但省略了一些次要细节。

场景描述:图像显示了一个城市街道场景,有正在进行的道路施工或维护工作……一名警察站在路中央指挥交通……可以看到几辆工程车辆,包括一辆停在路左侧的黑色自卸卡车以及其他工作车辆……该施工区域的交通似乎由警察和可能的车道限制所控制。

高层意图:鉴于当前场景有正在进行的施工,且一名警察在路中央指挥交通,自车应以大约 2 − 3 m/s 2 2-3 \text{m/s}^2 23m/s2 的加速度显著减速,为可能停车做准备,在未来3秒内将速度降至约 3 − 4 m/s 3-4 \text{m/s} 34m/s。车辆应继续沿车道行驶,同时准备好在警察指示下完全停车。

低层指令[(6.0, -0.001), (5.0, -0.001), (4.0, 0.0), (3.5, 0.0), (3.0, 0.0), (3.0, 0.0)]


在这里插入图片描述

IV. 实验

我们使用所提出的方法和模型,在nuScenes预测任务上对来自150个测试场景的总共3908帧进行了性能评估。评估主要集中在两个方面:模型的计算效率和其轨迹预测的准确性。

A. 推理时间

推理时间的摘要如表I所示,显示了每图像帧的平均处理时间。Gemini-2.0-Flash实现了最快的推理速度,每帧仅需4.5秒,而LLaMA-3.2-90b最慢,为40.8秒。Qwen-2.5-72B和Gemini-2.5-Pro也表现出相对较慢的性能,每帧都需要超过30秒。其余模型的运行时间通常在每帧10秒左右,基础版本通常比其高级版本运行得更快。

值得注意的是,即使是最快的模型Gemini-2.0-Flash,其处理时间也明显慢于实时更新频率。为了在实际部署中真正有效,这些模型需要将运行速度提高一到两个数量级。此外,基于API的商业模型依赖于稳定的互联网连接,这在移动的车辆中可能并不可靠。相反,本地部署面临着有限的计算能力和能耗的限制,进一步限制了其实用性。

B. 输入和输出Token

我们使用每个模型提供的官方说明来计算每帧的平均输入和输出token数量。如表I所示,输入token的数量显著高于输出token,通常约为6000个输入token,而输出token大约为300个。这与预期相符,因为输入包含图像数据,而输出纯粹是文本。

然而,也存在一些例外。LLaMA模型报告每帧仅约1000个输入token。经过进一步调查,我们发现LLaMA官方的token计算方法排除了图像token,只计算文本。尽管我们付出了大量努力,但仍未能找到一种可靠的方法来准确估计与图像相关的token;因此,我们按官方方法提供的结果进行呈现。

此外,Gemini-2.5-Pro的token计数在输入和输出token计算中明显存在错误,因为它们与可比模型的结果显著偏离。值得注意的是,使用完全相同的token计数设置计算的Gemini-2.0-Flash产生了与预期一致且合理的结果,这表明问题特定于Gemini-2.5-Pro,需要修正。

C. 成本

成本部分仅适用于商业API。为确保测量的准确性和报告的可靠性,我们将账单历史与基于输入和输出token使用量的官方定价表进行交叉引用。为清晰起见,表I中呈现的所有结果均以每帧美分显示。

Gemini-2.0-Flash最便宜,仅为0.07美分,使其成本可以忽略不计。GPT-4o和GPT-4.1的成本相似,约为1.3美分。Claude-3.7-Sonnet比Claude-3.5-Sonnet贵得多,并且明显比GPT模型更昂贵。由于Gemini-2.5-Pro的token计算不准确,难以进行精确估算。因此,此处报告的值仅基于运行模型后的账单历史。

D. 响应错误

在模型的最终输出阶段,我们观察到各种响应格式错误。尽管我们提示VLM严格按照 [(v1, c1), (v2, c2), (v3, c3), (v4, c4), (v5, c5), (v6, c6)] 的格式返回输出,不带任何附加文本,但我们偶尔会遇到偏差,例如缺少括号或逗号、额外的解释或标点符号以及不正确的列表长度。具体示例在此省略,但在我们的GitHub仓库中提供。

如表II所示,Qwen-2.5-72B的错误率最高,为62.9%,而其基础版本Qwen-2.5-7B则没有产生错误。GPT-4.1也表现出28.9%的有问题的错误率,而GPT-4o的错误较少,为7.8%。其余模型的表现可靠,错误率要么为零,要么低于1%。

我们认为,鉴于所有模型都使用相同的提示和工作流程,这些随机故障反映了模型固有的局限性,而非我们框架中的系统性缺陷。虽然许多格式错误可以通过后处理、附加提示或其他增强技术来缓解,但我们的目标是评估而非优化单个模型的性能。因此,我们保持了一致的实验设计,并报告观察到的错误率,未作修改。

E. 预测准确性

预测准确性遵循nuScenes预测任务中采用的标准评估方法,报告在1秒、2秒和3秒时间间隔的L2损失及其平均值。由于响应错误,每个模型对原始帧的不同子集产生预测。为确保公平比较,如果任何一个模型未能对某一帧产生有效预测,我们就会在所有模型的评估中排除该帧。由于Qwen-2.5-72B和GPT-4.1的失败率特别高,我们从该分析中完全排除了这两个模型,以保留足够大的帧集。最终,这种筛选产生了一个包含3506帧的子集,占原始3908帧的90%。

L2损失结果总结在表II中。为简化和便于比较,我们的分析主要关注平均L2损失(单位:米)。总体而言,GPT-4o以1.07米取得了最佳性能,紧随其后的是Claude-3.5-Sonnet和Claude-3.7-Sonnet,其结果仅略逊一筹。Gemini模型的表现相对较差;值得注意的是,Gemini-2.5-Pro的表现明显差于Gemini-2.0-Flash。总体而言,开源模型的表现不及商业模型,其中两个DeepSeek模型的表现最差。

F. L2损失基线

虽然L2损失提供了一种直接评估模型预测性能的方法,但正如[33]所讨论的,它可能无法完全捕捉驾驶场景的复杂性。为了缓解这个问题,我们引入了一个简单而有效的基线:将最新的AV(自动驾驶汽车)动作保持不变并延伸未来三秒。然后,通过计算这些恒定动作生成的轨迹与真实轨迹之间的L2损失来对其进行评估。

我们的结果表明,这个简单的基线实现了1.10米的平均L2损失,与表现最佳的VLM(GPT-4o的1.07米和Claude 3.7-Sonnet的1.09米)的结果非常接近,并且显著优于许多其他模型。这一比较凸显了当前零样本VLM方法在轨迹规划任务中的局限性,表明现有模型可能难以充分处理驾驶特定的复杂性。因此,这强调了进行针对性增强的必要性,例如设计专门用于驾驶环境的VLM架构或使用领域特定的驾驶数据集对模型进行微调。

尽管在轨迹预测任务中取得了次优的L2损失结果,但必须承认,VLM经常展示出有意义的驾驶智能,并且其行为通常与简单基线不同——尽管不一定更好。我们将在下一节中进一步探讨这一点。

在这里插入图片描述

V. 案例分析

本节讨论图2中所示的六个代表性场景。由于可用帧数众多,这些示例经过精心挑选,旨在突出典型行为,而非提供详尽分析。每张图都将VLM预测的轨迹与真实轨迹进行比较,作为示例说明,而非精确的模型输出。详细的推理过程、轨迹生成原理以及识别出的失败模式将在下文呈现。

在这里插入图片描述

案例1:由历史动作引起的轨迹偏差

图2.1展示了一个场景,其中真实轨迹是直线行驶,但预测轨迹却错误地指示了一个急右转,未能识别出位于右侧的障碍物。尽管最初看似违反直觉,但这种行为在所有模型中都一致地被观察到。其发生原因在于,自动驾驶汽车(AV)在该帧之前刚刚在十字路口完成了一次右转。因此,历史动作反映出明显的向右曲率。然而,VLM仅凭当前的前视图像难以识别更新后的路况,错误地将之前的转弯行为向前投射。值得注意的是,在车辆恢复直线行驶后不久,模型便能正确调整并重新开始预测直线轨迹。此类错误在各模型中普遍存在且频繁发生,不仅限于右转,左转时也类似。

案例2:视觉线索提供的上下文不足

图2.2展示了另一个所有模型都一致失败的场景。在这种情况下,真实轨迹涉及左转,但所有模型都错误地预测继续直行。尽管这个场景本身就具有挑战性——因为路面上没有明确的左转标记,也没有专用的交通灯——但仍然存在一些隐含的指示。例如,AV占据了最左侧车道,而右侧相邻车道上的车辆则准备直行。为了可靠地解决这个问题,模型可以整合额外的上下文信息,例如明确指示在十字路口左转的导航指令。

案例3和4:对停车信号的不同响应

图2.3展示了一个凸显VLM响应显著差异的场景。在这种情况下,AV在一个由红灯控制的十字路口逐渐接近一辆停着的车。真实轨迹显示AV平稳且渐进地减速,直到在前车后方完全停下。然而,VLM的预测分化为两个截然不同的类别,两者都未能准确复现真实行为。

第一类通常包括L2损失相对较低的模型。这些模型正确识别了红灯和前方停着的车辆,这在其场景描述中有所体现。然而,它们预测的是立即且突然的制动行为,而不是现实中观察到的受控、渐进的减速。这种行为表明,虽然这些模型能有效识别关键视觉线索并将其与适当的驾驶行为联系起来,但它们仅凭视觉输入缺乏精细的空间推理能力。因此,它们的响应似乎是事件触发式的——即时对红灯等视觉信号做出反应——而不是表现出对发展中场景的全面理解。

第二类包括通常以较高L2损失为特征的模型。这些模型错误地预测AV将继续直行通过十字路口而不减速或停车,实际上忽略了静止的车辆和红灯。此类预测揭示了模型在解释关键视觉线索并将其与驾驶行为适当联系起来的能力方面存在根本性缺陷,凸显了未来有待改进的巨大空间。

在图2.4中观察到了类似的模式。在这里,真实行为同样涉及AV接近一个有红灯的十字路口,此时一名行人正在过马路。VLM的预测要么是预判一次突然的紧急刹车,尽管前方有足够的距离;要么是完全忽略行人和交通信号,预测AV将保持速度并不减速地通过。

案例5:对通行信号的不同响应

图2.5描绘了一个场景,其中AV最初静止,在一个由交通信号灯控制的十字路口等待。当交通信号灯从红变绿时,真实行为是AV迅速开始加速并平稳地穿过十字路口。表现出较低L2损失的模型紧密地复现了这种行为,准确地将绿灯识别为明确的前进指示,并因此预测了适当的加速轨迹。相反,以较高L2损失为特征的模型则保持静止,未能建立起绿灯与相应加速动作之间的关键联系。它们的响应与我们简单的恒定动作基线无法区分,凸显了它们无法有效解释动态视觉线索以启动适当车辆运动的无能。

案例6:冲突的视觉线索和模型响应

最后一个例子,如图2.6所示,呈现了一个有趣的场景,即使是表现出低L2损失的模型也展现出不同的行为。与图2.5中的情况类似,交通信号灯刚从红变绿。一组模型观察到绿灯并预测立即加速,忽略了正前方的车辆。相反,另一组模型则准确识别了冲突的线索——承认尽管是绿灯,但由于有车辆阻挡,AV必须保持静止。这个场景进一步扩展了从图2.5中得出的观察结果,突显了不同的VLM在面对冲突的视觉信息时如何响应。

此外,VLM的这种分歧响应凸显了其决策过程在应用于自动驾驶任务时固有的不稳定性。这些不一致性可能直接导致危险情况,例如意外加速或碰撞风险,强调了建立强大的安全机制或防护措施的必要性。


VI. 结论

在这项工作中,我们介绍了LightEMMA,一个轻量级的、端到端的自动驾驶框架,它专门为与最先进的视觉-语言模型集成而设计。通过使用思维链提示策略,我们展示了VLM有时能够准确解读复杂的驾驶场景并产生智能的响应。值得注意的是,LightEMMA主要作为一个易于使用的基线,而不是为特定的VLM优化性能。

通过nuScenes预测任务进行的系统性评估,我们评估了计算效率、硬件需求和API成本等维度。使用L2损失的定量分析凸显了当前VLM预测的局限性,并强调了仅依赖这一指标的不足。定性分析进一步识别出了一些常见的缺陷,包括过度依赖历史轨迹数据、有限的空间感知能力以及反应式的决策制定。因此,未来的研究应专注于开发针对驾驶场景的特定模型,或使用领域特定的数据集对现有VLM进行微调,同时认识到商业VLM目前相对于开源替代方案的优势。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐