一句话结论
研究团队提出确定性谓词框架,将驾驶场景语义从可测量证据中推导,显著提升视觉语言模型在驾驶场景中的可解释推理性能。
关键要点
- 研究团队在2026年9月10日发布论文,提出了一种确定性的多数据集谓词框架,用于从几何、运动学、时间、地图及交通控制证据中推导驾驶场景语义,该框架在nuPlan和nuScenes两个数据集间保持谓词定义不变。
- 基于人工标注的谓词关系在两个数据集中各200个场景上进行定量语义验证,nuPlan数据集的宏F1分数为0.94,nuScenes为0.93,共享谓词间的跨数据集平均差异为0.02。
- 研究使用冻结的LLaVA-OneVision-7B模型在九个NuPlanQA子任务上评估谓词知识图谱,谓词定位在9个子任务中的7个取得了最高准确率,其中交通灯识别准确率从53.2%提升至71.5%。
- 在具体子任务表现中,态势评估准确率从76.2%提升至86.1%,行动推荐准确率从82.9%提升至89.0%,而天气/光照子任务准确率基本保持不变(89.4%对比88.8%)。
- 确定性谓词框架在9个NuPlanQA子任务中的8个上,仅输入谓词知识图谱的表现优于仅输入元数据,证明确定性谓词提供了可追溯的语义表示并降低了视觉依赖。
背景与事实
这篇于2026年9月10日提交到arXiv的论文题为《Grounding Vision-Language Models in Driving Semantics: A Multi-Dataset Predicate Framework for Explainable Reasoning》,归属于计算机科学中的机器学习领域。随着视觉语言模型在驾驶场景理解中应用日益广泛,模型输出中表达的语义关系往往难以针对底层交通状况进行验证,这一痛点促使研究团队提出了解决方案。该方案的核心是一种确定性的多数据集谓词框架,其工作原理是从可测量的几何、运动学、时间、地图和交通控制证据中推导驾驶场景语义。
在技术架构上,研究团队采用了数据集特定接口来恢复所需的场景信息,但谓词定义在nuPlan和nuScenes两个主流驾驶数据集中保持一致,并最终实例化为一个共同的谓词知识图谱。为了确保语义验证的准确性,研究团队在两个数据集各200个场景上进行了基于人工标注谓词关系的定量验证。验证结果显示,nuPlan数据集上的宏F1分数达到了0.94,nuScenes数据集上的宏F1分数为0.93,共享谓词间的跨数据集平均差异仅为0.02,证明了该框架在不同数据源间具有高度的一致性和稳定性。
在模型评估环节,研究团队使用了一个冻结的LLaVA-OneVision-7B模型,针对九个NuPlanQA子任务对谓词知识图谱进行了测试。数据表明,谓词定位在9个子任务中的7个上取得了最高准确率。具体而言,在交通灯识别任务中,准确率从53.2%跃升至71.5%;在态势评估任务中,准确率从76.2%提升至86.1%;在行动推荐任务中,准确率从82.9%提升至89.0%。值得注意的是,天气/光照子任务的准确率基本没有变化(89.4%对比88.8%),这与谓词词汇中缺乏相应谓词定义的事实相符。此外,研究还发现,仅输入谓词知识图谱在9个子任务中的8个上优于仅输入元数据,这进一步支持了确定性谓词在推理任务中降低视觉依赖的能力。
影响分析
对于中文开发者与自动驾驶从业者而言,这项研究的影响在于提供了一种从“黑盒”模型输出走向“白盒”语义验证的技术路径。自动驾驶系统的可靠性不仅取决于预测的准确性,更取决于决策逻辑的可解释性。该框架通过构建共同的谓词知识图谱,使得模型背后的交通语义变得可追溯和可验证,这对于提升自动驾驶系统的安全审计能力具有实际意义。
分析判断认为,虽然LLaVA-OneVision-7B模型是冻结状态,但确定性谓词框架的独立性意味着它可以作为通用的语义层插入到其他视觉语言模型中。对于从业者来说,这意味着在构建可解释的驾驶决策系统时,不再需要完全依赖端到端的深度学习模型猜测场景语义,而是可以通过几何和运动学等物理证据直接推导语义关系。这种确定性方法在涉及交通法规和危险规避的场景中,能够提供更稳定的推理基础,从而降低因模型幻觉导致的潜在安全风险。
适用边界
该结论的适用存在明确的边界条件。首先,确定性谓词框架的性能高度依赖于谓词词汇表对场景的覆盖率,在天气/光照等缺乏相应谓词定义的场景中,该框架无法提供显著的推理增益。其次,研究是在nuPlan和nuScenes这两个特定数据集上验证的,虽然框架设计为跨数据集通用,但在迁移到实际道路复杂多变的真实环境时,地图和交通控制证据的获取完整性可能会影响最终效果。最后,该框架主要用于增强可解释推理,并不直接替代端到端的控制策略,其在完全未结构化驾驶场景中的泛化能力仍需进一步验证。
孤本观察
编辑观察认为,确定性谓词框架在交通灯识别等高精度需求子任务上的显著跃升,揭示了结构化语义注入对视觉语言模型推理能力的杠杆效应。这一研究结果表明,在特定领域引入确定性知识图谱,可能比单纯扩大模型参数规模更有效地解决可解释性瓶颈。
![]()
![]()



常见问题
确定性谓词框架在nuPlan和nuScenes数据集上的宏F1分数及跨数据集平均差异是多少?
nuPlan数据集宏F1分数为0.94,nuScenes为0.93,共享谓词间的跨数据集平均差异为0.02。
在冻结的LLaVA-OneVision-7B模型评估中,交通灯识别任务的准确率变化具体是多少?
交通灯识别准确率从53.2%提升至71.5%。
为什么天气/光照子任务的准确率基本保持不变?
因为谓词词汇中缺乏相应谓词定义,该框架在缺乏相应谓词定义的場景中无法提供显著推理增益。
确定性谓词框架相较于仅输入元数据,在NuPlanQA子任务上的表现优势体现在哪里?
在9个NuPlanQA子任务中的8个上,仅输入谓词知识图谱的表现优于仅输入元数据。
来源:arXiv cs.LG