LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

MAPLM地图与交通场景的真实世界多模态问答基准

一句话结论

MAPLM 将六路环视 RGB、LiDAR-BEV 与 HD-map 文本接入 7B VLM;13,775-frame QA 上领域微调达到 QNS 85.52%/FRM 57.99%,高于 Nov-2023 GPT-4V,但随机 frame split、地图上下文不对称、开放答案 parser 与污染审计均不透明,不能外推到闭环驾驶。

接口、数据与模型

  • 原始池约 200 万帧;过滤 510K image–map-text pairs 预训练 BEV encoder。
  • MAPLM-QA:13,775 frames;SCN/QLT/LAN/INT 各 13,775 问,DES 5,643,合计 60,743 QA。
  • split 10,775/1,500/1,500 frames;论文未说明 route/city/time group split。
  • 输入 panoramic RGB、LiDAR 灰度 BEV、HD-map context、问题;输出道路类型、点云质量、路口、车道数与车道属性描述。
  • 实际 backbone:双 CLIP ViT-L/14-336 + projection + LLaMA-2-7B/Vicuna-7B;LoRA rank 128。不是原生 point-cloud LLM。

指标与结果

QNS 是问题级正确率,FRM 是一帧所有问题全对的严格联合成功率。最佳 MAPLM baseline+LoRA/Vicuna-7B:LAN 78.53、DES 70.60、INT 83.20、QLT 84.33、SCN 96.00、FRM 57.99、QNS 85.52。GPT-4V 0-shot 为 FRM 18.75/QNS 57.81,5-shot 为 20.18/60.94。

对比并非等信息量:GPT-4V 获得 RGB+BEV,领域 baseline 还能使用 HD-map text。RGB+BEV 相比仅 BEV 改善 baseline FRM/QNS 45.47/80.25→57.99/85.52,但缺 HD-map on/off 消融。

成本、judge 与污染

  • 510K 预训练:8×V100、2 epochs;QA 微调:2×A100、10 epochs。无 wall-clock/GPU-hours/显存。
  • 无 LLM judge/human baseline;开放 DES 的规范化与语义复核未详述;无置信区间或多 seed。
  • 两支受雇标注团队,但无人数、报酬、IAA、错误率或隐私/许可细节。
  • 未审计 GPS/route/邻帧跨 split、MAPLM 预训练与 QA test 场景重叠、公开模型训练污染。

能力边界与评级

只评静态 frame 的交通/地图问答;不评时序、轨迹、规划、控制与安全。最佳 FRM 仍约 42% frame 至少一问失败。

证据评级:B-(接口和领域数据有价值;split 独立性、公平性、评分与成本证据不足)。

原始链接

相关页面