来源笔记 · 更新于 2026-07-12
MAPLM地图与交通场景的真实世界多模态问答基准
一句话结论
MAPLM 将六路环视 RGB、LiDAR-BEV 与 HD-map 文本接入 7B VLM;13,775-frame QA 上领域微调达到 QNS 85.52%/FRM 57.99%,高于 Nov-2023 GPT-4V,但随机 frame split、地图上下文不对称、开放答案 parser 与污染审计均不透明,不能外推到闭环驾驶。
接口、数据与模型
- 原始池约 200 万帧;过滤 510K image–map-text pairs 预训练 BEV encoder。
- MAPLM-QA:13,775 frames;SCN/QLT/LAN/INT 各 13,775 问,DES 5,643,合计 60,743 QA。
- split 10,775/1,500/1,500 frames;论文未说明 route/city/time group split。
- 输入 panoramic RGB、LiDAR 灰度 BEV、HD-map context、问题;输出道路类型、点云质量、路口、车道数与车道属性描述。
- 实际 backbone:双 CLIP ViT-L/14-336 + projection + LLaMA-2-7B/Vicuna-7B;LoRA rank 128。不是原生 point-cloud LLM。
指标与结果
QNS 是问题级正确率,FRM 是一帧所有问题全对的严格联合成功率。最佳 MAPLM baseline+LoRA/Vicuna-7B:LAN 78.53、DES 70.60、INT 83.20、QLT 84.33、SCN 96.00、FRM 57.99、QNS 85.52。GPT-4V 0-shot 为 FRM 18.75/QNS 57.81,5-shot 为 20.18/60.94。
对比并非等信息量:GPT-4V 获得 RGB+BEV,领域 baseline 还能使用 HD-map text。RGB+BEV 相比仅 BEV 改善 baseline FRM/QNS 45.47/80.25→57.99/85.52,但缺 HD-map on/off 消融。
成本、judge 与污染
- 510K 预训练:8×V100、2 epochs;QA 微调:2×A100、10 epochs。无 wall-clock/GPU-hours/显存。
- 无 LLM judge/human baseline;开放 DES 的规范化与语义复核未详述;无置信区间或多 seed。
- 两支受雇标注团队,但无人数、报酬、IAA、错误率或隐私/许可细节。
- 未审计 GPS/route/邻帧跨 split、MAPLM 预训练与 QA test 场景重叠、公开模型训练污染。
能力边界与评级
只评静态 frame 的交通/地图问答;不评时序、轨迹、规划、控制与安全。最佳 FRM 仍约 42% frame 至少一问失败。
证据评级:B-(接口和领域数据有价值;split 独立性、公平性、评分与成本证据不足)。
原始链接
相关页面
元数据
{
"id": "2026-04-14-maplm",
"type": "source",
"title": "MAPLM:地图与交通场景的真实世界多模态问答基准",
"status": "reviewed",
"created": "2026-04-14",
"updated": "2026-07-12",
"venue": "CVPR 2024",
"ingested_at": "2026-04-14",
"tags": [
"near-cvpr-2025",
"evaluation",
"benchmarking",
"vision-language",
"primary-source"
],
"note_status": "reviewed",
"source_type": "paper",
"authors": [
"Xu Cao",
"Tong Zhou",
"Yunsheng Ma",
"Wenqian Ye",
"Can Cui",
"Kun Tang",
"Zhipeng Cao",
"Kaizhao Liang",
"Ziran Wang",
"James M. Rehg",
"Chao Zheng"
],
"published_at": "2024-01-01",
"canonical_links": [
"https://openaccess.thecvf.com/content/CVPR2024/html/Cao_MAPLM_A_Real-World_Large-Scale_Vision-Language_Benchmark_for_Map_and_Traffic_CVPR_2024_paper.html",
"https://openaccess.thecvf.com/content/CVPR2024/papers/Cao_MAPLM_A_Real-World_Large-Scale_Vision-Language_Benchmark_for_Map_and_Traffic_CVPR_2024_paper.pdf"
],
"raw_entry": "raw/ingest/2026-04-14-maplm/",
"analysis_note": "raw/ingest/2026-04-14-maplm/analysis.md",
"topics": [
"topics/generative-model-evaluation",
"topics/vision-language"
],
"entities": [],
"claims": [],
"questions": [
"questions/question-do-benchmarks-track-real-video-editing-understanding"
]
}