自动驾驶BEV融合里,稀疏激光别硬追稠密相机
自动驾驶做BEV融合时,最常见的错觉是把信息更稠密的一侧当成真相,再要求另一侧去“补齐”。可在占用建模里,稀疏激光和稠密相机描述的其实不是同一种证据,硬对齐反而会制造虚假可通行区。
激光点云的优势是量测几何直接,但它在远距、黑色物体和细小障碍上天然稀疏。为了让栅格更完整,很多系统会对单帧点云做膨胀或基于先验的面片扩展。问题在于,扩张一旦脱离真实回波边界,就会把“未观测”悄悄改写成“已知空地”或“已知障碍”,尤其在斜向护栏、锥桶和挂车尾缘上最容易出错。
相机则相反。语义分割和深度网络能给出密集外观信息,但这些密度来自模型推断,不等于每个像素都具备同等物理可信度。远处阴影、路面补丁和强反光区域常会被网络填成看似连续的地面,而激光此时可能恰好只有零散几个不支持通行的回波。如果融合层强迫激光去追相机的稠密结果,最后留下的多半是被外观先验抹平的风险。
遮挡记忆是第二个常被误用的机制。前车驶过后,后方区域在几帧时间里其实处于不可观测状态。为了稳定BEV,不少系统会保留上一时刻的占用记忆,等待新观测再更新。可若记忆衰减太慢,被遮挡区会长期保留旧的自由空间结论;衰减太快,又会在遮挡边缘制造闪烁,影响规划对可通行带宽的判断。
这说明多源融合不能只比较像素或栅格值,而要先区分证据类型:直接观测、间接推断和历史记忆分别代表什么。激光稀疏但直接,相机稠密却含模型猜测,历史记忆稳定却会过时。三者若在同一概率通道里简单平均,系统就无法表达“这里看起来像路,但其实刚被遮挡且激光没有确认”的关键边界。
更稳妥的做法,是让稀疏激光优先定义硬边界,让相机负责补语义和外观连续性,而遮挡记忆只在有限寿命内维持未确认区域的临时假设。对远距或低纹理区域,还应允许系统明确输出“不确定”,而不是被迫给出满图稠密答案。规划宁可面对一块保守的不确定区,也不该收到一张过度平滑的假安全地图。
验证时尤其要看被遮挡后重显、逆光出口、夜间锥桶和施工围挡等场景。若错误总出现在“相机很自信但激光很少”的区域,问题就不是模型精度不够,而是融合层把不同证据误当成同一类信息了。
部署时还要考虑训练集与在线分布的落差。网络若在晴天城市场景里学到“连续纹理通常对应可通行路面”,到了积雪、泥水或补丁路面上就会把外观相似区域继续填平。此时激光的稀疏回波反而是少数能提醒系统“这里没看清”的硬证据。若融合规则总让高密度输出压过稀疏量测,就会把最珍贵的不确定性信息主动丢掉。保留这种不确定性,往往比再多补几格表面连续性更有价值。
所以,自动驾驶做BEV时不该要求稀疏激光去追随稠密相机。先把直接量测、外观推断和历史记忆分层管理,空间占用图才不会越做越满、越满越不可靠。





