
125、洞察驱动的实战标题——人像模式的"深度估计三兄弟"——双目视差/ToF/单目深度估计的精度与鲁棒性对比,如何用置信度融合实现边缘发丝级抠图去年秋天,我在调试某旗舰机的人像模式时,遇到了一个让我连续加班两周的诡异问题:模特站在逆光场景下,头顶的碎发在预览框里像被狗啃过一样,边缘全是锯齿状的半透明像素。更离谱的是,同一台机器,在室内暖光灯下拍同样的模特,发丝边缘却干净得能数清每一根。我当时的第一反应是算法参数出了问题,但翻遍了ISP和NPU的配置,愣是没找到任何异常。直到我把RAW图拉出来逐像素看,才发现问题根本不在抠图算法本身,而在深度图——逆光场景下,单目深度估计的置信度在发丝区域直接崩了。这个案例让我意识到,人像模式的核心从来不是"抠图"这个动作,而是"深度估计"这个前提。今天这篇笔记,我就把这三兄弟——双目视差、ToF、单目深度估计——放在解剖台上,从精度、鲁棒性、功耗、成本四个维度拆开揉碎,再聊聊怎么用置信度融合把它们的优点拼起来,最终实现发丝级抠图。先说双目视差。它的原理不复杂,就是模拟人眼,通过左右两颗摄像头拍摄的视差来计算深度。精度上,在近距离(0.3米到1.5米)范围内,如果纹理丰富,双目视差的深度精度能做到毫米级,这是单目完全无法企及的。但它的命门在于"纹理"二字。你拿一台只有双目模组的手机去拍一面纯白墙壁,深度图直接变成一片噪点,因为左右图找不到任何可匹配的特征点。更麻烦的是,双目对光照极其敏感,暗光环境下信噪比骤降,视差匹配的误匹配率会飙升到30%以上。我在调试某款双目方案时,发现室内灯光频闪(50Hz/60Hz)会导致左右图曝光不一致,直接造成深度图出现横向条纹——这个坑,很多工程师第一次遇到都会懵。再说ToF。ToF的原