ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ECCV 2026 | 南开OPPO开源 ExpoMotion:首个大规模动态多曝光融合数据集

ECCV 2026 | 南开OPPO开源 ExpoMotion:首个大规模动态多曝光融合数据集 ECCV 2026 · MULTI-EXPOSURE FUSIONExpoMotion1738组动态多曝光数据Householder投影“筛掉”鬼影大规模动态多曝光融合基准 Householder正交投影网络同时解决极端曝光、运动鬼影与高频细节丢失图1 ExpoMotion 既包括真实的运动、可控制的运动、极强的光线以及实验室的数据并非仅仅是为了还原画面细节在动态场景中也尽量减少运动模糊。动态多曝光融合容易产生重影、撕裂等问题。本文解决了这两个问题第一是建立大规模动态多曝光的数据集ExpoMotion二是提出Householder正交投影网络用几何投影的方法把运动鬼影从特征空间里去掉。01 论文信息PAPER INFORMATION题目ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion中文面向多曝光融合的大规模基准与 Householder 投影网络作者Yao Liu*、Lishen Qu*、Shihao Zhou、Jie Liang、Hui Zeng、Yabin Peng、Huipeng Lin、Lei Zhang、Jufeng Yang†单位南开大学国际先进研究院深圳·福田鹏城实验室南开大学计算机学院香港理工大学OPPO研究院发表ECCV 2026代码https://github.com/Leo-LiuYao/ExpoMotion下载https://arxiv.org/abs/2607.0311002 为什么要再创建一个新的数据集呢在不断变化的画面当中存在着一个长久以来的问题真实的运动一般都没有可靠的GT但是人工合成的动作不真实现有的MEF基准大部分都是静态场景不能很好地评价出细节恢复、视觉质量以及消除拖尾的效果。ExpoMotion到底有多大的空间呢① 数据规模共包含1738 组曝光序列和 10909 张图片支持3帧、5帧以及7帧的输入方式曝光范围从EV-3到EV3。② 场景组成可以控制运动状态、真实的运动情况以及静止的状态在专业的实验室里也可以得到数据包括白昼、黑夜、街道、餐馆、沙滩、楼梯等等现实生活中的各种场景。③ 严格筛选原始采集了大约14235组序列在去除掉模糊、噪声、抖动以及对齐质量之后有超过80%的数据被删除掉了。高质量GT先用经典的算法以及商业HDR软件得到一些候选的结果然后经过人的选择之后再把它们交给五名专业的摄影师或者成像师改变色调曲线和色温。图2 ExpoMotion在数据量、语义种类、明暗变化范围、曝光时间长短以及颜色深度等方面都更加广泛并且平均分辨率为2563*1896。03 HOP先对齐曝光后滤掉鬼影传统的做法是把多曝光融合当作一个特征匹配的过程来处理首先找到相似的部分然后用光流、可变形卷积或者注意机制等方式进行合并。但是在MEF中辅助帧最具有价值的信息往往就是参考帧中已经被过度曝光或者不足曝光而无法匹配的地方。因此作者把整个过程分成两部分来进行曝光预对齐和鬼影过滤。图3中HOP用过曝帧、参考帧以及欠曝帧作为输入并且首先使用GPIA来统一亮度值之后再经过U形Transformer中的HOA以及GGFN对鬼影进行消除并改善图像质量。1、GPIA首先解决曝光的问题然后再来谈运动的事极大的亮度差别会对特征匹配造成影响在GPIA中用Retinex理论中的“照明主要是低频信息”来处理参考特征和辅助特征并且做16*16的平均池化得到全局照明先验之后再求出亮度比例图。RUp(LRef) εUp(LAux) εFAux′FAux⊙RR 代表的是辅助帧与参考帧之间的光强校正系数在此之前要先把辅助特征的曝光值调整至接近于参考帧的程度之后再由后面的网络来单独去解决运动伪影以及亮度差异的问题。2、HOA把鬼影改成几何投影HOA是本文最重要的设计部分它不单单依靠特征相似度来判断要保留哪些内容了而是明确定义了参照特征和辅助特征的关系并且对它们进行了学习冲突方向 v并且把运动鬼电影看作是沿着这个方向产生的干扰分量。HhopI− αv**vT标准Householder变换用I-αvTvT把向量关于一个超平面做镜像本文把常数2换成可学的通道缩放系数α之后可以使各个通道自己调整鬼影抑制的程度。图4 蓝色向量被超平面反射之后就变成了绿色向量论文用上面这个几何过程来把不一致的运动分量从辅助特征里正交地去掉。为了防止把真实的细节一并去掉在模型中会利用到参照特征和辅助特征之间的差异幅度来产生一个强度门控M并且只有当两者之间存在较大的差别时才会对投影滤波施加更大的影响。FcleanFAux− α ·M**v⊙ (vTFAux)可以把它看作是首先求出辅助特征在冲突方向上的分量然后从原来的特征里去掉这部分之后得到的就是fclean它更接近于参照帧的有效结构。3、GGFN用固定的梯度先验来保护边缘去掉鬼影之后还要注意不要把边沿、纹理等细节给抹杀了在此情况下有两种途径可以走一种是用可训练的深度卷积网络来捕捉语义以及局部特征另外一种则是直接利用固定好的拉普拉斯算子来求解二阶导数。KLap⎡ 0 −1 0 ⎤⎢−1 4 −1⎥⎣ 0 −1 0 ⎦Xhidden DWConv(Xin) β(Xin⊛KLap)β 初始值设为 0在此之前模型会用普通的卷积分支来训练并且之后还会加入 Laplacian 边缘先验。因此既可以保持网络的学习能力又可以加强灯光边沿、人物轮廓以及阴影细节。图5 三个模块各司其职GPIA 调整亮度、HOA 依据不同方向滤除鬼影、GGFN 利用Laplacian分支还原高频率边沿。HOP就是一种思想方式即把问题看作一个整体来思考。首先把各个曝光不一致的照片亮度调至同一个标准上然后找出参照帧和辅助帧之间存在的矛盾之处并且通过正交投影来消除运动伪影在此之后再用梯度先验的方法给边沿以及纹理做填充工作。04 实验结果训练集有1493组ExpoMotion序列测试时用到的是带有GT的可控制运动样本共132组以及没有GT的真实运动样本共113组在进行150个epoch的训练过程中使用了AdamW算法并且把初始的学习率设为2×10−4并且用四块NVIDIA V100进行训练。全参考结果HOP-B 在 Kalantari17、RealHDRV 以及 ExpoMotion 中都达到了28.804分贝、28.704分贝、28.720分贝Kalantari17 的增益比Restormer高大约0.5dB左右而且参数量为15.69M只占Restormer的一半不到。轻量级HOP-S只有3.699M参数仍然可以获得很好的结果。表1 HOP-B 在三个完整的基准测试集中都得到了最好的综合成绩而HOP-S 更加突出了它的轻量化的优点。图6 人物、灯柱以及夜晚墙面等地方仍然有重影、变形或者噪点等问题而使用HOP之后可以很好地还原出高光网格、暗处细节以及移动物体轮廓。跨数据集泛化在 Sen 和 Tursen 测试集中用 ExpoMotion 对 HOP-B 进行训练之后得到MUSIQ 62.74百万比用Kalantari17训练得到的结果高57.87个百分点用RealHDRV训练得到的结果高60.89个百分点。也就是说并不是单纯的网络性能提高了数据量以及真实的运动多样性也很重要。表2 ExpoMotion 对于两个真实的运动测试集进行训练之后得到的结果比其他方法更好一些在MUSIQ、DeQA、PAQ2PIQ以及HyperIQA这四个指标上都表现得比较好。图7 小样本量的数据所得到的模型容易造成枝节不清在强光处还会出现形态畸变ExpoMotion 训练出来的模型对于真实的运动以及各种各样的光照条件都比较有抵抗力。消融实验单独加入GPIA、HOPU和GGFN三个模型可以提高大约0.4dB完整的模型比基准值提高了27.45dB。28.50dB累计增加1.05dB但是参数量只由原来的3.3818M增加到现在的3.6990M左右增加了大约9.3%。表3-4中GPIA可以改善人脸和暗部的噪声恢复效果而HOPU对于运动伪影抑制的效果最好在这三个模块一起使用的情况下可以获得最好的效果。05 总结与思考ExpoMotion 不是简单的把数据放大而是把数据做大的过程。真实的运动、极强的曝光以及专家偏好的倾向并且加入了多曝光融合评价。HOP 不再仅仅依靠相似度匹配来实现去鬼影的效果而是对去鬼影进行了新的定义。特征空间中正交拒绝的问题然后进行亮度预对齐以及梯度先验补齐的过程。一句话总结首先利用ExpoMotion补齐动态多曝光的数据然后用Householder投影找出并且去掉运动冲突的部分使得最终的结果既没有鬼影又保留了亮度、对比度以及纹理等信息。现在HOP使用的是固定的三帧输入方式对于曝光帧数可以变化的相机或者数据集仍然存在一定的限制。作者也表示会把支持灵活输入帧数作为接下来的研究方向之一。EXPOSITION · MOTION · ORTHOGONAL PROJECTION往期推荐
返回列表