图片 图1、SOI脊波导[1] 本节主要介绍用于计算SOI波导系统应力分布的模型,该系统由硅基板、二氧化硅下包层和二氧化硅上包层组成(图1)。
论文题目NTIRE 2025 Challenge on Efficient Burst HDR and Restoration:Datasets, Methods, and Results1简介本文回顾了 NTIRE 2025 高效连拍HDR 和修复挑战赛,该挑战赛旨在推进高效的多帧高动态范围 (HDR) 和修复技术。该挑战赛基于一种新颖的 RAW 多帧融合数据集,该数据集包含每个场景的九个具有不同曝光等级的噪声和未对齐的 RAW 帧。参与者需要开发能够有效融合这些帧的解决方案,同时遵守严格的效率约束:模型参数少于3000万,计算预算低于4.0万亿FLOPs。共有217名参与者注册,最终有六支队伍提交了有效的解决方案。表现最佳的方法达到了 43.22 dB 的 PSNR,展示了新方法在该领域的潜力。本文全面概述了这一挑战,比较了所提出的解决方案,并为高效突发 HDR 和修复领域的研究人员和从业人员提供了有价值的参考。原始图像融合是图像信号处理中的一项关键任务,在现实世界中有着广泛的应用。由于拜耳输入中存在缺失值及其特定形式,它需要稍微不同的处理技术,并被认为是一项具有挑战性的任务。多帧融合旨在通过使用具有连续时间序列的多张图像来获得高质量的图像,例如 RAW 连拍降噪 或 RAW 图像超分辨率 。特别是在过去的十年中,图像处理的深度学习技术得到了迅速发展,以解决日益困难的问题,例如降噪 、去模糊 、超分辨率 (SR) 和高动态范围 (HDR) 重建 。具体而言,多重曝光图像包含更丰富的信息,并且已经提出了各种方法来从退化的多帧输入中恢复清晰的图像。在过去的十年中,研究人员越来越多地探索使用具有不同曝光水平的噪声、模糊、未对齐帧进行多重曝光图像融合。此外,之前的一个图像恢复与增强新趋势(NTIRE)挑战赛专注于从连拍和双重曝光输入中恢复和增强低光RAW图像,从而产生了若干新颖的方法和见解。这些进展表明,尽管多图像处理方法存在固有的挑战,但它们在解决此类问题和获得更准确的结果方面具有显著的优势。受先前工作启发,在 NTIRE 2025 中提出了一个新的挑战,即通过融合多个退化的 RAW 帧来恢复 RGB 图像。特别地,与之前的挑战相比,引入了一个更困难的任务,即结合混合噪声分布(高斯和泊松)、增加输入帧的数量,并应用几个具有挑战性的退化过程。多帧融合任务在之前的NTIRE挑战赛中尚未涉及,预计将对该领域的发展做出重大贡献。此外,本次挑战赛的另一个关键目标是鼓励参赛者开发适用于设备端部署的高效网络架构,从而实现实际应用。总而言之,本文介绍了 NTIRE 2025 中关于高效突发 HDR 和修复的挑战赛,该挑战赛旨在从一个新颖的角度探索高效的多帧融合解决方案。参赛者的任务是设计一个合适的图像信号处理 (ISP) 模块,以从九个未对齐、有噪声和退化的 RAW 输入中合成干净、对齐的 HDR RGB 图像。在最终测试阶段,六支队伍成功提交了有效解法。本文概述了他们的方法并报告了他们的性能。所提出的方法突出了高效多帧HDR融合和修复领域中潜在的最新技术基准,预计不仅会加速该领域的研究,还会推动现实世界的工业应用。2. NTIRE 2025 高效连拍HDR和修复挑战赛2.1. 概述本次竞赛的目标是开发一种用于突发 HDR 和修复的高效算法。更准确地说,任务包括从多个以不同曝光时间捕获的连续 RAW 帧生成 HDR 图像。 这需要对在一段时间内拍摄的 RAW 帧进行对齐和去噪,每个帧具有不同的曝光设置(并因此具有不同的噪声水平),然后有效地融合它们。本挑战赛旨在使用智能手机或数码单反相机等设备模拟现实世界的移动摄影场景。其主要目标是通过鼓励开发高效的设备端图像信号处理(ISP)模型,从而激发移动和相机应用程序的创新。具体而言,本次竞赛需要解决以下三个关键任务:1. 多帧RAW图像融合:输入由连续的多帧RAW Bayer图像组成。2. HDR图像合成:输入图像呈现出不同的亮度级别,导致色彩饱和。目标是将这些帧融合为一张高动态范围(HDR)图像。3. 恢复:输入包含不同程度的噪声,目标是恢复干净的真实图像 (GT)。总而言之,设计一种同时适用于多帧融合和复原的高效算法仍然是一项具有挑战性的任务。本次竞赛的最终目标是开发一种适用于设备端部署的方法,从而在移动设备上实现真实世界的应用。2.2.数据集为了鼓励创新方法,在本次竞赛中引入了一个新的合成 RAW HDR 融合数据集,而不是使用现有的多帧 RAW 融合数据集,例如 BurstSR 、SyntheticBurst、LLFF-N或先前 NTIRE 挑战赛中的其他数据集 。具体而言,训练数据集是使用虚拟成像流程生成的。对于每个场景,捕获九个具有不同曝光级别的干净 RAW 帧,并从这些帧合成相应的真值 (GT) HDR RGB 图像。所提供的 RAW 帧具有三种不同的曝光级别(低、中和高),从而产生三种不同的噪声级别。为了模拟真实世界的突发RAW图像采集,该数据集包含了多种退化,包括噪声、旋转、平移和运动模糊。每个序列中的第一帧作为参考帧,它与真值图像完美对齐。图1展示了数据集中一个场景的示例构成。该数据集的核心目标是鼓励参与者探索如何在考虑每一帧独特特征的同时,有效地利用来自多个输入帧的信息。训练集、验证集和测试集均采用相同的方法构建,所有图像的分辨率均为768(H) × 1536(W),如图1(a)所示。训练集由300个场景组成,每个场景包含九个RAW输入帧和一个ground-truth RGB图像。验证集和测试集各包含20个场景,这些集合中的GT图像对参与者隐藏。2.3 挑战规则2.3.1. 度量评估基于生成图像与对应真实图像之间的比较。遵循之前的NTIRE挑战赛,使用整个测试集上的平均峰值信噪比(PSNR)来确定最终排名。虽然数据集以16位.tif格式提供,但PSNR是在转换为8位格式后测量的。作为补充参考,还向参与者提供以灰度计算的结构相似性指标(SSIM)。2.3.2. 模型参数和 FLOPs 的限制由于本次竞赛强调开发高效的设备端模型,因此对计算成本和内存有严格的限制。具体而言,当生成大小为 1 × 3 × 768 × 1536 的全尺寸输出 RGB 图像时,提交的模型不得超过 30M 参数和 4T 浮点运算 (FLOPs)。FLOP计数采用fvcore模块中的FlopCountAnalysis函数进行测量,该方法已被先前的工作采用。2.3.3. 其他可以使用任何训练技术。例如,他们可以利用外部公共数据集进行预训练,整合预训练网络,或利用生成模型/transformers等。此外,对内存使用或推理时间没有进一步的约束。最后,并非必须使用所有输入帧。为了优化计算效率并减少FLOPs,参与者可以选择性地使用一部分帧,然后再应用融合技术。2.4. 挑战阶段(1) 训练与验证阶段:参与者将获得来自构建的数据集的300个训练场景对和20个验证输入。训练阶段持续三周,在此期间,参与者可以提交他们的验证结果以获得PSNR反馈。验证集的GT图像对参与者保持隐藏。相反,他们可以将其增强后的结果提交到评估服务器,服务器将计算生成图像的PSNR和SSIM分数,并提供即时反馈。所得的PSNR值将显示在排行榜上,对所有参与者可见。(2) 测试阶段:测试阶段持续一周,在此期间,参与者可以提交他们的最终结果。他们可以访问包含20个场景的测试集,但GT图像保持未公开状态。与验证阶段类似,测试结果的PSNR分数将显示在排行榜上。参与者需要将他们增强后的输出提交到Codalab评估服务器,同时通过电子邮件向组织者发送包含其代码和情况说明书。组织者会验证并执行提供的代码,以验证最终结果。3. 挑战结果本次比赛共有217名参与者,最终有六支队伍提交了他们的最终结果。他们的量化性能总结在表1中,而图2可视化了测试集中几个场景的定性结果。ImvisionAI团队赢得了比赛,在测试集上获得了最高的PSNR值43.22 dB,比第二名团队高出0.47 dB。他们的模型旨在充分利用比赛的约束条件(30M模型参数和4.0T FLOPs),以最大限度地提高性能。此外,他们的模型还实现了最高的 SSIM 分数 0.992,略微超过了第二名的结果。从效率的角度来看,每个模型的推理时间是在相同的条件下使用单个 NVIDIA H100 GPU 测量的。恢复完整尺寸(768 × 1536)图像所需的时间取平均值,并在表 1 中报告。ImvisionAI 团队的获胜模型具有最长的推理时间,约为 7 秒,而 CidautAI 团队实现了最快的处理时间,为每张图像 64 毫秒。考虑到速度和性能之间的权衡,选择合适的模型取决于具体的应用需求。值得注意的是,效率评估的另一种方法是使用 PSNR/时间 指标,如其他挑战赛中所示。如果本次比赛采用此指标,排名和模型设计可能会有所不同。例如,Team ImvisionAI 的推理速度慢并非由于 GPU 计算,而是由于架构瓶颈,这可以进一步优化。重要的是要注意,本次比赛没有施加超出定义的运行时间或内存使用限制;相反,主要重点是在给定的资源限制内实现最佳性能。为了比较参与者模型的定性性能,选择了六个具有代表性的测试场景,这些场景突出了他们结果的关键特征。这些选定的场景显示在图2的第一行中,并放大了裁剪的图像块以进行详细检查。在图2(a)中,所有参与者都成功地恢复了场景中明亮区域的纹理。然而,合成图像中开始出现伪影,例如图2(b)最右列中的垂直线,或(c)中右边两列的噪声输出。这个问题在暗区字母的恢复中变得更加明显,如(d)所示,只有前三名的团队产生了清晰可辨的结果。最后,分析了结果与模型复杂度的关系。值得注意的是,亚军团队 DeepTrans 在参数数量不到 ImvisionAI 团队一半的情况下,取得了视觉上可比的结果。尽管观察到一些精细细节上的差异,但他们的方法展示了性能和效率之间的有效平衡,使其成为在时间和内存约束至关重要的现实世界应用(如设备端环境)中的有力候选者。4. 挑战方法4.1 ImvisionAI通用方法描述。团队提出了一种具有时空解耦的递归多曝光对齐方法,名为RASD,用于高效的连拍HDR和修复。从RAW到RGB的连拍HDR和修复,旨在提供端到端的解决方案,由于两个关键矛盾而成为一项具有挑战性的任务:(1)多曝光数据域中由亮度、噪声、饱和度和死黑区域引起的信息差异,以及(2)对齐和修复在时域和空域上的差异。忽略这些因素会导致低效的联合优化。为了应对这些挑战,该团队提出了一个框架,该框架在对齐和恢复阶段都明确考虑了这些矛盾。具体而言,如图3所示,对于对齐,该团队利用统计导出的亮度先验进行无截断曝光对齐,使其朝向最长曝光,以防止因饱和像素过多而导致的对齐错误,并引入递归的基于流的增强可变形对齐(F-EDA)模块来实现多曝光空间对齐。具体而言,由于 spynet是在非线性 RGB 域中训练的,该团队使用可学习的特征映射将输入转换到具有较小差距的域中,从而减少光流误差,并使 spynet能够进行更准确的光流估计。这些确保了在不同曝光水平下更稳定和准确的对齐。此外,为了平衡对齐和复原之间的权衡,该团队采用了一种两阶段训练策略,将时空学习解耦。在对齐阶段(阶段 1),该团队使用少量 Restormer块来最大化对齐效果。在复原阶段(阶段 2),该团队使用完整的 Restormer 架构来最大化整体复原效果,解决模糊、噪声问题,并提供从 RAW 到 sRGB 的映射。此外,他们发现,在恢复阶段分解拜耳模式通道会显著降低准确率。因此,他们保留了原始的 RAW 模式格式。他们分析认为,分解操作丢失了不同颜色通道之间的空间关系,从而降低了恢复准确率。实现细节。团队使用了AdamW优化器(α = 0.9 且 β = 0.9),在第一阶段和第二阶段均进行了1000个训练epoch。学习率的初始值为8 × 10−4,并使用余弦退火策略进行更新。图像块大小设置为 128 × 128 像素。对于数据增强,他们仅使用了 bayeraug进行随机翻转和转置。在测试阶段,该团队使用了 TLC 进行全图像推断,并注意到 TLC 的加入没有带来复杂度的提升。4.2. DeepTrans通用方法描述。他们的模型的整体架构如图4所示。他们首先采用光流对齐块(Optical Flow Alignment Block, OFAB)来对齐九个输入的RAW帧。该模块包含用于浅层特征提取的卷积层,并集成了预训练的SpyNet 用于光流估计。由于原始模型是为四通道RAW输入设计的,而输入数据由单通道RAW图像组成,因此他们根据RGGB拜耳模式将它们转换为四通道格式。这种转换会将每帧的空间分辨率降低一半。对齐后,将九个转换后的帧进行拼接,并通过转置卷积层以恢复原始空间分辨率。此操作能够有效地聚合和利用来自多个输入帧的互补信息。然后,将融合的特征输入到四层对称的编码器-解码器架构中,以提取深层表示。编码器-解码器的每一层都由多个Transformer块组成。编码器逐步降低空间维度,同时增加特征维度,而解码器相应地对低分辨率的潜在特征进行上采样,以重建高分辨率表示。为了方便重建过程,引入跳跃连接,以在每一层将编码器特征与相应的解码器特征连接起来。随后,将卷积层应用于精细化的特征以预测残差图像。最后,采用转置卷积层来生成与残差具有相同通道数的对齐参考帧。通过将残差加到该参考帧上来获得恢复的图像。实现细节。在训练过程中,图像被随机裁剪成 128 × 128 大小的图像块,并进行随机翻转和旋转。使用 PyTorch 框架,并采用 Adam 优化器,其中 β1 = 0.9 且 β2 = 0.999。初始学习率设置为 2 × 10−2,使用 CosineAnnealingLR ,在 80 个 epoch 内逐渐降低至 2 × 10−4。该模型在8个RTX 4090 GPU上进行了训练,总共训练了80个epoch,相当于1天的训练时间。4.3. SimonLarsen通用方法描述。SimonLarsen 团队提出了如图 5 所示的 FlowCNRDB 模型。他们的目标是构建一个现代化的融合和恢复模型,该模型不采用自注意力机制,而是应用 ConvNeXt 和 ConvNeXt V2中概述的设计原则,以产生一个高效且完全卷积的模型。整体网络架构由三个阶段组成:特征提取、帧对齐,以及最终的联合融合与恢复模型。在第一和第二阶段,每一帧被并行处理,而最后一个阶段则将所有帧一起处理,以产生最终输出。该模型的所有阶段都采用了ConvNeXt V2的基本块设计,该设计采用大核深度卷积,然后是逐点MLP和全局响应归一化(GRN)。为了避免过拟合,dropout贯穿整个模型。当在patch输入上训练时,GRN中的全局特征聚合将导致训练-测试时间的不一致性。为了缓解这个问题,在推理过程中使用了一种类似于测试时局部转换的局部聚合方法。特征提取阶段将每一帧Ii ∈ RH×W ×1编码成一个潜在表示Zi ∈ R H2 × W2 ×C。输入帧首先使用步长为2的2 × 2卷积进行分块。选择该分块大小是为了匹配原始拜耳输入的GRBG滤波器大小。然后通过一系列 ConvNeXt (CN) 块提取深度特征。帧对齐模型是一个由CN块构成的U-Net架构。给定一个编码后的参考帧和目标帧(Zref, Zi) ∈ R H2 × W2 ×2C(在通道轴上连接),该模型输出一个稠密光流场Fi ∈ R H2 × W2 ×2,用于估计参考帧和目标帧之间的位移。预测的流场被用于使用双线性网格采样来扭曲目标帧,使其与参考帧匹配。目标帧外的令牌用零填充,并计算一个填充掩码,以便在融合阶段使用。融合与复原阶段接收全部对齐的帧和填充掩码,并在通道轴上进行连接,并预测最终的RGB输出图像Yˆ ∈ RH×W ×3。在训练期间,帧在三个曝光时间组内随机打乱,以有效防止模型将特定通道与参考帧相关联。此步骤对于强制模型利用所有帧是必要的,并因此学习如何在第二阶段对齐帧。融合阶段由一系列ConvNeXt残差密集块(CNRDB)组成,其宏观设计类似于DRCT,但将Swin Transformer层替换为CN块。此外,在每个CN块之前使用一个线性层将通道数投影到一个通用大小,以约束参数的数量。融合阶段的输出未经修补,经过一个 2 × 2 像素重组操作,然后进行一个 3 × 3 卷积,降至 3 个通道,以生成最终输出图像。训练细节。该模型仅使用所提供的训练数据集进行训练,其中最后20个场景被保留用于验证。对于数据增强,使用了保留Bayer格式的水平/垂直翻转、旋转(以90度为增量)和随机裁剪。该模型仅使用MSE损失进行训练。没有使用额外的损失来监督帧对齐。该模型在 256×256 分辨率下,以批量大小为 10,在单个 NVIDIA RTX A6000 GPU 上,使用自动混合精度训练了 224k 次迭代。初始学习率设置为 3 × 10−4,并使用余弦退火策略逐渐降低至 10−7。在整个训练过程中,使用了AdamW优化器,其权重衰减 = 0.01,β1 = 0.9,以及β2 = 0.999。4.4. E Group通用方法描述。E组团队提出了一个利用SFHFormer块的模型,该模型由一个包含五个阶段的分层编码器-解码器结构组成。该结构包括一个双尺度编码器(阶段-1和阶段-2)、一个瓶颈(阶段-3)以及一个双尺度解码器(阶段-4和阶段-5)。SFHFormer模块的核心组件包括:(a)局部全局感知混合器(Local Global Perception Mixer, LGPM)和(b)多核ConvFFN(Multi-kernel ConvFFN, MCFN)。LGPM旨在捕获局部和全局特征表示,而MCFN通过多核卷积增强特征转换能力。训练策略。E组团队采用AdamW优化器,参数为β1 = 0.9和β2 = 0.999,来训练SFHFormer模型。初始学习率设置为7.5 × 10−4,并采用余弦退火策略,将学习率从初始值逐渐降低至5 × 10−6。这种学习率调度器对于微调至关重要,因为它能够实现平滑收敛,并通过周期性地重启退火过程来帮助模型逃脱局部最小值。除了优化器设置,E组的训练过程还整合了mixup数据增强,mixup参数为β = 1.2,并启用了恒等映射。这种增强策略通过在训练样本之间进行插值来增强数据多样性,从而提高模型的鲁棒性。此外,E组团队的框架利用FFT损失(fftLoss)进行像素级优化。FFT损失的权重为1.0,并采用均值缩减,在频域中运行以捕捉高频细节,从而改善复原图像中精细纹理和边缘的恢复。这种方法缓解了通常与直接像素级损失(如L1或L2)相关的模糊问题。E组团队还将预训练权重纳入训练流程。通过使用从先前训练阶段获得的权重初始化模型,微调过程得以加速,并且模型受益于已学习的特征表示,从而确保在修复任务中获得更好的性能。所有实验均在使用 PyTorch 1.11.0 的系统上进行,该系统配备了两块 NVIDIA 4090 GPU。 批大小设置为 2,并使用 256 的裁剪尺寸,这些参数针对内存效率和高分辨率图像数据的有效训练进行了优化。这种综合训练策略,结合了高级优化器设置、动态学习率调度、有效的数据增强和频域损失计算,确保了SFHFormer模型在全球结构恢复和局部细节增强方面都取得了平衡的性能。4.5. CidautAI通用方法描述。该挑战涉及处理具有不同曝光度的原始图像序列,对齐这些图像,然后将它们融合为单个 HDR 图像,同时最大限度地减少计算资源。CidautAI 团队提出了在 FLOPs 和运行时间方面效率最高的解决方案。他们提出的名为DarkIRFusion的解决方案,通过一种高度优化的方法来解决这些约束。该解决方案基于DarkIR在低光照图像增强(LLIE)方面的良好结果。他们提出的模型 DarkIRFusion 的架构如图 7 所示。在第一阶段,一组九张不同曝光时间的输入帧通过对齐(Alignment)阶段。然后在第二阶段,对齐后的图像被引入到编码器-解码器 DarkIR 架构中,该架构最终返回输入集合的融合 HDR 图像。该方法比要求的尺寸小10倍(30M),所需操作比硬件要求少14倍,并且在NVIDIA H100 GPU上实时运行(≈ 15 FPS),在RTX 4090上实现了近8 FPS。对齐阶段。引入九张输入图像,并将其分为数据集中给出的3组相同曝光的三元组(见图7)。每个三元组被引入到对齐模块中,并且对于每张图像,使用FlowMask Block估计光流(flow)和掩码。此模块将级联卷积应用于参考图像和目标图像的连接,返回 Mask 和 Flow(见图 7)。DarkIR。该神经网络遵循基于Metaformer结构的编码器-解码器架构。编码器利用傅里叶信息,专注于HDR照明和色彩问题。因此,编码器生成一个具有校正后的照明和色彩的低分辨率融合图像xˆ↓8。该团队通过引入引导损失来确保编码器在这些问题中正常工作。解码器则专注于使用先验的增强照明编码特征来进行放大,并减少未对准模糊和噪声伪影。DarkIR实现的输出建立在与对齐阶段输出的残差连接之上。这个张量最终通过一个3x3卷积层转换为输出图像——这可以被理解为一个融合去马赛克层。训练细节。所提出的方法仅使用挑战数据集从头开始训练。为了训练DarkIRFusion,该团队使用AdamW,设置β1 = 0.9,β2 = 0.9,权重衰减为10−3。学习率初始化为10−3,并遵循余弦退火策略更新至最小值10−7。使用了不同尺寸(比例2:1)的矩形裁剪,并应用了随机的水平和垂直翻转。训练遵循多步策略,每一步都减小批量大小,同时增大裁剪尺寸。在个epoch的四个不同连续步骤中,他们分别使用了patch尺寸[(256,512), (384,768), (512,1024), (768,1536)]和批量大小。该模型在四个 H100 GPU 上训练了大约 20 小时。以下损失组合被用于优化:在 (1) 中的所有距离均使用 L1 范数计算。∇ 代表梯度运算,YUV 代表颜色空间变换。参考真值图像和清理后的图像分别是 x 和 xˆ。4.6. X-L通用方法描述。在突发HDR和修复任务中,从多个帧中高效提取信息并执行高性能的多帧对齐、融合和重建至关重要。为了解决这个问题,X-L团队提出了一种使用特征编码器的方法,该编码器包含五个残差通道注意力块(RCABs)来提取关键信息。这些特征随后被输入到一个增强的可变形对齐模块,该模块将相邻帧对齐到参考帧。在对齐模块之后,这些特征通过级联的置换自注意力块(PSABs)进行处理,以建模全局关系。最后,这些特征被输入到解码器,解码器由五个RCAB和一层卷积层组成,以产生最终输出。这种方法确保了稳健的对齐和有效的全局上下文建模。训练策略。在训练阶段,他们使用Adam优化器,指数衰减率设置为β1 = 0.9和β2 = 0.999。初始学习率配置为4 × 10−4,并且每200个epoch减半。他们使用了Charbonnier惩罚损失,并且批次大小设置为4。所提出的方法使用 PyTorch 框架实现,并在单个 NVIDIA 4090 GPU 上执行。5. 讨论与结论5.1.讨论观察参与者们不同的方法,首先值得注意的是,几乎所有参与者都采用了共同的模型结构,即先进行帧对齐,然后进行修复。正如ImvisionAI团队分析本次竞赛时所说,将每个模块的角色进行划分,并逐步解决问题,而不是用单个模型同时执行多个任务,取得了有效的结果。虽然在光流的计算方式上存在细微差异(例如,Spynet(ImvisionAI团队),TMRnet(DeepTrans团队),U-net(SimonLarsen团队),简单的可变形编码器(X-L团队)等),但计算光流以引导和影响扭曲优先于修复阶段。此外,SimonLarsen团队和X-L团队尝试了在提取的特征空间上进行多帧对齐。这种方法对于进行额外的研究具有重要意义,以确定在降噪或提取的时空特征上进行对齐(如X-L团队尝试的那样)是否能产生更好的结果。其次,大多数团队都采用了简单的损失函数,这是比赛中最大化 PSNR 值的常用方法。ImvisionAI 团队直接使用了 PSNR 损失,而 DeepTrans 团队和 SimonLarsen 团队分别使用了 L1 和 L2 损失函数。CidautAI 团队进一步施加了额外的基于梯度的损失 (1),但它仍然与 L1 损失具有相似的见解。如果需要解决那些定性结果更为重要,且提高PSNR不是首要任务的任务,那么使用额外的损失函数和正则化方法,例如score distillation ,可能会带来更好的结果。第三,讨论提交模型的效率。尽管团队ImvisionAI的模型记录了最佳性能,但它也紧密地消耗了比赛的资源约束。第二名团队DeepTrans以更少的参数实现了比SimonLarsen更好的结果。虽然它消耗了更多的FLOPs,但经测量,当提供高端GPU时,它具有更快的推理时间。如果环境需要低端GPU或NPU,并且推理时间更重要,例如在移动智能手机中,那么团队SimonLarsen的结果可能更合适。最后,CidautAI团队专注于优化模型,并实现了最短的推理时间。他们的研究方法可以通过稍微增加模型大小(简单地增加层数和通道数)来进一步发展,以牺牲少量推理时间为代价,从而获得更好的性能。5.2.结论本文全面概述了 NTIRE 2025 高效突发 HDR 和修复挑战赛及其结果。在 217 名注册参与者中,有六支队伍提交了最终结果。该比赛引入了一个新颖的突发 HDR 融合数据集,包含 300 个场景,每个场景有九个多重曝光输入帧。ImvisionAI团队脱颖而出,成为获胜者,在该数据集上取得了43.22 dB的最高PSNR值。他们引入了一种递归的基于流的增强型可变形对齐(F-EDA)模块来处理多重曝光图像,并采用了一种两阶段训练策略来分别学习帧对齐和恢复任务。其他五个团队也提出了高效的模型和学习策略,每个团队都强调了时间和内存效率的不同方面,这可能有利于未来的相关任务。最后,建议可以通过考虑额外的指标(例如 PSNR 和运行时间),或者通过在图像信号处理中引入进一步的退化(例如,坏像素校正、固定模式噪声、镜头阴影校正等)来进一步增强此项竞赛。
页:
[1]
