开发者社区 > 博文 > AAAI 2026 | FANoise:特征自适应的噪声注入策略
分享
  • 打开微信扫码分享

  • 点击前往QQ分享

  • 点击前往微博分享

  • 点击复制链接

AAAI 2026 | FANoise:特征自适应的噪声注入策略

  • jd_KzITHhuCvyId
  • 2026-07-24
  • IP归属:北京
  • 53浏览

    TL;DR: FANoise,一种新颖的特征自适应噪声注入策略,旨在增强多模态表征学习的鲁棒性和泛化性。现有噪声注入方法多采用启发式或静态噪声,未能适应训练过程中特征分布的动态变化。本文通过对 InfoNCE loss 的梯度分析和特征奇异值分解 (Singular Value Decomposition, SVD) 视角,深入研究了噪声的作用机制。

    论文地址


    一、背景与动机

    表征学习是文本检索与多模态理解等任务的基石。当前主流多模态表示方法多基于对比学习(如 CLIP、GME、VLM2Vec),但学习鲁棒性和泛化能力强的表征仍然具有挑战性。虽然在特征层主动注入噪声可作为一种数据增强手段提升编码性能,但现有方法多依赖启发式或静态噪声,忽视了训练过程中特征分布的动态变化与结构差异。尤其在高维多模态特征空间中,统一噪声容易破坏弱但关键的判别特征。本文旨在探索噪声如何影响表示学习,提出对噪声进行特征自适应调制,在增强鲁棒性的同时尽量减少信息损失。

    二、理论分析

    2.1 InfoNCE Loss 梯度视角

    InfoNCE Loss 的目标是拉近正样本对 (positive pairs) 而推远负样本对 (negative pairs)。我们以 InfoNCE  Loss作为训练目标,其中是归一化后的 embedding,是温度参数:

    为了分析梯度对表征的影响,我们分析了InfoNCE Loss对模型参数的梯度:

    其中,

    可以发现,梯度旨在减小之间的距离,同时最大化与整体加权平均方向的偏离,从而增强表征空间的各向同性。

    2.1.1 噪声驱动的 InfoNCE Loss

    当对 embedding注入高斯噪声,此时 InfoNCE Loss 对的期望变为:

    采样分布足够均匀,平行于,定义:

    这表明噪声等价于赋以负样本更大的权重,促使更快地远离加权平均方向并接近正样本。而对 embedding注入噪声不会对产生额外的期望项,

    2.2 特征分布视角

    定义特征,m 是批处理大小,n 是特征向量的维度。通过奇异值分解 SVD,我们得到:

    其中,是酉矩阵,是对角矩阵,对角线上的元素是降序排列的、非负的奇异值,的每一列(记作)是一个向量,它代表了数据空间中的一个特定方向。的方向告诉我们数据在哪个“方向”上变化最大、结构最明显。对角线上的每一个奇异值对应于的一个特定方向,较大的奇异值对应着数据中更重要、变化更显著的方向。

    传统噪声注入方法对所有特征维度应用均匀噪声,导致在高维空间中噪声能量随维度线性增加,可能淹没信号,特别是有弱信号强度的判别性特征。为解决这类问题,通常使用对噪声进行缩放,使总噪声能量保持恒定。然而,这种均匀的噪声无法区分特征方向的重要性,关联较小奇异值的特征维度在噪声下信噪比(SNR)下降更快。这一观点具备理论基础:

    1. 谱扰动理论(Spectral Perturbation Theory):根据 Weyl 定理,占主导地位的特征 (奇异值大小远大于噪声谱范数)在噪声扰动下保持稳定,反之边缘特征可能遭受信噪比崩溃。
    2. 随机矩阵理论(Random Matrix Theory):当数据和噪声混合时,会出现一个临界阈值。高于阈值的奇异值能从噪声中凸显出来,反之会被噪声淹没、统计上与噪声不可区分。
    3. 信息论视角(Information-Theoretic Perspective):均匀的噪声注入可能破坏弱的、但有判别性的维度的有价值信息。
    理论回答的问题
    谱扰动理论哪些特征会被噪声破坏?指出小奇异值方向最脆弱。
    随机矩阵理论何时特征会“淹没于噪声”?给出临界阈值。
    信息论视角噪声是否破坏判别性信息?均匀噪声可能破坏判别性信息。

    三、FANoise 方法

    FANoise:一种基于奇异值分解(SVD)的特征自适应噪声注入策略,通过动态调制各主成分方向上的噪声强度,在保持有益正则效应的同时避免信息破坏,实现理论可解释、即插即用、跨架构泛化的多模态表示增强。

    基于上述理论基础,我们提出一种两阶段的噪声注入策略 FANoise。如上图所示,左图展示了“噪声加在哪”,使用 VLM(Vision-Language Model) 作为 backbone,query 和 target 可以是文本、图像、或二者的组合。对于训练中的每一个 batch 的数据,我们将 query 和 target 分别输入 VLM 中,各自得到 VLM 最后一层隐藏状态最后一个 token 对应的向量作为其对应的特征。在对比学习目标之前,分别对两组特征注入 FANoise 以提高表征的质量。右图展示了“噪声怎么加”,主要分为两阶段:

    1. 谱感知噪声生成与变换:
      1. 对输入特征进行奇异值分解(SVD),m 是批处理大小,n 是特征向量的维度;
      2. 在主成分空间生成噪声,根据奇异值进行自适应缩放:是某种缩放策略;
      3. 将缩放后的噪声变换回原始特征空间:.
    2. 维度归一化噪声注入:确保总噪声能量与特征维度无关:,其中是噪声强度值,是特征向量的维度。

    在这里,我们定义了 3 种噪声缩放策略

    • 均匀缩放:所有方向的噪声强度相同
    • 线性缩放:噪声强度与信号强度成比例(
    • 次线性缩放:介于均匀缩放和线性缩放之间(

    实验证明,次线性缩放效果最佳,因为它在高奇异值区域施加适度扰动,同时保护低奇异值区域不被彻底破坏,这与信息论视角的理论相符。

    FANoise的注入伪代码如下所示:

    四、实验结果

    我们在 MMEB benchmark对 FANoise 进行了全面评估,涵盖了分类、检索、视觉问答和视觉定位等 36 个数据集。结果显示,FANoise 在多个 backbone 模型(Phi3.5-V、Qwen2-VL-2B、LLaVA-1.6-LR、LLaVA-1.6-HR、Qwen2-VL-7B)上实现了一致的提升,平均性能提高 2.04%。这表明 FANoise 能够提升表征的鲁棒性,并很好地推广到不同架构和容量的模型。即使在分布外(OOD)任务中,FANoise 也能增强模型的泛化能力。

    五、结论

    表征学习的能力很大程度上取决于其能否捕捉到鲁棒且泛化的特征表示。虽然主动噪声注入作为一种数据增强手段被证明可以提升编码性能,但现有方法多依赖启发式或静态噪声,忽视了训练过程中特征分布的动态变化。本文从梯度动力学和特征分布的双重视角,系统地研究了噪声在对比学习(如 InfoNCE 损失)中的演化机制。基于以上理论支撑,本文提出特征自适应的噪声注入策略FANoise,根据奇异值大小在主成分空间自适应地调制噪声,确保在增强模型鲁棒性的同时,保护那些易被均匀噪声淹没的判别性特征。与先前的方法相比,FANoise作为一种即插即用的策略在不同架构和容量的模型中持续增强了模型鲁棒性和泛化能力。

    文章数
    1
    阅读量
    53

    作者其他文章