
AAAI 2026: MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation
论文链接: https://arxiv.org/abs/2512.22310
多元素商品视频生成demo:
| Prompt | Subject Image (必选) | Text Image (可选) | Background Image (可选) | 输出视频 |
|---|---|---|---|---|
| 眼镜在黑色闪粉包装上缓慢转动,金黑相间的镜框随动作轻轻摆动,金属部分反射光线闪烁,包装上的闪粉似有微风拂过的流动感,整个画面氛围从静谧转为精致优雅,光线柔和地聚焦于眼镜,凸显质感,广告文字始终稳定呈现,镜头固定不动。 | ![]() | ![]() | ![]() | link |
| 酒瓶周围的烟雾缓缓飘动,如轻柔薄纱般环绕,环境光线逐渐明亮,柔和地洒落在酒瓶与苔藓之上,整体氛围从静谧幽深转变为雅致温馨,所有元素始终稳定呈现,镜头固定不动。 | ![]() | / | ![]() | link |
| 戒指在柔和光线中慢慢转动,银色纹路与钻石闪烁的光芒随角度改变而变化,周围浅蓝色调光影缓缓流动,营造出优雅清新的氛围。广告文字始终稳定显示,镜头固定,商品完整呈现。 | ![]() | / | / | link |
| 水泡在腕表周围缓缓游动,大小不一的气泡自然浮动,水面光影随波动闪烁变化,呈现出专业潜水环境的动感氛围。腕表始终完整展示,广告文字稳定显示,镜头固定不动。 | ![]() | / | ![]() | link |
摘要:随着电商平台与短视频广告的普及,多元素商品视频生成正成为智能营销的重要能力。当前主流方法多借鉴通用多元素视频生成框架,通过文本提示与多张参考图像共同引导生成,以实现多商品同屏的内容合成。然而,当参考图像来自真实广告素材时,往往天然存在主体尺度差异(不同拍摄距离、裁剪比例、缩放程度)以及参考输入顺序变化(多元素条件通常被按序拼接或逐个注入)。这会触发两类关键失败模式:其一是尺度不一致,生成结果出现不符合常识的大小关系(商品被放大/缩小到失真,破坏画面可信度与表达逻辑);其二是顺序敏感,仅仅交换参考图像的输入顺序就可能导致主体扭曲、缺失或相互干扰,稳定性随主体数量上升而显著下降。为解决这两个核心问题,我们提出统一框架 MoFu:一方面通过尺度感知调制(Scale-Aware Modulation)从文本中提取隐式尺度线索,并在生成网络中进行显式调制,使模型在参考尺度波动时仍能保持自然的相对大小关系;另一方面通过傅里叶融合(Fourier Fusion)在频域聚合多参考特征,形成顺序无关的统一表示,从根源上消除逐个注入带来的顺序偏置。进一步地,我们设计尺度-顺序稳定性损失,在训练阶段联合约束尺度一致性与置换不变性,并构建专门的评测基准,通过受控缩放与随机置换系统性检验模型在两大挑战下的鲁棒性。整体而言,MoFu 以“尺度一致、顺序不敏感”为中心目标,显著提升多元素视频生成在复杂真实输入条件下的稳定性与可控性,为电商广告等多元素内容生产提供更可靠的生成底座。
一、背景及现状
多元素视频生成旨在根据文本提示与多张参考图像,合成包含多个主体的连贯视频内容,广泛应用于内容创作、虚拟角色生成以及电商广告等场景。近年来,基于扩散模型与 Transformer 架构的视频生成方法取得了显著进展,使模型能够在保持主体外观一致性的同时生成具有复杂运动和叙事结构的视频。然而,当生成任务从单一主体扩展到多个主体时,现有方法暴露出两个尚未被充分解决的关键问题:尺度不一致(scale inconsistency)与顺序敏感(permutation sensitivity)。
一方面,由于参考图像通常来源于不同拍摄距离、裁剪方式或缩放比例,主体在输入阶段便存在显著的尺度差异。现有方法往往缺乏显式的尺度建模机制,导致生成结果中主体大小失衡,出现违背常识的比例关系。另一方面,多数多元素生成框架依赖对参考图像的顺序化处理,例如按顺序拼接或逐个注入条件特征。这使得生成结果对参考输入顺序高度敏感,仅仅改变图像排列顺序,就可能引发主体形变、缺失甚至不合理的物理交互。随着主体数量增加,这种不稳定性进一步放大,严重制约了模型在真实复杂场景中的可用性。
如图1所示,现有方法在面对尺度变化或顺序扰动时,往往无法同时保持自然的主体比例与稳定的生成结果。这表明,当前多元素视频生成仍停留在“条件可用但不鲁棒”的阶段,其根本原因在于缺乏同时针对尺度一致性与顺序不变性的统一建模与训练机制。

图1:多元素视频生成的动机阐述
为了解决上述挑战,我们提出多元素视频生成框架MoFu,算法架构如图2所示。MoFu通过显式建模尺度信息并引入顺序无关的条件融合机制,从根源上缓解尺度不一致与顺序敏感问题。围绕这一目标,本文从三个核心问题出发展开研究:如何从文本中提取并注入可靠的尺度约束,如何在不引入顺序偏置的前提下融合多参考条件,以及如何系统性评估模型在尺度与顺序扰动下的生成稳定性。

图2:MoFu算法架构
二、如何解决尺度不一致?
针对多元素视频生成中的尺度不一致问题,关键困难在于:尺度信息并未显式出现在参考图像中,而是隐含在文本语义与主体关系之中。例如,“a girl holding a dog”隐含了明确的相对尺度关系,但参考图像可能由于拍摄视角或裁剪方式完全破坏了这种比例。现有方法通常仅将文本作为高层语义条件输入模型,缺乏机制将这类尺度线索转化为对生成过程的持续约束,从而导致主体大小随参考尺度波动而失控。
为此,我们提出 Scale-Aware Modulation(SMO),通过显式地从文本中提取尺度线索,并将其注入到生成网络的中间特征中,从而在特征层面约束主体的尺度关系。具体而言,给定文本提示,我们首先使用冻结的语言模型对其进行编码,得到语义表示:

该表示不仅包含主体类别信息,也隐含了主体之间的相对关系与尺度语义。随后,我们引入一个轻量级的 Scale Control Adapter (SCA),将文本语义映射为调制参数:

其中与分别表示尺度相关的缩放与偏移参数,而用于控制调制特征在残差连接中的作用强度。在生成网络(如 DiT block)中,给定中间特征表示,SMO 通过特征调制的方式显式注入尺度约束:

其中表示逐元素乘法,可以是自注意力或前馈模块。通过这种方式,尺度信息被持续地施加在生成过程的多个层级,而非仅在输入阶段提供一次性条件。
这种基于调制的注入方式,使得模型在面对参考图像尺度不一致时,能够优先遵循文本中隐含的尺度关系,而非被视觉输入中的尺度噪声所主导。换言之,SMO 将“尺度”从一个需要模型隐式推断的不稳定因素,转化为一个由文本语义显式控制的生成约束,从而显著提升了多元素视频在复杂尺度条件下的生成稳定性与自然性。
三、如何解决顺序敏感?
在多主体视频生成中,另一个关键挑战是顺序敏感性:生成结果会随着参考图像输入顺序的变化而发生显著改变。现有方法通常将多张参考图像按顺序拼接,或逐个注入生成网络进行条件控制。这类顺序化处理在实现上较为直接,但会在模型中引入隐式的顺序偏置,使得不同参考在特征融合过程中被不平等地对待。当输入顺序发生变化时,模型可能出现主体缺失、外观扭曲,甚至生成不符合物理常识的交互关系。
这一问题的根源在于:多参考条件本质上是一个无序集合(set),而顺序化注入方式却强行赋予其序列结构。随着主体数量增加,这种不匹配会被不断放大,严重影响生成稳定性与可控性。
为此,我们提出 Fourier Fusion(FF),一种简单而有效的顺序无关参考特征融合策略。其核心思想是:在高维特征空间中,不同主体的表示在频域中具有近似正交性,因此可以通过频域聚合的方式,构建对输入顺序不敏感的统一表示。
具体而言,给定 N 张参考图像,我们首先对每张图像进行主体分割与编码,得到对应的特征表示:

其中为轻量级卷积编码器。随后,我们将特征映射到频域:

在频域中,我们进一步将特征划分为高频与低频分量:

其中为基于径向频率的掩码。随后,我们对所有参考在频域中进行直接求和聚合:

最终,通过逆傅里叶变换将融合后的频域表示映射回空间域:

由于加法运算天然满足交换律,上述融合过程对参考输入的排列顺序保持严格不变性,从而在特征层面消除了顺序偏置。该统一表示随后作为条件输入注入生成网络,使模型在面对任意参考排列时都能保持稳定一致的生成结果。
通过 Fourier Fusion,多主体条件不再以“先后顺序”竞争模型注意力,而是以集合形式被等价地建模与融合。这使得生成结果对参考顺序具有鲁棒性,显著缓解了顺序变化带来的主体丢失与失真问题,并为复杂多主体场景下的稳定生成提供了关键支撑。
四、如何约束尺度与顺序模块?
尽管 Scale-Aware Modulation 与 Fourier Fusion 分别从结构上缓解了尺度不一致与顺序敏感问题,但仅依赖模块设计仍不足以保证模型在训练过程中真正学习到稳定且可泛化的生成行为。一方面,尺度约束需要明确告诉模型“哪些区域更重要、尺度误差应该被如何惩罚”;另一方面,顺序不变性也需要在优化目标中被显式编码,否则模型仍可能在隐式表征中残留顺序相关的偏置。
为此,我们提出 Scale–Permutation Stability Loss(SPSL),在训练阶段联合约束尺度一致性与顺序不变性,使模型在参数层面内化这两项关键性质。
尺度一致性的核心在于:不同主体在生成结果中的相对重要性并不相同。尺度较大的主体通常占据更大的视觉区域,其失真对整体感知影响更为显著。基于这一观察,我们利用参考图像中的主体掩码与其相对面积,引导模型在训练时对尺度相关区域施加更强约束。
具体而言,设预测噪声与真实噪声分别为其基础损失为逐像素的均方误差。对于第 r 个参考主体,其掩码为,相对面积为,我们定义归一化权重:随后将各主体掩码加权融合,得到尺度权重图:

最终,尺度损失被定义为:

其中表示逐元素乘法,为数值稳定项。该设计使模型在训练过程中更加关注大尺度主体的重建质量,同时仍保持对所有区域的归一化约束,从而显式强化尺度一致性。
为保证生成结果对参考输入顺序保持不变,我们直接在特征层面对不同排列施加一致性约束。给定一组参考图像的原始顺序及其第 p 个随机置换,通过 Fourier Fusion 得到对应的融合特征表示。我们定义顺序损失为:

该损失直接惩罚由于输入顺序变化引起的特征偏移,迫使模型学习对排列不敏感的条件表示,从而在生成阶段消除顺序相关的不稳定性。
最终,Scale–Permutation Stability Loss 定义为两者的加和:

通过 SPSL,尺度一致性与顺序不变性不再是彼此独立的设计目标,而是在统一优化框架下被同时约束与强化。这一联合损失为 SMO 与 Fourier Fusion 提供了明确、互补的监督信号,使模型在复杂多主体场景中能够稳定地生成尺度自然、顺序鲁棒的视频结果。
五、实验结果
(1)定量实验

表1:视频生成评估指标结果
我们在 MoFu-Bench 上对所提出的方法进行了系统的定量评估,并与多种代表性多主体视频生成方法进行了对比,包括 VACE、MAGREF、SkyReels-A2 以及 Phantom。该基准专门针对尺度变化与参考顺序扰动进行设计,能够直接衡量模型在这两类挑战下的稳定性与生成质量。
如表1所示,MoFu 在几乎所有评测指标上均取得了最优或次优表现,整体性能显著优于现有方法。具体而言,MoFu 在 ScaleScore 与 SubjectSim 上取得了明显优势,表明模型在多主体场景中能够更稳定地保持自然的相对尺度关系与主体一致性。这一结果验证了 Scale-Aware Modulation 与尺度约束损失在缓解尺度不一致问题上的有效性。
与此同时,MoFu 在 GmeScore 与 Aesthetics 等综合质量指标上同样表现出色,说明在引入尺度与顺序稳定性约束后,模型并未牺牲整体视觉质量或文本对齐能力。相比之下,部分基线方法虽然在单一指标(如外观相似度)上具有一定优势,但在尺度变化或顺序扰动条件下整体性能下降明显,反映出其对输入排列和尺度噪声的敏感性。
值得注意的是,MoFu 在 Motion Score 上保持了与现有方法相当的水平,表明所提出的机制主要改善的是生成的结构稳定性而非简单地平滑运动,从而避免了通过牺牲动态多样性来换取稳定性的取巧行为。
总体而言,定量结果表明,MoFu 能够在尺度一致性、顺序鲁棒性与整体生成质量之间取得更优的平衡,验证了所提出统一框架在多主体视频生成任务中的有效性与泛化能力。
(2)定性实验
我们在图3中展示了MoFu在不同输入条件设置下的定性效果:Single-ID / Single-ID + Single-Subject / Multi-ID + Single-ID / Single-ID + Multi-Subject / Subjects with Scale。可以看到在不同的条件输入设置下,MoFu都可以保持主体一致性、画面中不同元素的尺度一致性、顺序鲁棒性,并且取得优秀的整体生成质量。


图3:不同输入条件设置下的定性实验结果
我们在图4中展示了我们和业内SOTA方案,如Phantom(字节) / SkyReels-A2(昆仑万维) / VACE(阿里) / MAGREF(字节)等的定性对比。可以看到MoFu在生成元素的尺度一致性和顺序鲁棒性上取得了更优的结果,整体生成质量也更真实自然。

图4:和业内SOTA方案的对比实验结果
我们在图5中展示了消融实验的结果,可以看到,如果去掉Scale-Aware Modulation模块,生成画面中的元素的尺度会有明显不合理的问题;如果去掉Fourier Fusion模块,生成画面中的元素的顺序、布局等会有明显的变差,整个画面的生成质量也会大大降低,这有力地证明了我们提出的上述两个模块的作用。

图5:消融实验结果
Note:
欢迎大家交流与探讨,如有任何问题或建议,请随时联系:maao.8@jd.com。
京东广告创意部门诚邀AIGC/大模型领域人才加入,共同推动技术的进步和创新。欢迎大家踊跃投递简历,期待与您在京东相遇!














