开发者社区 > 博文 > 京东零售广告创意:自动化商品海报生成与优化(AAAI 2026)
分享
  • 打开微信扫码分享

  • 点击前往QQ分享

  • 点击前往微博分享

  • 点击复制链接

京东零售广告创意:自动化商品海报生成与优化(AAAI 2026)

  • jd****
  • 2026-07-28
  • IP归属:北京
  • 9浏览

    AAAI2026: AutoPP: Towards Automated Product Poster Generation and Optimization

    论文链接:https://arxiv.org/abs/2512.21921

    代码链接:https://github.com/JD-GenX/AutoPP

    AutoPP生成的商品海报demo

    摘要:商品海报通过极具冲击力的视觉设计与信息丰富的文字内容相结合,突出产品特色并有效捕捉消费者注意力。然而传统人工设计方式不仅创意产出效率低下,基于线上效果的手动调优更是耗费大量资源。为此,我们推出全自动海报生产优化系统AutoPP该系统核心由两大模块构成:生成器仅需输入商品基础信息,即可通过统一设计模块协同推理海报三大要素(背景/文案/布局)的有机组合,再经由要素渲染模块将各要素编码为条件令牌,实现高效可控的海报输出优化器则基于生成结果,通过要素替换对比获取细粒度CTR数据,采用孤立直接偏好优化算法(IDPO)精准归因点击率提升动因,完成数据驱动的自动化迭代。

    一、背景及现状

    近年来,文生图技术的快速发展为自动化商品海报生成奠定了基础,相关研究已实现从文本到视觉元素的初步自动化。然而,现有技术仍存在显著局限:1)生成环节碎片化且批量生产困难,多数系统依赖多模型串联(如分步处理提示词、布局、背景)导致流程复杂,需人工干预,既影响自动化程度又难以规模化输出高质量海报,如图1(a)(b)所示;2)线上优化粗放,当前CTR优化方法仅聚焦背景元素,忽视文案与布局的综合影响,而联合优化又因归因模糊导致效率低下。针对上述问题,我们提出AutoPP,采用一体化生成与优化框架实现高质量输出并基于IDPO算法的数据驱动优化器精准提升CTR,为了详细阐述AutoPP,本文围绕四个核心研究问题展开。

    图1:不同海报生成与优化流程的对比

    二、如何统一设计海报中各元素?

    为了生成风格统一的海报元素(背景描述、文案及布局),我们设计了集成化的统一设计模块,如图2(a)所示。为解决传统多模型方案导致的元素不协调问题,我们采用多模态大语言模型(MLLM)实现元素联合生成。

    为了实现结构化指令输入,我们基于商品图像和候选文案集,通过模板函数构建自然语言指令:

    该函数具体实现为"Given the product image and [candidate text], generate the background prompt, selected text, and layout"的指令模板,其中[candidate text]为占位符。

    为了建立元素间的概率关联,我们将联合分布建模为自回归序列:

    其中y包含背景描述、选定文案和布局三个结构化输出元素,表示第个token。为了优化模型性能,我们采用交叉熵损失函数进行端到端训练。

    图2:AutoPP结构图


    三、如何实现高可控海报生成?

    基于统一设计模块的输出结果,我们的要素渲染模块通过高效的令牌架构生成最终海报(图2(b))。具体实现包含以下关键技术环节:

    首先,为建立精确的空间控制,我们构建两种专用控制信号:1)根据预测的商品布局将商品图像置于黑色背景上;2)按照预测的文本布局生成字形图像。这种基于前景-背景分离的掩膜控制策略为渲染提供显式空间引导。

    为提升字形控制的鲁棒性,我们创新性地采用令牌机制,其优势在于:1)无需字形与目标图像的像素级对齐,大幅降低标注成本;2)通过VAE编码视觉内容()和T5编码文本描述b,获得统一表征空间

    其中分别表示编码后的令牌,D、N、M对应潜在维度、图像块序列长度和文本令牌长度。在流匹配框架下,我们通过时间步t∈[0,1]对目标潜在表示进行渐进扰动

    其中ϵ∼N(0,I)为标准高斯噪声。

    为解决长序列处理的计算瓶颈,我们将传统MM-DiT块中的全局注意力改进为分解注意力机制(DA),包含两个独立组件:1)条件自注意力(SA)分别处理字形和商品令牌,捕捉元素内部依赖;2)图像-条件交叉注意力(CA)实现跨模态信息交互,其中查询由提示和噪声令牌构建,键值由全部令牌组成

    为确保文本渲染精度(海报生成的核心需求),我们在基础流匹配损失外引入OCR感知损失:

    其中,分别表示每个去噪步骤中的预测速度场和真实速度场;为重建图像,代表预训练PaddleOCRv4骨干网络提取的中间特征,λ=0.1用于平衡各项损失权重。


    四、如何进行元素替换?

    为了评估单个元素对点击率(CTR)提升的贡献,我们开发了一种系统替换海报元素的策略,如图2(c)所示。该方法以生成的海报P及其三个关键元素y为起点:背景提示词b、选定文本其中以及布局l。

    为解构单个元素的影响,我们通过扰动特定元素同时固定其他元素来创建修改版本。具体而言:

    1. 背景替换:向GPT-4o提供原始产品图像和提示词b,要求其生成一个与b不同但适合该产品的全新提示词b′
    2. 文本替换:从同一候选文本集T中选取长度匹配的替代文本
    3. 布局替换:通过统一设计模块重新生成另一个布局l′

    完成每个元素替换后,我们使用元素渲染模块重新生成包含替换元素y′的产品海报P′。


    五、如何对齐人类偏好

    随后,这些海报将在京东平台进行轮播实验以收集点击率(CTR)反馈(如图2(d)所示)。为简化表述,下文将产品图像记为,设计指令记为。实验结果建立了偏好关系,其中分别表示对比组(P, P’)中点击率较高和较低的海报。与CAIG类似,我们仅通过微调统一设计模块来选择更具吸引力的元素并剔除吸引力较低的元素。标准DPO是一种粗粒度对齐方法,直接优化统一设计模型的整体输出。给定策略模型和参考模型,DPO目标函数定义为:

    其中表示sigmoid函数,是控制参考模型偏离程度的温度参数。

    我们认为背景b、文本和布局l对用户参与度的影响存在差异,由此提出IDPO方法,通过元素感知优化整合CTR反馈:

    其中为元素特定权重,控制元素c的重要性,为指示函数。例如强调背景修改时可设。似然值通过进行归一化以保持尺度一致性。我们将DPO损失中的替换为,从而构建IDPO损失函数。这种解耦方法确保CTR反馈能精准指导对关键元素的修改,相比整体优化策略,能实现更高效、可解释的海报优化。


    六、实验结果

    (1)海报生成模型性能

    为评估海报生成我们将AutoPP与开源方法和闭源的GPT-4o进行对比,其中开源方法采用与我们相同的数据集进行训练。由于Seedream 2.0可能改变产品外观形态从而导致消费者误解,故未纳入比较范围。对于GPT-4o,我们为其提供与我们相同的产品基础信息。如表1所示,本方法在视觉质量和布局合理性方面均优于其他所有方法。图3展示了若干生成案例,可见P&R和PAID由于采用人工渲染规则,易导致文字模糊和产品遮挡问题;GPT-4o在中文文本生成表现欠佳,文字笔画错误频发。

    表1 :海报生成模型对比

    图3 :海报生成模型定性比较

    (2)视觉文本生成性能

    为深入评估视觉文本生成性能,我们采用真实布局、背景提示词和文本作为所有方法的统一输入。对于Glyph-byt5-v2和Anytext-v2,通过图像修复技术确保产品区域保持不变。表2结果显示,本方法在文本准确率和视觉质量指标上均取得最优性能,验证了AutoPP在可控视觉文本生成方面的有效性。

    表2 :视觉文本生成对比

    (3)海报优化性能

    为评估产品海报优化器的点击率(CTR)提升能力,我们对AutoPP框架与两种前沿CTR优化方法——CG4CTR和CAIG进行了对比实验。我们随机选取10,000款商品,使用三种方法分别为每款商品生成一张海报,并通过京东平台开展为期一周的在线实验收集CTR数据。如图4所示,AutoPP实现了显著的CTR性能提升,而对比方法CG4CTR和CAIG由于未能整合布局与文本元素,其相对CTR呈现负增长。具体而言:AutoPP的平均CTR提升达18.7%,显著优于基准方法;CG4CTR因过度依赖图像特征导致相对CTR下降3.2%;CAIG虽在文本优化方面表现尚可,但布局适应性不足使其相对CTR降低1.5%

    图4:相对ctr提升比较

    Note:

    欢迎大家交流与探讨,如有任何问题或建议,请随时联系:fanjiahao5@jd.com。

    京东广告创意部门诚邀AIGC/大模型领域人才加入,共同推动技术的进步和创新。欢迎大家踊跃投递简历,期待与您在京东相遇!

    文章数
    1
    阅读量
    9

    作者其他文章