京东承载超 7 亿活跃用户、数百万商家的庞大商业生态,在这片庞大的电商场域中,高质量、结构化的商品知识,是打磨极致消费体验、压缩平台管理成本、全面拉升运营效率的核心基石。可行业长期深陷三大工业化瓶颈:新概念持续井喷;百亿量级 SKU 难以批量产出高标准商品知识;搜推、运营等下游业务诉求多元。
直面行业长期无解的痛点,我们提出京东AI商品中心(JD Oxygen AI Item Center, AIIC)——一套以LLMs/VLMs为核心的工业级商品知识生产与服务平台,为行业提供完整解决方案。Oxygen AIIC 由四大支柱协同驱动:(i) 基于高效人机协同的本体工程,支撑百万级本体的动态演进与敏捷扩展;(ii) “语义搜索-判别”知识识别架构配合吞吐提升策略,实现百亿SKU的高质量、规模化、高吞吐的AI商品库生产;(iii) 自演进的商品理解大模型,推动模型能力稳定、可控地持续进化,实现精确率/召回率 94.2%/82.8%的知识生产;(iv) 作为数据与服务中枢的统一商品总线,保障商品知识的分级时效交付。
目前,Oxygen AIIC已覆盖京东万级类目,支撑单日亿级数据更新,沉淀千亿级商品知识资产,商品信息丰富度提升至原有的3.35倍。Oxygen AIIC已在搜索、推荐、运营、品类规划等核心业务中全面落地,并取得了显著的规模化正向收益,如:实现搜索流量覆盖率80%,发品核心属性自动化填充率超80%,商品信息质量问题下降37%,商品素材智能优化提升点击率9%等
完整报告已发布于:https://arxiv.org/abs/2606.28070
一、超大规模电商下的商品知识困境
在京东百亿级 SKU 的超大规模场景下,要构建一套“统一、动态演进、低人工依赖”的商品知识基础设施,我们直面三大工业级核心痛点:
1、商品知识异构、概念快速涌现。 商品知识是多源且异构,且散落在标题、主图、详情、用户查询与互联网信息中;与此同时,新概念持续涌现,且用户对商品细节刻画的颗粒度要求越来越细。依靠人工手动维护本体,时效慢、覆盖不全,早已无法支撑业务高速发展。
2、海量商品、既要保障质量又要吞吐快。 在面对百亿 SKU、万级类目、百万级动态演化本体以及日均亿级的信息变更流时,我们若简单依赖大模型逐条生产,这将带来高昂的推理成本与无法接受的延迟,且质量无法保障。
3、下游应用多样、既要支持共性又要适配特性。 搜索、发品、治理、导购、品类运营等场景,对商品知识的形态与时效诉求差异明显:商品治理强依赖实时服务,搜索推荐聚焦高吞吐近线特征,品类运营需基于业务逻辑做离线二次加工。一般的框架很难同时高效支撑这些服务模式。

图一:Oxygen AIIC 商品生命周期示意图
二、Oxygen AIIC 如何突破困境
针对行业现存一系列硬核难题,我们打造了一套以 LLM、VLM为核心的工业级商品知识生产服务平台 —— 京东 Oxygen AIIC。平台依托四大核心支柱协同驱动,打通商品知识全流程::
- 本体工程:本体是Oxygen AIIC的知识基座,决定了商品知识丰富度。我们通过高效的人机协同,整合了沉淀多年的专家知识与大模型的通用世界知识与推理能力,构建了更新快、覆盖全、质量高的本体体系,实现低成本、高效率的动态本体迭代。
- AI 商品库:AI 商品库建立了商品与本体之间的语义映射,是下游应用场景消费的商品知识源头。面对动态演进的本体与百亿级SKU,我们设计并实现了一套涵盖“模型-数据-工程”的协同优化流水线,实现了高质量、规模化、可拓展的知识生产。
- 商品理解大模型:商品理解大模型支撑了本体与AI商品库的建设,是持续优化商品信息质量的核心动力。我们整合了全场景所需的算法能力,构建高泛化、易拓展的统一模型底座,实现模型能力可控、稳定地持续自进化。
- 商品总线:商品总线作为数据与服务中枢连接着Oxygen AIIC与业务,搭建了标准化业务服务体系。为满足下游应用对数据新鲜度和吞吐的多元化诉求,建立了分级时效生产与分发链路,为赋能下游应用提供了良好的生态。
四者共同构成一个从"规模化本体构建"到"海量知识生产与消费"的链路,既保障了商品知识的稳定与高质量,又赋予系统持续自演进的生命力。

图二:Oxygen AIIC 整体架构图
三、四大支柱携手同行
本章我们将重点介绍Oxygen AIIC的四大支柱如何协同工作:
3.1 人机协同的本体演进
本体工程要构建的是“好(高质量)、全(高覆盖)、快(高时效)”的商品知识底座,但落地路上横亘两大难题:一方面,新概念会持续涌现,纯人工定义无法兼顾时效与覆盖,而大模型规模化扩展又容易引入幻觉;另一方面,同义表达众多、语义冗余严重,不加处理会让本体体系极度臃肿,拖慢全链路知识处理效率。为此我们采用人机协同(Human-in-the-Loop)框架:专家自顶向下定义骨架,算法自底向上挖掘增量知识,二者结合实现本体动态演进。
1) 专家定义骨架(自顶向下)。专家把品类经验沉淀为结构化先验知识,规范四类核心要素——类目、属性键、属性值、场景标签。其中"类目—属性键—属性值"构成结构基础,场景标签负责场景化语义扩展。此阶段专家只对高价值、稳定性强的典型知识建模,提前划定算法挖掘边界,从源头规避错误、无效概念泛滥。
2) 算法驱动生长(自底向上)。在专家骨架约束下,我们以"知识发现 → 知识融合 → 知识验证"三段式规模化扩展本体:
- 知识发现:通用大模型不懂电商行业术语与标准,直接抽取易产生偏差。我们基于行业规范构建专属指令数据,微调得到电商领域专用挖掘模型,从海量多源数据中自动发掘商品概念。
- 知识融合:大规模的知识发现在保障了覆盖的同时会引入大量同义异构表达、造成本体臃肿。我们以"表征—聚类—筛选"三阶段消解冗余,并训练电商领域适配的专用编码模型提升实体表征质量,得到候选概念。
- 知识验证:为保障本体质量,我们构建了基于多通用大模型的协同验证框架,串行级联完成"质量校验(合理性、重复性)→ 重要性评估(规模、趋势)→ 专家终审入库"。该机制不仅关注"知识是否正确",更进一步衡量"知识是否重要",在保障本体质量的同时兼顾覆盖率与热点追踪。
在人机协同模式下,我们沉淀百万量级高质量本体(含属性、产品词、品牌等),其中商品平均刻画维度提升至 1.44 倍、本体规模提升 64.5%,本体对用户流量覆盖率达 80.4%。

图三:本体工程pipeline
3.2 S²D 架构与高吞吐的知识生产
AI 商品库负责在商品本体与海量非结构化商品信息之间建立连接。工业级 AI 商品库为支撑百亿级 SKU与百万级动态演化本体,承接日均亿级的SKU信息变更流并高时效赋能核心场景,需同时满足两点:一是传统端到端建模易在本体迭代、分布外数据下性能退化,频繁重训成本高昂;二是海量高质量商品知识生产下,难以平衡吞吐与算力开销。为此,我们把“高质量 + 可扩展 + 高吞吐”作为一体化建设目标,设计了贯穿“模型—数据—工程”的协同优化体系。
1) S²D(语义搜索—判别)架构
落地调研中我们发现,直接用大模型生成商品属性值,存在两大难以解决的硬伤:本体持续变化,模型需要频繁重训;而且通用大模型直接生成属性值的精确率有限,千亿参数模型也不足 80%,并且幻觉严重。
为此,我们提出了Semantic Search-Then-Discrimination架构(S²D) ,先进行语义检索再判别结果对错。语义检索阶段,我们根据商品信息通过语义检索相关本体,从动态的本体库中召回 Top-K 候选。判别阶段基于Top-K候选集,进一步完成SKU与本体的精确匹配。
我们利用合成数据微调得到领域适配的表征模型和判别模型,并通过将动态本体外挂为知识库,实现与模型参数解耦,本体演化无需重训模型。这套方案把 “自由生成” 转化为 “有限候选内筛选”,大幅降低任务难度,有效遏制幻觉,让 AI 商品库能够轻松适配不断新增的商品本体。
2) 高吞吐生产
S²D 保证了"识别得准",但在百亿 SKU 的规模下,如果对每个 SKU 都跑一遍完整链路,相当一部分算力会耗在重复计算上。这是因为我们在数据中观察到三类典型现象:其一,同一商品常有大量 SKU 在售(比如不同店铺挂的同款 iPhone 17 Pro Max),会被反复识别;其二,属性分布极不均衡,通用属性高频出现,长尾小众属性仅适配极少商品,全量遍历会浪费大量资源;其三,同一 SPU 衍生多条 SKU,商品介绍、核心特征高度重合,识别需求高度一致。
据此,我们把优化目标从"所有 SKU × 所有属性"的全量扫描,改成"差异化 SKU × 高相关属性"的选择性计算:系统先判断识别结果能否复用、筛选需要处理的属性,仅将必要样本送入 S²D 执行推理。落到实现上,具体做三重优化:
- 双重计算减负——SKU 维度上,语义检索匹配同质商品,如果结果可复用,则直接跳过推理;属性维度上,在 S²D 前加一道属性相关性探测,先筛出与商品高相关的属性、滤掉低相关的,把“全属性扫描”变为“高相关属性探测”;
- 缓存复用——S²D 的 Prompt 由指令、商品信息、属性键及候选值组成,我们发现同一 SPU 下不同 SKU 约 85% 信息相同。我们通过 Prompt 结构优化、Cache-Aware 局部性保障与显存管理调优复用共享前缀,避免重复 prefill;
- 异步流水并行——向量生成、语义搜索、判别分别跑在 NPU 和 CPU(Faiss 集群)上,是典型的异构协同,调度不当就会产生算力气泡。我们用 L0 细粒度数据并行叠加 L1 跨 Chunk 异步流水,保障最大的资源利用率。
基于上述流程,AI商品库的算法识别达到 92% Precision / 78.3% Recall;对比商家自填数据,平均每个 SKU 的属性数提升至 1.5 倍,商品知识资产规模(SKU×key×value)提升至 3.35 倍、达千亿量级,其中 AI 生产数据占 70%、商家自填占 30%。"计算减负 → 缓存优化 → 异步并行"三段协同,使整体吞吐效率提升 10 倍以上。

图四:AI 商品库流程图
3.3 稳定可控的模型自演进
上述内容保障了基础可用的Oxygen AIIC生产流程,但是要让系统长期可靠并持续演进,需要一套稳健可控的模型迭代框架。它需应对四类问题:通用模型缺乏行业知识;频繁全量微调低效且易灾难性遗忘;关键细粒度特征易被噪声淹没;少量隐蔽的识别缺陷难以靠盲目加数据修复。为此我们构建了 Oxygen AIIC 商品理解大模型框架,以统一多任务基座为核心,叠加增量学习、指令遵循知识表征技术,并结合模型自演进框架,实现系统稳定可控的迭代。

图五:商品理解大模型
1) 商品理解大模型(多任务基座)
通用大模型缺少电商行业的专家知识,为此我们把知识抽取、知识识别这些高度相关的任务放到一起做多任务指令微调,将相关知识注入同一个底座。这样领域知识能在任务间共享,也不必为每个任务单独维护一个模型,管理成本随之下降。底座由此建立起对商品、本体(Ontology)和常见任务的通用理解,成为 Oxygen AIIC 的模型能力底座——商品理解大模型。
2) 增量学习(不重训基座、敏捷扩能)
随着Oxygen AIIC支持领域的拓展,新领域知识的缺乏,仅依赖商品理解大模型是不够的,但如果把整个基座模型重训,不仅成本高效率低,还容易触发灾难性遗忘。因此我们采用 Task-free 轻量增量机制:通过训练轻量化"专家",并加入专家池,基座模型本身不动,再利用动态路由机制,实现新领域的快速适配。这里有两个关键设计。
其一是基于 LoRAM 的专家训练:传统 LoRA 的更新幅值偏低,收敛慢、效果上限也受限,我们从"幅值原则"(Magnitude Principle)出发优化了它的初始化,在不额外占显存、不加预处理成本的前提下,让它拟合速度更快、上限更高。
其二是基于 GROLE 的动态路由机制:面对众多专家,我们通过一个自适应选择器根据输入和任务指令,给每个专家算一个融合权重(非负、加起来为 1),最终输出就是底座和这些专家的加权组合。这个权重不是固定的,而是用组内相对策略优化(GRPO)学出来的,让模型在同一套架构里既保住通用语义理解、又能做特定领域的逻辑判定。
随着系统的演进,专家池中专家会越挂越多,所以系统还会周期性做一次全量微调,把这些分散的增量能力沉淀回基座。增量负责快速扩能,全量负责长期整合。

图六:增量学习,基于幅值驱动初始化与专家动态融合的增量适配机制总体架构图
3) 指令遵循知识表征(先推理、后表征)
知识表征是把商品、用户 Query 和标准化本体映射到同一个向量空间,方便大规模对齐和检索。但由于商品信息繁杂,关键细粒度特征易被噪声淹没,比如一款手表,“防水级别”的信息隐藏于冗长的信息中: “防水能力再升级,支持IP68级防尘防水,并通过TÜV南德2米24小时严苛测试”。这时如果直接把整段描述编码成向量,结果会被营销话术主导,跟正确的本体对不齐。为了让表征模型抓住真正决定属性的那部分信息,我们采用“先推理、后表征”的策略实现了高质量表征:
基于隐式思维链蒸馏的推理型表征(InstEmb):为了兼顾推理能力与大模型的推理效率,我们采用了隐式思维链(Latent CoT)蒸馏策略,在输入序列后面挂几个可学习的特殊token的"推理标记",训练时用一个冻结的教师模型当监督,让学生在这些标记位置去拟合教师的推理隐状态。这样一次前向就把需要推理才能得到的核心知识压进了向量,不增加自回归生成的开销。
基于谱结构的自适应噪声注入(FANoise, SDE):光有推理还不够,细粒度的弱信号容易在训练中被淹没,于是我们对每个批次的表征做奇异值分解(SVD),再按谱分布分方向加噪:主导方向多扰动一些,抑制过拟合;弱信号方向少扰动,把细粒度信息保护住。我们通过这种方式获取更鲁棒的表征。

图七:知识表征训练架构
4) 模型自演进(数据闭环)
最后一类问题最棘手:在如此规模大场景下,少量隐蔽的识别缺陷难以靠单纯加数据修复。我们如果只看模型的宏观指标,却不去诊断模型失败的具体原因、针对性补充样本,则补充的数据大概率没有意义,甚至会产生负面影响。以往的模型优化依赖算法工程师针对大量badcase的人工分析,自动化程度低且容易产生偏差。针对此类情况,我们走通了"数据评估 → 数据分析 → 数据合成 → 数据筛选"四阶段闭环:从线上反馈与主动探测样本中,按证据一致性、模型置信度、扰动稳定性识别 Badcase/Hardcase;对其做缺陷归因,把"结果错误"转化为"缺陷原因与修复建议";据此定向合成高信息密度的修复样本;再用基于认知差距(现状模型与专家模型的损失差 )的价值度量筛选高价值数据(TANDEM, BLADE)。整套机制把模型迭代从盲目补数据转向按缺陷定向修复。

图八:模型自演进总体架构图
经多任务 SFT、增量适配、指令遵循表征与自演进后,我们端到端商品知识生产达到 94.2% Precision / 82.8% Recall,较上一阶段(C2)分别提升 2.2 与 4.5 个百分点,且仅 0.8% 的属性精确率下降超过 5%,整体保持稳定;新增本体从"属性键挖掘到数据生产完毕"的周期由 30+ 天缩短至 2 周。
平台层面,底层算力平台统一兼容昇腾 NPU 的训练与推理,并支持离线集群弹性调度,实现全链路算力复用与稳定高效运行。
3.4 分级时效的数据与服务中枢
在面对海量的商品与复杂的下游应用环境时,商品知识的生产与消费面临了众多困境,例如:知识的新鲜度、版本一致性问题、存算效率、服务碎片化等。为此,我们建设了商品总线(Item Tunnel),连接上游商品数据、推理集群与下游业务,生产侧统一组织离线/近线/实时加工,消费侧提供统一的数据与算法服务,主要解决四个工程问题:
- 分级时效:按商品价值与变化频率把生产分为离线(构建知识基线)、近线(分钟级增量)、实时(仅强时效高价值商品,并按需过滤减少低收益推理),在保障关键场景低延迟的同时兼顾新鲜度与成本。
- 版本一致性:多链路并发生产下,在"商品+属性"粒度按版本顺序写入与覆盖、状态类计算只读最新状态,避免旧结果覆盖新结果。
- 存算效率:统一本体、分片存储与任务调度串联大数据集群与异构推理集群,上游先聚合裁剪、推理侧按分片调度并复用可复用结果。
- 统一服务:把碎片化对接收敛为标准服务,业务差异用配置与服务形态承载,而非为每个场景重复建接口。
商品总线支撑每日亿级 AI 商品库更新,提供秒级、分钟级、天级三档时效能力,已服务搜索、广告、营销、C 端导购、商品运营、B 端发品与平台治理等核心场景。
四、落地与结果
Oxygen AIIC 通过商品总线对本体、AI商品库、商品理解大模型等能力做标准化输出,我们支撑 C 端用户、B 端商品管理和平台运营,使 Oxygen AIIC 真正成为驱动业务高质量增长的知识基础设施。
- C 端购物:我们将本体与AI商品库赋能了搜索各环节,比如,召回、相关性、Query 理解等,搜索商品信息质量问题占比下降 37%,并应用于搜索导购、筛选等功能;为商详提供智能短标题、核心卖点与参数解读、功能解释,帮助用户更快理解商品价值;AI 导购则以 Oxygen AIIC 为知识底座,为对话式导购与智能比选提供结构化商品知识。
- B 端经营:品类规划结合用户行为、行业趋势与市场表现,识别供需缺口与用户偏好,把原本两三周的分析压缩到天级;智能发品以商品理解模型、AI 商品库与本体库为基础支持属性预填,核心属性自动填充率超 80%,从源头提质提效;商品运营将品类 Know-how 用于素材与文案优化,从高转化商品图中提炼视觉规则,带来约 9% 的点击率提升。
- 平台运营:接入盘货与选品等场景,并结合用户行为构建了高潜兴趣、竞品意向等人群包,支撑广告投放与 Push 运营;支撑了发品前合规拦截与发品后巡检,自动识别类目、属性错误并推动整改;价格管理基于结构化信息与图文特征构建同品识别能力,准确率超 90%、覆盖京东零售实体类目,支撑同款比价、大促控价与异常价格识别。
五、One Step Further
当前Oxygen AIIC已取得阶段性成效,但我们仍然处于初级阶段,在超大规模落地仍有很多挑战。我们后续将沿三条主线继续深入:
- 本体侧:从"概念建设"走向"关系建设"。 后续我们需要着力于关系,完善本体的关系类型,增强图推理能力,实现京东多年行业 Know-how 的沉淀复用,为关系型消费(如 GraphRAG、Agent 化导购与决策)打好底座。
- AI 商品库侧:让数据消费反向驱动生产。 我们需要建立更及时的线上 badcase 发现与修复机制,把"消费—反馈—再生产"的数据飞轮真正跑起来。
- 模型侧:持续缓解灾难性遗忘。 在提升垂类能力的同时保持通用能力稳定的同时,我们需要探索 MoE 扩专家、任务简化、知识注入式 prompt 等更高效、灵活的手段,增强系统的可拓展性。
我们将围绕这些方向持续迭代,使 Oxygen AIIC 从阶段性建设成果,逐步演进为可长期运行、可持续更新的商品知识基础设施。






