1. 引言
近日,京东零售AI Infra团队围绕多模态大模型训练效率提升,提出 FlowTrain 分离式训练框架,并在昇腾超节点上完成实验验证。相关论文《FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models》已被 EMNLP 2026 Industry Track 录用。FlowTrain 面向视觉语言模型训练中 encoder 与 LLM backbone 同步等待、资源利用率低、变长样本负载不均等核心挑战,提出流式解耦训练范式。依托昇腾超节点的高带宽互联、跨设备数据访问和集群训练能力,FlowTrain 在真实工业负载下实现超过 50% MFU,并获得最高 1.7 倍吞吐提升,为自主创新 AI 算力底座上的多模态大模型训练提供了新的技术路径。

2. 背景与挑战
多模态大模型正在成为智能零售、内容理解、智能客服、工业质检等场景的重要技术底座。与纯文本大模型相比,多模态训练需要同时处理图像、文本、视频等异构输入,训练链路中通常包含视觉 encoder、投影层、LLM backbone 等多个模块。不同模块的计算形态、并行方式和资源需求差异显著,给训练系统带来了新的效率瓶颈。 在传统训练框架中,多模态样本通常以固定batch 方式组织。encoder 需要先完成图像或视频特征提取,再将 embedding 交给 LLM backbone 继续训练。由于样本分辨率、图像数量、文本长度差异较大,不同 microbatch 的处理耗时波动明显,容易造成以下问题:
- Batch 级同步等待明显:encoder 和 backbone 被固定 batch 边界绑定,快的一侧需要等待慢的一侧,导致算力空转。
- 异构模块并行策略难以统一:encoder 更适合轻量化 DP/TP 组合,LLM backbone 则通常需要 DP/TP/PP 等复合并行。如果所有模块采用统一并行策略,会造成资源错配。
- 变长多模态样本导致负载不均:padding 浪费、attention计算差异、pipeline stage 负载不均,会进一步拉低集群整体 MFU。
针对上述挑战,京东零售AI Infra团队提出 FlowTrain 框架,将多模态训练从传统的“同步 pipeline”重构为“生产者—消费者数据流”,FlowTrain包括三个核心亮点。Unified Memory Pool:通过统一内存池打破 encoder 与 backbone 的 batch 级同步屏障,将点对点批量交互转化为全局可寻址的缓冲交换; Heterogeneous Parallel Allocator:将资源分配目标从“单模块最快”转为“生产速率与消费速率匹配”,为 encoder 和 backbone 选择差异化并行策略; Dynamic Packing Scheduler:根据运行时样本长度和真实计算成本动态构造 microbatch,降低 padding 浪费并平衡 PP/DP 负载。 在昇腾超节点实验环境中,FlowTrain 进一步结合其高带宽互联与跨设备数据访问能力,验证了框架在工业级多模态训练中的效率潜力。

3. FlowTrain 的关键技术创新与昇腾超节点验证
3.1 Unified Memory Pool:以全局地址空间实现多模态训练时间解耦
FlowTrain 的 Unified Memory Pool 是实现时间解耦的基础。该机制通过 64 位全局虚拟地址统一管理跨节点 HBM 与 DRAM 资源,将 encoder 产生的多模态 embedding 与文本 token 纳入全局可寻址空间。backbone 可依据元数据和全局虚拟地址持续访问已就绪数据,无需等待完整 batch 的 encoder 输出。 在昇腾超节点上,灵衢互联提供的高带宽互联与跨设备访问能力,为 embedding 的透明流转和 backbone 的连续消费提供支撑,使 encoder 侧的运行波动能够被统一内存池吸收,而不直接传导至 backbone 训练阶段。

FlowTrain通过消费者-生产者流消除同步训练的batch-level同步等待
3.2 Heterogeneous Parallel Allocator:以吞吐匹配优化异构并行资源分配
多模态训练中,encoder 与 LLM backbone 的计算特征不同。Encoder 通常更适合 DP/TP 组合,LLM backbone 则通常需要 DP、TP、PP等复合并行。如果所有模块采用统一并行策略,会造成资源错配。
FlowTrain 提出的 Heterogeneous Parallel Allocator,将资源分配转化为生产速率与消费速率的匹配问题,而非依赖经验调参。系统先以小规模吞吐 profiling 建立吞吐代理模型,再通过 MILP 在既定资源预算内,为 encoder 与 backbone 选择各自更匹配的并行配置;优化目标是优先最大化全局吞吐,并进一步降低生产—消费不匹配。 在昇腾超节点实验环境中,该机制可结合集群拓扑、通信代价、算子执行效率和并行策略组合,更准确地刻画真实训练吞吐,为异构模块提供差异化资源配置。
3.3 Dynamic Packing Scheduler:基于真实计算成本的动态打包调度
多模态训练样本天然存在变长问题。文本长度不同,图像数量不同,视觉 token 数也不同。即使 token 总数接近,最长子序列长度也会显著影响 attention 计算开销。
FlowTrain 设计 Dynamic Packing Scheduler,不再仅按 token 数或样本大小进行静态分桶,而是在完成编码后,依据 LLM 侧的实际计算代价动态构造 microbatch。调度器先通过 segment tree-based best-fit packing 降低 padding 浪费,再基于真实计算成本对 microbatch 分桶,并通过 zig-zag dispatch 同时平衡 PP 与 DP 维度负载,从而更有效应对多模态样本带来的计算波动与负载不均。
3.4 基于 MindSpeed MM 的工程实现与昇腾原生适配
在完成 FlowTrain 三项核心方法设计后,京东零售AI Infra团队团队基于 MindSpeed MM 进行工程实现与昇腾原生适配。MindSpeed MM 提供多模态训练所需的数据工程、模型组件、并行训练和算子优化能力,为 FlowTrain 的落地验证提供工程承接。
在工程实现层面,FlowTrain 还可利用 MC2 通信计算掩盖技术,将可并行的通信任务嵌入计算窗口执行,减少通信在关键路径上的暴露;在相关工程优化条件下,整体性能可进一步提升约 10%。
4. 实验结果
4.1 端到端训练性能提升

我们评估了FlowTrain在三种模型规模下的端到端训练性能。上图表明,FlowTrain在与Megatron-LM、DistTrain的基线对比中始终实现最高的吞吐量。在InfoVQA数据集和工业数据集上,FlowTrain分别带来最高达1.7倍和1.4倍的吞吐量提升。值得注意的是,随着模型规模增大,FlowTrain与基线方法之间的性能差距也在不断扩大。在InfoVQA数据集上,FlowTrain相较于Megatron-LM的吞吐量提升从VLM-6B的1.3倍增加至VLM-72B的1.7倍。这是因为基线方法受限于批次级别的同步屏障,导致硬件利用率低下。相比之下,FlowTrain允许执行解耦,并通过共享内存抽象来协调异构模块,从而显著提升大规模VLM的训练效率。
4.2 计算效率大幅提升

基于同样的实验环境,我们比较了不同方法在三种模型规模下的MFU(模型浮点运算利用率)。如上图所示,FlowTrain在所有配置下均大幅优于Megatron-LM。得益于生产者和消费者之间的流匹配优化,FlowTrain在InfoVQA数据集和工业数据集上训练VLM-72B时,MFU分别达到52.9%和50.0%,而Megatron-LM由于采用单体设计,MFU仅达到31.2%和36.9%。此外,虽然DistTrain的分离式编排能够缓解一部分并行度不匹配的问题,但由于其僵化的流水线执行方式,MFU仍低于FlowTrain。FlowTrain允许 backbone无需等待整个批次的encoder输出即可继续执行,并能够消费均衡的微批次,从而提升了资源利用率。
4.3 优秀的横向扩展性能

为了进一步验证可扩展性,我们在不同集群规模下基于InfoVQA数据集训练VLM-32B,并以纯LLM训练作为性能参考上限。上图结果展示FlowTrain在所有集群规模下均达到53%以上的MFU,吞吐量提升1.1-1.4倍,表现出不同训练规模下的鲁棒性,而其他方法的训练效率远低于FlowTrain。
此外,我们观察到FlowTrain的性能相比于基线方法更接近纯LLM训练。Megatron-LM、DistTrain和FlowTrain与纯LLM训练的平均MFU差距分别为18.7、12.1和5.0个百分点,证实我们的设计能显著缩小VLM训练与单模态训练在效率上的差距。
4.4 在京东电商大模型训练的真实应用
京东零售OxygenVLM电商多模态32B Dense和35B-A3B MoE大模型上,训练吞吐分别提升1.7倍和1.4倍;通用能力与同尺寸开源模型持平,在OxyEcomBench零售电商评测任务达到行业SOTA;已支持7个以上零售业务场景,包括AI图搜、商品素材质检、穿搭推荐、货不对品、AI致幻、平生-商品违规巡检、风控-风险商家巡检等多项业务,其中AI图搜相比线上模型 UCVR核心指标置信提升+2.24%,且多个核心指标均置信正向。
5. 结论与展望
京东近年来大力布局、共建国产AI生态。本工作是京东零售AI Infra团队与华为昇腾团队合作,基于昇腾超节点的灵衢互联硬件能力、MemFabric内存池化技术、MindSpeed MM软件栈,结合多模态大模型训练特点所作出的系统级工作,并在京东电商业务真正的应用落地,带来显著的效率提升。
我们看到,大模型训练正在从单一模型优化走向系统级协同优化,模型规模、数据形态和业务复杂度将持续提升,训练系统需要同时具备更高的算力利用率、更强的异构并行能力和更灵活的数据调度能力。京东零售AI Infra团队将持续推进面向真实业务场景的训练框架、调度算法和系统优化实践;昇腾超节点则可为相关技术的规模化验证与落地提供高性能算力支撑。
京东零售AI Infra团队围绕 FlowTrain 的技术创新,验证了自主创新 AI 基础设施支撑工业级多模态训练的可行路径。未来,双方将继续推动 FlowTrain 相关技术能力在更大规模模型、更复杂数据分布和更多产业场景中落地,并面向开发者社区开放更多实践经验,促进高效、开放的多模态大模型训练生态发展。
关于该工作的更多细节,请参考论文:https://arxiv.org/pdf/2606.23087





