
ICLR2026: Bayesian Ensemble for Sequential Decision-Making
链接: https://openreview.net/pdf?id=s2hxd8JghB
摘要
在这篇工作中,我们关注的是不确定性下的序列决策问题,典型场景包括推荐系统里的在线决策,以及强化学习中的探索与利用。已有很多 ensemble-based 方法会用多个模型来近似后验分布,再从中随机选一个成员做决策。但这些方法通常有一个共同限制:它们默认 ensemble 成员的采样分布是固定的,比如简单地均匀采样。这样做忽略了一个事实——不同 ensemble 成员本身的质量、偏好和有效性,可能会随着训练过程逐渐拉开差异。
因此,我们提出了 Bayesian Ensemble(BE)。它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层:除了更新每个 base model 的参数,我们还通过观测到的 reward,动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说,成员选择本身不再是固定随机的,而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架,我们进一步提出了面向 bandit 的 Bayesian Ensemble Bandit(BEB),以及面向强化学习的 Bayesian Ensemble DQN(BE-DQN)。在合成环境和真实环境上的大量实验都表明,这种做法既有效,也足够高效。
引言
这篇文章的出发点来自一个经典问题:在不确定环境中,智能体该如何平衡 exploration 和 exploitation。这个问题在推荐系统和强化学习里都非常核心。最经典的建模方式之一是 Thompson Sampling:维护一个关于奖励分布参数的后验,每一轮从后验里采样一个参数,再基于这个参数去选动作。它的优势在于,探索是由不确定性自然驱动的。
但问题在于,一旦我们用神经网络去建模复杂的 context–reward 关系,精确维护后验分布几乎是不可行的。因此,实际工作里大家往往使用各种近似贝叶斯方法,比如 variational inference、MCMC、dropout、gradient-based posterior sampling,以及 ensemble-based 方法。其中,ensemble 方法之所以特别受欢迎,是因为它实现简单、泛化性强,而且在很多实际任务中效果稳定。
不过,现有 ensemble-based Thompson Sampling 还有一个被忽视的问题:大家通常只在更新 ensemble 成员的参数,却不更新成员索引本身的采样分布。也就是说,模型在学,但“抽谁来做决策”这件事没学。可在实际中,不同成员由于随机初始化、prior function 等因素,表现并不等价。基于这个观察,我们的核心主张是:不确定性不仅存在于模型参数中,也存在于 ensemble 成员之间;因此索引分布也应该被纳入贝叶斯更新。 这正是本文想补上的那一块。
方法
1. 统一框架:Bayesian Ensemble
我们先提出一个统一的 Bayesian Ensemble 框架。其基本流程是:在第 (t) 轮,智能体维护两部分信息,一部分是 ensemble 参数 ,另一部分是成员索引 的分布。先从 中采样一个成员索引 ,再用对应成员对候选动作进行打分,选择当前估计期望 reward 最大的动作,拿到反馈后,同时更新 和 。也就是说,我们把“模型怎么学”和“该信哪个模型”这两件事统一放进同一个贝叶斯决策闭环里。图片中也直观展示了这个思想:索引分布通过奖励反馈不断被更新,从而在 ensemble 成员和环境奖励之间建立直接联系。
一个关键点在于:对于 ensemble 参数 ,我们依然沿用现有方法常见的做法,用 surrogate loss 做经验风险最小化;但对于索引分布 ,我们不再借助 surrogate loss,而是直接围绕长期累积 reward 去更新。原因很简单:相比庞大的网络参数,索引分布的参数量通常很小,更适合直接做精确或近似的贝叶斯推断。这个设计,是本文相较于已有 ensemble-based TS 方法最本质的区别。

2. 面向 Bandit:Bayesian Ensemble Bandit
在 contextual bandit 场景中,我们用一个 ensemble 网络来输出 reward 的概率分布。每轮先从当前索引分布里采样一个成员,再由该成员在候选动作集合上挑选期望 reward 最大的动作。动作执行后,我们利用新样本同时更新 ensemble 参数和索引分布。这个算法就是 Bayesian Ensemble Bandit(BEB)。它不是替代现有 ensemble bandit,而是可以增强现有方法。
为了说明这一点,文中给了两个代表性实例。
第一个是 ensemble+。原始 ensemble+ 使用均匀分布在多个 ensemble 成员中随机选一个。我们在 BEB 下,把每个成员对应一个 Beta 分布参数,用 Beta-Bernoulli 的共轭关系,根据实际 reward 对成员选择分布做精确贝叶斯更新。直觉上,它等于让“哪个成员更值得被抽到”这件事,随着反馈自动学出来。
第二个是 hypermodel。原始 hypermodel 使用标准高斯分布采样连续索引,再通过 hypernetwork 映射成模型参数。我们则进一步把这个连续索引分布做成可学习的高斯分布,学习每个维度的均值和方差,并用 variational inference 去近似后验。换句话说,我们不仅保留了 hypermodel 的连续索引表达能力,还把索引本身也变成一个可自适应更新的贝叶斯对象。
3. 面向强化学习:Bayesian Ensemble DQN
除了 bandit,我们还把这一思想扩展到了强化学习,提出了 BE-DQN。它维护 个独立的 Q-network,每个网络对应一个 Beta 分布。每一轮先从这些 Beta 分布里采样出权重,再选出当前最优的那个 Q-network 负责动作选择;但在 target Q 的构造时,并不是只用单个网络,而是对所有 Q-network 做加权聚合。
这个设计有两个好处。第一,它继承了 ensemble 方法降低方差、稳定训练的优点;第二,它不像传统 Ensemble DQN 或 Random Ensemble DQN 那样使用固定或随机的组合方式,而是让“哪个估计器更值得信”也能随着 reward 自适应变化。文中进一步给出了理论分析:在一个单向 MDP 环境里,BE-DQN 的 Q-value 方差上界与标准 DQN 一致,下界与 Ensemble DQN 一致。这说明它至少不会比 DQN 更不稳定,同时又保留了比纯平均 ensemble 更强的探索能力。
实验
1. 合成环境:Neural Testbed 和 Mushroom
我们先在两个 bandit 风格环境里验证方法。一个是 Neural Testbed,它通过神经网络生成 ground-truth reward 分布,可以精确计算 regret;另一个是 Mushroom,把蘑菇可食用性数据集转化成一个二元决策问题,智能体需要决定是否选择当前蘑菇。
在 Neural Testbed 上,我们设置动作维度 (d=2,10,50),时间跨度为 20,000 步。结果显示,无论问题简单还是复杂,BEB 版本都在全程显著优于原始 baseline。到最后一步时,ensemble+(BEB) 相对 ensemble+ 的 regret 分别下降 37.0%、12.8%、42.2%;hypermodel(BEB) 相对 hypermodel 的 regret 分别下降 69.8%、22.8%、30.3%。在 Mushroom 数据集上,BEB 版本同样始终更优,最终 ensemble+(BEB) 和 hypermodel(BEB) 分别带来 8.7% 和 4.8% 的提升。换句话说,不管是离散索引还是连续索引,只要把索引分布也学起来,探索效率就会更高。
我们还专门分析了时间开销。对于 ensemble+,因为 Beta-Bernoulli 更新是共轭的,几乎没有额外耗时;而对于 hypermodel,由于需要 variational inference,BEB 版本比原始方法大约多 20% 的计算时间。这个结果也说明,BE 的额外成本主要取决于索引分布的更新方式本身,而不是框架设计带来的硬性负担。
2. 真实推荐环境:Yahoo!R6B
为了验证方法在真实序列决策场景中的表现,我们进一步在 Yahoo!R6B 新闻推荐数据集上做了实验。这个数据集包含 2800 万次用户访问日志,每条样本包括用户特征、展示文章、候选文章集合以及点击标签。由于真实最优奖励不可见,我们用累计点击数作为评价指标。
在这个实验里,我们主要评测 hypermodel 系列,因为 ensemble+ 的计算开销更大。结果显示,hypermodel(BEB) 达到了 50,322.1 ± 1,487.2 次点击,高于原始 hypermodel 的 49,676.8 ± 1,355.7,也明显优于 Random、Greedy、-Greedy、MC Dropout 和 Gradient TS 等方法。这个结果说明,BE 并不只是一个合成环境里的技巧,而是能够在真实推荐任务中带来更强的探索效率和更好的点击收益。
3. 强化学习环境:MiniGrid
在强化学习部分,我们选择了 MiniGrid 中五个任务:FourRooms、Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4,用来评测 BE-DQN。对比方法包括 vanilla DQN、Ensemble DQN、Random Ensemble DQN,以及 UAAC。
整体结果表明,BE-DQN 在这些任务上表现最强或最稳健。例如在 Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4 上,BE-DQN 的平均 reward 都是表中最优;在 FourRooms 上也优于其余多数 baseline。论文里对此的解释是:传统 DQN 依赖单一 Q-value estimator,鲁棒性差;E-DQN 和 RE-DQN 虽然有所缓解,但由于权重机制静态或随机,无法持续偏向更优的 Q-estimator;而 BE-DQN 能动态更新不同 Q-network 的重要性分布,从而更好地兼顾探索、利用和训练稳定性。
另外,附录里还补充了更多实证结论:比如在 Yahoo!R6B 的 100 万样本子集上,ensemble+(BEB) 比 ensemble+ 再提升约 3%;随着 ensemble size 从 25 增大到 100,ensemble+(BEB) 相对 ensemble+ 的 regret reduction 从 28.23% 提升到 47.97%,这也说明我们的框架在更大的 ensemble 上反而更能发挥优势。
参考文献
本文的参考文献大致可以分成四条主线。
第一条是 Thompson Sampling 与 bandit 理论。这里包括 Thompson (1933)、Russo et al. (2018)、Li et al. (2010)、Chapelle & Li (2011)、Lattimore & Szepesvari 等工作,它们奠定了“基于后验采样做探索”的基本范式,也是我们将 ensemble 成员选择视作贝叶斯决策问题的理论起点。
第二条是 深度不确定性建模与 ensemble posterior sampling。比如 deep ensembles、randomized prior functions、hypermodel、Epistemic Neural Networks、Ensemble Sampling 等工作,共同构成了我们方法的直接技术背景。我们的工作与这些方法的关系不是推翻,而是前进一步:它们主要学模型参数,我们进一步去学索引分布。
第三条是 强化学习中的 ensemble 方法。包括 DQN、Ensemble DQN、Random Ensemble DQN、Reset Deep Ensemble、HyperDQN、HyperAgent 等。这些工作说明 ensemble 在 RL 中确实可以帮助稳定训练、增强探索,而我们的 BE-DQN 可以理解为在此基础上加入一个“贝叶斯化的动态成员选择机制”。
第四条是 实验基准与应用背景。例如 Neural Testbed、Yahoo!R6B、MiniGrid、Mushroom 数据集等,这些基准分别对应了合成 bandit、真实推荐、强化学习与经典决策数据集,使我们能够从多个角度验证方法的有效性与泛化性。






