一、文章主要内容总结
该研究聚焦于逆约束强化学习(ICRL)的核心挑战——现有算法假设演示数据来自单一类型专家,难以处理多专家、多约束的混合演示场景,提出了多模态逆约束强化学习(MMICRL)算法,核心目标是从混合专家演示中同时估计不同专家对应的专属约束,并学习符合这些约束的模仿策略。
核心背景与问题
- 安全强化学习要求智能体遵循环境约束,但现实场景中(如自动驾驶、机器人控制)约束往往依赖专家经验,难以数学建模;
- 现有ICRL方法仅能推断单一约束,而实际演示数据常来自多个遵循不同(甚至冲突)约束的专家(如卡车与轿车的车距约束不同),单一约束模型会导致性能下降或安全风险。
算法核心流程
- 无监督专家识别:基于流的密度估计器(CFDE),通过轨迹级别的占用度量(而非单步状态-动作对)识别专家类型,保证识别结果的可辨识性;
- 专属约束推断:利用识别后的专家子集,通过最大熵框架估计许可函数(区分专家与非专家轨迹),进而构建各专家的专属约束;
- 多模态策略优化:设计“最小化 agent 条件熵 + 最大化非条件熵”的目标函数,并融入对比学习框架,增强同类专家轨迹的相似性和不同类的区分度,提升策略多样性与鲁棒性。
实验验证
- 在离散环境(Gridworld)、连续环境(MuJoCo)
订阅专栏 解锁全文

40

被折叠的 条评论
为什么被折叠?



