2025_NIPS_Multi-Modal Inverse Constrained Reinforcement Learning from a Mixture of Demonstrations

一、文章主要内容总结

该研究聚焦于逆约束强化学习(ICRL)的核心挑战——现有算法假设演示数据来自单一类型专家,难以处理多专家、多约束的混合演示场景,提出了多模态逆约束强化学习(MMICRL)算法,核心目标是从混合专家演示中同时估计不同专家对应的专属约束,并学习符合这些约束的模仿策略。

核心背景与问题
  • 安全强化学习要求智能体遵循环境约束,但现实场景中(如自动驾驶、机器人控制)约束往往依赖专家经验,难以数学建模;
  • 现有ICRL方法仅能推断单一约束,而实际演示数据常来自多个遵循不同(甚至冲突)约束的专家(如卡车与轿车的车距约束不同),单一约束模型会导致性能下降或安全风险。
算法核心流程
  1. 无监督专家识别:基于流的密度估计器(CFDE),通过轨迹级别的占用度量(而非单步状态-动作对)识别专家类型,保证识别结果的可辨识性;
  2. 专属约束推断:利用识别后的专家子集,通过最大熵框架估计许可函数(区分专家与非专家轨迹),进而构建各专家的专属约束;
  3. 多模态策略优化:设计“最小化 agent 条件熵 + 最大化非条件熵”的目标函数,并融入对比学习框架,增强同类专家轨迹的相似性和不同类的区分度,提升策略多样性与鲁棒性。
实验验证
  • 在离散环境(Gridworld)、连续环境(MuJoCo)
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值