强化学习01简介

本文介绍了强化学习的基本概念,包括智能体如何通过与环境的交互学习决策,以及目标是最大化累积奖励。强调了环境的动态性、状态转移概率、价值计算和策略优化的重要性,并对比了强化学习与有监督学习的区别。

强化学习01简介

1简介

学习总结
参考书籍链接: link

序贯决策(sequential decision making):不断做决策的过程,并且在未来决策点做进一步决策,决策者需要在未来对当前决策负责。
实现序贯决策的机器学习方法——强化学习(reinforcement learning)

1.1定义

强化学习:机器通过与环境的交互来实现目标的一种计算方法。
智能体(agent):做决策的机器,感知周围信号,做决策改变周围的环境
智能体的关键要素感知决策(策略是智能体最终体现出的智能形式,是不同智能体之间的核心区别)、奖励
一轮交互:机器在环境的一个状态下做一个动作决策,把这个动作作用到环境当中,这个环境发生相应的改变并且将相应的奖励反馈和下一轮状态传回机器。
目标:最大化在多轮交互过程(序贯决策)中获得的累积奖励的期望

多轮交互(序贯决策);给当前轮带来最大反馈的动作在长期看来不一定最优。

1.2环境

环境是动态的,会随某些因素而改变。用随机过程来刻画,关键要素:状态以及状态转移的条件概率分布。环境状态下一刻状态的概率分布由 当前状态和智能体的动作决定。

下一状态 ~ P(*|当前状态,智能体的动作)

1.3目标

实数标量表示,关注回报(return)的期望,并定义为价值(value)。
价值的计算需要对交互过程每一轮智能体采取动作的概率分布和环境相应的状态转移概率分布做积分运算。(在某个数据分布下优化一个分数值的期望)

1.4数据

智能体与环境交互的过程中得到的。
占用度量(occupancy measure):归一化的占用度量用于衡量在一个智能体决策与一个动态环境的交互过程中,采样到一个具体的状态动作对(state-action pair)的概率分布

给定两个策略及其与一个动态环境交互得到的两个占用度量,那么当且仅当这两个占用度量相同时,这两个策略相同。也就是说,如果一个智能体的策略有所改变,那么它和环境交互得到的占用度量也会相应改变

  1. 强化学习的策略在训练中会不断更新,其对应的数据分布(即占用度量)也会相应地改变
  2. 由于奖励建立在状态动作对之上,一个策略对应的价值其实就是一个占用度量下对应的奖励的期望,因此寻找最优策略对应着寻找最优占用度量

1.5有监督学习和强化学习区别

有监督学习任务:目标是找到一个最优的模型函数,使其在训练数据集上最小化一个给定的损失函数。
强化学习:通过改变策略来调整智能体和环境交互数据的分布,进而优化目标,即修改数据分布而目标函数不变。

综上:
一般的有监督学习关注寻找一个模型,使其在给定数据分布下得到的损失函数的期望最小;
强化学习关注寻找一个智能体策略,使其在与动态环境交互的过程中产生最优的数据分布,即最大化该分布下一个给定奖励函数的期望。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值