
Spot and Learn:A Maximum-Entropy Patch Sampler for Few-Shot Image Classification阅读笔记
因此我们应该在最终取胜时给与决定性的奖励,而游戏过程中的行棋或甚至局部获利都不应该给很大奖励(相比最终赢棋的奖励而言)或者甚至不给奖励,以免误导智能体。折扣因子 在分类任务中,如果第N个时间步之后分类正确,奖励函数通常Rn=1.否则为0. 此外,这些动作通常是从学习策略π中采样,即ai ~ πθ(a|s),其中策略由θ参数化,可以建模为神经网络。使得做出正确的分类的同时,最大化我们行为的多样性。如图所示,五个组件,特征提取器,动作上下文编码器,状态编码器,最大熵采样器,分类。,其中T表示最终时间步。

















