马尔可夫决策过程(Markov Decision Process, MDP)是描述序贯决策问题的数学 框架。它通常写成五元组:

  • :状态空间;
  • :动作空间;
  • :执行动作后转移到下一状态的概率;
  • :转移产生的即时奖励;
  • :未来奖励的折扣因子。

马尔可夫性质

MDP 假设:给定当前状态和动作后,下一状态的分布不再依赖更早的完整历史。 这不是说历史没有作用,而是要求当前状态已经包含决策所需的信息。如果状态 不能表达这些信息,就需要考虑状态重构或 POMDP。

与强化学习的关系

MDP 定义问题;强化学习研究在未知或难以直接使用转移模型时,如何通过交互 数据学习策略。价值函数和贝尔曼方程建立了即时奖励与长期回报之间的递归关系。

返回 强化学习总纲

来源

  • Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., 官方在线版