以下是强化学习知识点教程框架。只有已经存在的知识页使用链接;其余术语先 保留在本页,待形成独立、可验证的内容后再拆分。


一、基础概念

  1. 核心要素

    • 智能体(Agent):学习与决策的主体,通过与环境交互实现目标(如 AlphaGo 的决策模块)
    • 环境(Environment):智能体外部的一切,包含状态转移与奖励机制
    • 状态(State):描述环境的瞬时特征
    • 动作(Action):智能体可执行的操作集合
    • 奖励(Reward):标量反馈信号,驱动智能体优化策略
  2. 学习机制

    • 策略(Policy):状态到动作的映射规则(确定性策略如,随机性策略如
    • 价值函数(Value Function):衡量状态或状态-动作对的长期期望回报(
    • 探索与利用(Exploration vs. Exploitation):平衡尝试新动作与利用已知高回报动作的矛盾
  3. 理论框架

    • 马尔可夫决策过程(MDP):基于状态转移概率和即时奖励的数学模型,包含状态、动作、转移概率、奖励函数和折扣因子
    • 贝尔曼方程(Bellman Equation):递归表达价值函数的核心公式(

二、核心算法

  1. 经典方法

    • Q-learning:无模型的离策略算法,通过更新 Q 表逼近最优动作价值函数
    • SARSA:同策略的 TD 控制方法,更新依赖实际执行动作而非最大值
  2. 深度强化学习

    • DQN(深度 Q 网络):结合 Q-learning 与神经网络,引入经验回放和固定目标网络解决不稳定问题
    • 策略梯度(Policy Gradient):直接优化策略参数,适用于连续动作空间
    • PPO(近端策略优化):通过截断目标函数实现稳定训练
    • SAC(软演员-评论家):引入最大熵框架平衡探索与利用
  3. 进阶变体

    • CQL(保守 Q 学习):通过正则化防止 Q 值高估,提升离线强化学习性能
    • TD3(双延迟深度确定性策略梯度):改进 DDPG,采用双 Q 网络与目标策略平滑

三、数学基础

  1. 必备工具

    • 动态规划(Dynamic Programming):求解 MDP 的迭代方法
    • 概率论与统计:理解状态转移分布、期望回报计算及探索策略设计
    • 优化与梯度下降:策略网络参数更新与损失函数优化的核心技术
  2. 关键推导

    • 贝尔曼最优性原理:证明最优策略对应的价值函数满足自洽方程
    • 策略梯度定理:推导策略性能度量对参数的梯度表达式

四、进阶主题

  1. 复杂场景扩展

    • 多智能体强化学习(MARL):处理竞争或协作环境。
    • 逆强化学习(IRL):从专家示范中推断奖励函数。
    • 分层强化学习(HRL):通过子策略分解解决长期信用分配问题。
  2. 前沿方向

    • 基于 Transformer 的强化学习:利用注意力机制处理长序列决策。
    • 元强化学习(Meta-RL):快速适应新任务的小样本学习框架。

五、应用场景

  1. 典型领域

    • 游戏AI(Atari游戏、AlphaGo)
    • 机器人控制(机械臂抓取、无人机导航)
    • 推荐系统(动态调整推荐策略)
    • 自动驾驶(路径规划、交通信号优化)
  2. 实践挑战

    • 奖励设计(Reward Shaping):通过额外反馈缓解稀疏奖励,但必须避免改变原任务的最优策略。
    • 部分可观测 MDP(POMDP):处理智能体无法直接观察完整环境状态的情况。

六、学习资源推荐

  • 入门:李宏毅《深度强化学习》视频(代码示例丰富)
  • 理论:David Silver课程(系统性框架+学术深度)
  • 数学:《深度强化学习(初稿)》(需线性代数/优化基础)
  • 实战:GitHub项目datawhalechina/easy-rl(13种算法PyTorch实现)

待扩展页面

  • 多智能体强化学习(MARL)
  • 奖励设计与稀疏奖励
  • 离线强化学习
  • 基于 Transformer 的强化学习
  • 部分可观测 MDP(POMDP)

只有在能够提供清晰定义、公式边界和可靠来源后,才把这些条目拆成独立页面。