联系我们

课程大纲

强化学习导论

  • 强化学习概览及其应用
  • 监督学习、无监督学习与强化学习的区别
  • 关键概念:智能体、环境、奖励及策略

马尔可夫决策过程(MDP)

  • 理解状态、动作、奖励及状态转移
  • 价值函数与贝尔曼方程
  • 用于求解MDP的动态规划

核心强化学习算法

  • 表格方法:Q-Learning与SARSA
  • 基于策略的方法:REINFORCE算法
  • Actor-Critic框架及其应用

深度强化学习

  • 深度Q网络(DQN)简介
  • 经验回放及目标网络
  • 策略梯度及高级深度强化学习方法

强化学习框架与工具

  • OpenAI Gym及其他强化学习环境简介
  • 使用PyTorch或TensorFlow进行强化学习模型开发
  • 强化学习智能体的训练、测试及基准评估

强化学习的挑战

  • 训练中的探索与利用平衡
  • 应对稀疏奖励及信用分配问题
  • 强化学习的可扩展性及计算挑战

动手实践

  • 从零实现Q-Learning与SARSA算法
  • 训练基于DQN的智能体在OpenAI Gym中玩简单游戏
  • 微调强化学习模型以在自定义环境中提升性能

总结与后续步骤

要求

  • 熟练掌握机器学习原理及算法
  • 精通Python编程
  • 熟悉神经网络及深度学习框架

目标受众

  • 机器学习工程师
  • AI专家
 14 小时

即将举行的公开课程

课程分类