联系我们

课程大纲

强化学习与智能体AI简介

  • 不确定性下的决策与序列规划
  • 强化学习的关键组成:智能体、环境、状态和奖励
  • 强化学习在自适应和智能体AI系统中的作用

马尔可夫决策过程

  • 马尔可夫决策过程的正式定义与性质
  • 价值函数、贝尔曼方程与动态规划
  • 策略评估、改进与迭代

无模型强化学习

  • 蒙特卡洛与时序差分学习
  • Q-learning和SARSA
  • 动手实践:在Python中实现表格型强化学习方法

深度强化学习

  • 将神经网络与强化学习结合进行函数逼近
  • 深度Q网络与经验回放
  • Actor-Critic架构与策略梯度
  • 动手实践:使用Stable-Baselines3训练基于DQN和PPO的智能体

探索策略与奖励塑形

  • 平衡探索与利用(ε-greedy、UCB、熵方法)
  • 设计奖励函数,避免非预期行为
  • 奖励塑形与课程学习

强化学习与决策的高级主题

  • 多智能体强化学习与协作策略
  • 分层强化学习与options框架
  • 离线强化学习与模仿学习,助力更安全部署

模拟环境与评估

  • 使用OpenAI Gym和自定义环境
  • 连续与离散动作空间
  • 衡量智能体性能、稳定性和样本效率的指标

将强化学习集成到智能体AI系统中

  • 在混合智能体架构中结合推理与强化学习
  • 将强化学习与工具使用型智能体集成
  • 扩展与部署的运维考量

结业项目

  • 为模拟任务设计并实现一个强化学习智能体
  • 分析训练性能并优化超参数
  • 在智能体场景中展示自适应行为与决策能力

总结与后续步骤

要求

  • 精通Python编程
  • 扎实理解机器学习和深度学习概念
  • 熟悉线性代数、概率和基本优化方法

目标受众

  • 强化学习工程师和应用AI研究人员
  • 机器人与自动化开发人员
  • 从事自适应和智能体AI系统开发的工程团队
 28 小时

客户评论 (3)

即将举行的公开课程

课程分类