聯繫我們
 課程時長 21 時間:

課程簡介

1.深度强化学习导论

  • 什么是强化学习?
  • 监督学习、无监督学习与强化学习的区别
  • 2025年DRL的应用(机器人、医疗、金融、物流)
  • 理解智能体与环境的交互循环

2.强化学习基础

  • 马尔可夫决策过程(MDP)
  • 状态、动作、奖励、策略和价值函数
  • 探索与利用的权衡
  • 蒙特卡洛方法与时间差分(TD)学习

3.实现基础强化学习算法

  • 表格方法:动态规划、策略评估与迭代
  • Q-Learning与SARSA
  • Epsilon-greedy探索与衰减策略
  • 使用OpenAI Gymnasium实现强化学习环境

4.过渡到深度强化学习

  • 表格方法的局限性
  • 使用神经网络进行函数逼近
  • Deep Q-Network(DQN)架构与工作流程
  • 经验回放与目标网络

5.高级DRL算法

  • Double DQN、Dueling DQN与优先经验回放
  • 策略梯度方法:REINFORCE算法
  • Actor-Critic架构(A2C、A3C)
  • 近端策略优化(PPO)
  • Soft Actor-Critic(SAC)

6.处理连续动作空间

  • 连续控制中的挑战
  • 使用DDPG(深度确定性策略梯度)
  • Twin Delayed DDPG(TD3)

7.实用工具与框架

  • 使用Stable-Baselines3和Ray RLlib
  • 使用TensorBoard进行日志记录与监控
  • DRL模型的超参数调优

8.奖励工程与环境设计

  • 奖励塑形与惩罚平衡
  • Sim-to-real迁移学习概念
  • 在Gymnasium中创建自定义环境

9.部分可观测环境与泛化

  • 处理不完整状态信息(POMDP)
  • 使用LSTM和RNN的基于记忆的方法
  • 提高智能体的鲁棒性与泛化能力

10.博弈论与多智能体强化学习

  • 多智能体环境简介
  • 合作与竞争
  • 在对抗训练与策略优化中的应用

11.案例研究与实际应用

  • 自动驾驶模拟
  • 动态定价与金融交易策略
  • 机器人与工业自动化

12.故障排除与优化

  • 诊断不稳定的训练
  • 处理奖励稀疏与过拟合
  • 在GPU和分布式系统上扩展DRL模型

13.总结与后续步骤

  • 回顾DRL架构与关键算法
  • 行业趋势与研究方向(例如RLHF、混合模型)
  • 延伸资源与阅读材料

最低要求

  • 熟练掌握Python编程
  • 理解微积分和线性代数
  • 具备概率与统计的基础知识
  • 有使用Python及NumPy或TensorFlow/PyTorch构建机器学习模型的经验

目标受众

  • 对人工智能和智能系统感兴趣的开发人员
  • 正在探索强化学习框架的数据科学家
  • 从事自主系统工作的机器学习工程师

人數


每位參與者的報價

客戶評論 (2)

即將到來的課程

課程分類