感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 21 時間:
課程簡介
1.深度强化学习导论
- 什么是强化学习?
- 监督学习、无监督学习与强化学习的区别
- 2025年DRL的应用(机器人、医疗、金融、物流)
- 理解智能体与环境的交互循环
2.强化学习基础
- 马尔可夫决策过程(MDP)
- 状态、动作、奖励、策略和价值函数
- 探索与利用的权衡
- 蒙特卡洛方法与时间差分(TD)学习
3.实现基础强化学习算法
- 表格方法:动态规划、策略评估与迭代
- Q-Learning与SARSA
- Epsilon-greedy探索与衰减策略
- 使用OpenAI Gymnasium实现强化学习环境
4.过渡到深度强化学习
- 表格方法的局限性
- 使用神经网络进行函数逼近
- Deep Q-Network(DQN)架构与工作流程
- 经验回放与目标网络
5.高级DRL算法
- Double DQN、Dueling DQN与优先经验回放
- 策略梯度方法:REINFORCE算法
- Actor-Critic架构(A2C、A3C)
- 近端策略优化(PPO)
- Soft Actor-Critic(SAC)
6.处理连续动作空间
- 连续控制中的挑战
- 使用DDPG(深度确定性策略梯度)
- Twin Delayed DDPG(TD3)
7.实用工具与框架
- 使用Stable-Baselines3和Ray RLlib
- 使用TensorBoard进行日志记录与监控
- DRL模型的超参数调优
8.奖励工程与环境设计
- 奖励塑形与惩罚平衡
- Sim-to-real迁移学习概念
- 在Gymnasium中创建自定义环境
9.部分可观测环境与泛化
- 处理不完整状态信息(POMDP)
- 使用LSTM和RNN的基于记忆的方法
- 提高智能体的鲁棒性与泛化能力
10.博弈论与多智能体强化学习
- 多智能体环境简介
- 合作与竞争
- 在对抗训练与策略优化中的应用
11.案例研究与实际应用
- 自动驾驶模拟
- 动态定价与金融交易策略
- 机器人与工业自动化
12.故障排除与优化
- 诊断不稳定的训练
- 处理奖励稀疏与过拟合
- 在GPU和分布式系统上扩展DRL模型
13.总结与后续步骤
- 回顾DRL架构与关键算法
- 行业趋势与研究方向(例如RLHF、混合模型)
- 延伸资源与阅读材料
最低要求
- 熟练掌握Python编程
- 理解微积分和线性代数
- 具备概率与统计的基础知识
- 有使用Python及NumPy或TensorFlow/PyTorch构建机器学习模型的经验
目标受众
- 对人工智能和智能系统感兴趣的开发人员
- 正在探索强化学习框架的数据科学家
- 从事自主系统工作的机器学习工程师
客戶評論 (2)
讓從未使用過AI的人重複練習提示詞,並讓已在使用AI的人考慮不同的使用方式。
Matthew Gay - Tarsus Pharmaceuticals
課程 - Artificial Intelligence (AI) Overview
機器翻譯
從第一性原理出發,專注於實踐,並在同一天內應用案例分析
Maggie Webb - Department of Jobs, Regions, and Precincts
課程 - Artificial Neural Networks, Machine Learning, Deep Thinking
機器翻譯