聯繫我們

課程簡介

強化學習與Agentic AI簡介

  • 不確定性下的決策制定與序貫規劃
  • RL核心組成:代理、環境、狀態及獎勵
  • RL在適應性與Agentic AI系統中的角色

馬爾可夫決策過程(MDPs)

  • MDPs的正式定義與特性
  • 價值函數、貝爾曼方程及動態規劃
  • 策略評估、改進及迭代

無模型強化學習

  • 蒙特卡羅(Monte Carlo)與時間差分(TD)學習
  • Q學習(Q-learning)與SARSA
  • 實戰:在Python中實現表格型RL方法

深度強化學習

  • 結合神經網絡進行RL函數近似
  • 深度Q網絡(DQN)與經驗重放
  • Actor-Critic架構與策略梯度
  • 實戰:使用Stable-Baselines3通過DQN和PPO訓練代理

探索策略與獎勵塑形

  • 平衡探索與利用(ε-greedy、UCB、熵方法)
  • 設計獎勵函數並避免非預期行為
  • 獎勵塑形與課綱學習(Curriculum Learning)

RL與決策制定的高級主題

  • 多智能體強化學習與合作策略
  • 層級化強化學習及選項框架
  • 離線RL與模仿學習,以实现更安全部署

模擬環境與評估

  • 使用OpenAI Gym及自定義環境
  • 連續與離散動作空間
  • 代理性能、穩定性及樣本效率的指標

將RL整合至Agentic AI系統

  • 在混合代理架構中結合推理與RL
  • 將強化學習與工具使用代理相結合
  • 擴展與部署的運營考量

綜合專案

  • 設計並實現針對模擬任務的強化學習代理
  • 分析訓練性能並優化超參數
  • 在Agentic情境中展示適應性行為與決策能力

總結與下一步

最低要求

  • 精通Python程式設計
  • 深入理解機器學習與深度學習概念
  • 熟悉線性代數、概率論及基礎優化方法

目標受眾

  • 強化學習工程師及應用AI研究者
  • 機器人和自動化開發人員
  • 致力於開發適應性與Agentic AI系統的工程團隊
 28 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類