聯繫我們

課程簡介

強化學習簡介

  • 強化學習及其應用的概覽
  • 監督式、非監督式與強化學習之間的差異
  • 關鍵概念:代理、環境、獎勵與策略

馬爾可夫決策過程(MDP)

  • 理解狀態、動作、獎勵與狀態轉移
  • 價值函數與貝爾曼方程式
  • 用於解決MDP的動態規劃

核心強化學習演算法

  • 表格式方法:Q學習與SARSA
  • 基於策略的方法:REINFORCE演算法
  • Actor-Critic框架及其應用

深度強化學習

  • 深度Q網絡(DQN)簡介
  • 經驗回放與目標網絡
  • 策略梯度與高階深度強化學習方法

RL框架與工具

  • OpenAI Gym及其他RL環境簡介
  • 使用PyTorch或TensorFlow進行RL模型開發
  • 訓練、測試並對標RL代理

RL的挑戰

  • 訓練中平衡探索與利用
  • 處理稀疏獎勵與信用分配問題
  • RL中的可擴展性與計算挑戰

動手實作活動

  • 從零開始實現Q學習與SARSA演算法
  • 訓練基於DQN的代理,在OpenAI Gym中進行簡單遊戲
  • 微調RL模型,以提升在自訂環境中的表現

總結與後續步驟

最低要求

  • 深刻理解機器學習原理與演算法
  • 熟練使用Python程式語言
  • 熟悉神經網路與深度學習框架

目標受眾

  • 機器學習工程師
  • AI專家
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類