聯繫我們

課程簡介

1. 深度強化學習簡介

  • 什麼是強化學習?
  • 監督學習、無監督學習和強化學習之間的區別
  • DRL 在 2025 年的應用(機器人、醫療保健、金融、物流)
  • 理解智能體與環境的交互循環

2. 強化學習基礎

  • 馬爾可夫決策過程 (MDP)
  • 狀態、行動、獎勵、策略和價值函數
  • 探索與利用之間的權衡
  • 蒙特卡洛方法和時間差分 (TD) 學習

3. 實現基本的 RL 算法

  • 查表方法:動態規劃、策略評估和迭代
  • Q-Learning 和 SARSA
  • Epsilon-greedy 探索和衰減策略
  • 使用 OpenAI Gymnasium 實現 RL 環境

4. 過渡到深度強化學習

  • 查表方法的局限性
  • 使用神經網絡進行函數逼近
  • 深度 Q 網絡 (DQN) 架構和工作流程
  • 經驗回放和目标網絡

5. 高級 DRL 算法

  • Double DQN、Dueling DQN 和優先經驗回放
  • 策略梯度方法:REINFORCE 算法
  • Actor-Critic 架構 (A2C, A3C)
  • 近端策略優化 (PPO)
  • 軟 Actor-Critic (SAC)

6. 處理連續動作空間

  • 連續控制的挑戰
  • 使用 DDPG (深度確定性策略梯度)
  • 雙向延遲 DDPG (TD3)

7. 實用工具和框架

  • 使用 Stable-Baselines3 和 Ray RLlib
  • 使用 TensorBoard 進行日誌記錄和監控
  • DRL 模型的超參數調優

8. 獎勵工程和環境設計

  • 獎勵塑形和懲罰平衡
  • Sim-to-real 遷移學習概念
  • 在 Gymnasium 中創建自定義環境

9. 部分可觀察環境和泛化

  • 處理不完整狀態信息 (POMDPs)
  • 使用 LSTMs 和 RNNs 的基於內存的方法
  • 提高智能體的魯棒性和泛化能力

10. 博弈論和多智能體強化學習

  • 多智能體環境簡介
  • 合作與競爭
  • 在對抗性訓練和策略優化中的應用

11. 案例研究和實際應用

  • 自動駕駛模擬
  • 動態定價和金融交易策略
  • 機器人和工業自動化

12. 故障排查和優化

  • 診斷不穩定訓練
  • 管理獎勵稀疏性和過擬合
  • 在 GPU 和分佈式系統上擴展 DRL 模型

13. 總結和下一步

  • DRL 架構和關鍵算法回顧
  • 行業趨勢和研究方向(例如,RLHF,混合模型)
  • 進一步的資源和閱讀材料

最低要求

  • 精通 Python 編程
  • 理解微積分和線性代數
  • 具備概率論和統計學的基本知識
  • 有使用 Python 以及 NumPy 或 TensorFlow/PyTorch 構建機器學習模型的經驗

目標受眾

  • 對人工智能和智能系統感興趣的開發人員
  • 正在探索強化學習框架的數據科學家
  • 從事自主系統工作的機器學習工程師
 21 小時

客戶評論 (3)

課程分類