聯繫我們

課程簡介

強化學習簡介

  • 什麼是強化學習?
  • 關鍵概念:智能體、環境、狀態、動作和獎勵
  • 強化學習面臨的挑戰

探索與利用

  • 在 RL 模型中平衡探索與利用
  • 探索策略:epsilon-greedy、softmax 等

Q-Learning 和深度 Q 網路(DQNs)

  • Q-learning 簡介
  • 使用 TensorFlow 實現 DQNs
  • 透過經驗回放和目標網路優化 Q-learning

基於策略的方法

  • 策略梯度演算法
  • REINFORCE 演算法及其實現
  • 演員-評論家方法

使用 OpenAI Gym

  • 在 OpenAI Gym 中設置環境
  • 在動態環境中模擬智能體
  • 評估智能體效能

高級強化學習技術

  • 多智能體強化學習
  • 深度確定性策略梯度(DDPG)
  • 近端策略優化(PPO)

部署強化學習模型

  • 強化學習的真實世界應用
  • 將 RL 模型整合至生產環境

總結與下一步

最低要求

  • 具備 Python 程式設計經驗
  • 對深度學習和機器學習概念有基本了解
  • 掌握強化學習中使用的演算法及數學概念

受眾

  • 數據科學家
  • 機器學習從業人員
  • AI 研究人員
 28 小時

課程分類