聯繫我們

課程簡介

強化學習簡介

  • 強化學習及其應用的概述
  • 監督式學習、非監督式學習與強化學習之間的差異
  • 核心概念:代理、環境、獎勵與政策

馬可夫決策過程(MDPs)

  • 理解狀態、動作、獎勵與狀態轉移
  • 價值函數與贝尔曼方程
  • 運用動態規劃解決MDPs問題

核心RL演算法

  • 表格方法:Q-Learning與SARSA
  • 基於政策的政策:REINFORCE演算法
  • Actor-Critic架構及其應用

深度強化學習

  • 深度Q網絡(DQN)簡介
  • 經驗重放與目標網路
  • 政策梯度與進階深度RL方法

RL框架與工具

  • OpenAI Gym與其他RL環境簡介
  • 使用PyTorch或TensorFlow開發RL模型
  • 訓練、測試及基準測試RL代理

RL的挑戰

  • 在訓練中平衡探索與利用
  • 應對稀疏獎勵與信用分配問題
  • RL的可擴展性與計算挑戰

實作活動

  • 從零開始實作Q-Learning與SARSA演算法
  • 訓練基於DQN的代理在OpenAI Gym中玩簡單遊戲
  • 微調RL模型以在客製化環境中提升效能

總結與後續步驟

最低要求

  • 具備紮實的機器學習原理與演算法基礎
  • 熟練Python程式語言
  • 熟悉神經網路與深度學習框架

受訓對象

  • 機器學習工程師
  • AI專家
 14 小時

課程分類