感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
1. 深度強化學習簡介
- 什麼是強化學習?
- 監督式學習, 非監督式學習與強化學習之差異
- DRL 於 2025 年之應用領域 (機器人, 醫療保健, 金融, 物流)
- 理解智能體與環境之間的互動循環
2. 強化學習基礎
- 馬可夫決策過程 (MDP)
- 狀態, 動作, 獎勵, 政策與價值函數
- 探索與利用的權衡
- 蒙特卡羅方法與時間差分 (TD) 學習
3. 實作基礎 RL 演算法
- 表格式方法: 動態規劃, 策略評估與迭代
- Q-Learning 與 SARSA
- Epsilon-greedy 探索機制及衰減策略
- 使用 OpenAI Gymnasium 建立 RL 環境
4. 過渡至深度強化學習
- 表格式方法的限制
- 使用神經網路進行函數逼近
- Deep Q-Network (DQN) 架構與工作流程
- 經驗回放與目標網路
5. 進階 DRL 演算法
- Double DQN, Dueling DQN 與優先經驗回放
- 策略梯度法: REINFORCE 演算法
- Actor-Critic 架構 (A2C, A3C)
- 近端策略優化 (PPO)
- 軟 Actor-Critic (SAC)
6. 處理連續動作空間
- 連續控制面臨的挑戰
- 使用 DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. 實用工具與框架
- 使用 Stable-Baselines3 及 Ray RLlib
- 使用 TensorBoard 進行日誌記錄與監控
- DRL 模型超參數調優
8. 獎勵工程與環境設計
- 獎勵塑形與懲罰平衡
- Sim-to-real 遷移學習概念
- 在 Gymnasium 中建立自訂環境
9. 部分可觀察環境與泛化能力
- 處理不完整狀態資訊 (POMDPs)
- 基於記憶的方法: 使用 LSTMs 和 RNNs
- 提升智能體的穩健性與泛化能力
10. 博弈論與多智能體強化學習
- 多智能體環境簡介
- 合作與競爭
- 在對抗性訓練及策略優化中的應用
11. 案例研究與實際應用
- 自動駕駛模擬
- 動態定價與金融交易策略
- 機器人與工業自動化
12. 除錯與最佳化
- 診斷不穩定的訓練過程
- 管理獎勵稀疏性與過度擬合問題
- 在 GPU 及分散式系統上擴展 DRL 模型
13. 總結與下一步
- DRL 架構與關鍵演算法回顧
- 產業趨勢與研究方向 (例如: RLHF, 混合模型)
- 進階資源與閱讀材料
最低要求
- 具備 Python 程式設計能力
- 理解微積分與線性代數
- 具備概率論與統計學的基本知識
- 曾使用 Python 及 NumPy 或 TensorFlow/PyTorch 建立機器學習模型之經驗
適用對象
- 對人工智慧與智能系統感興趣的開發人員
- 正在探索強化學習框架的數據科學家
- 從事自主系統專案的機器學習工程師
21 小時
客戶評論 (3)
我非常喜歡最後我們花時間一起探索CHAT GPT的部分。不過房間的佈置不是最佳選擇,如果能有幾張小組桌,而不是一張大桌子,這樣我們可以分成小組進行頭腦風暴,效果會更好。
Nola - Laramie County Community College
課程 - Artificial Intelligence (AI) Overview
機器翻譯
從第一性原理出發,專注於實踐,並在同一天內應用案例分析
Maggie Webb - Department of Jobs, Regions, and Precincts
課程 - Artificial Neural Networks, Machine Learning, Deep Thinking
機器翻譯
它應用了真實的公司數據。培訓師採用了一種非常好的方法,讓學員參與並競爭。
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
課程 - Applied AI from Scratch in Python
機器翻譯