聯繫我們

課程簡介

強化學習與代理式 AI 簡介

  • 不確定性下的決策和序列規劃
  • RL 的關鍵組件:代理人、環境、狀態和獎勵
  • RL 在適應性和代理式 AI 系統中的作用

馬爾可夫決策過程 (MDPs)

  • MDPs 的正式定義和屬性
  • 價值函數、貝葉斯方程和動態規劃
  • 策略評估、改進和迭代

模型自由強化學習

  • 蒙特卡洛和時間差分 (TD) 學習
  • Q-learning 和 SARSA
  • 實踐:在 Python 中實現表格 RL 方法

深度強化學習

  • 結合神經網路與 RL 進行函數近似
  • 深度 Q-網路 (DQN) 和經驗回放
  • Actor-Critic 架構和策略梯度
  • 實踐:使用 Stable-Baselines3 訓練使用 DQN 和 PPO 的代理人

探索策略與獎勵塑造

  • 平衡探索與利用 (ε-greedy、UCB、熵方法)
  • 設計獎勵函數並避免意外行為
  • 獎勵塑造和課程學習

RL 與決策的高級主題

  • 多代理強化學習及合作策略
  • 分層強化學習和選項框架
  • 用於更安全部署的離線 RL 和模仿學習

模擬環境與評估

  • 使用 OpenAI Gym 和自訂環境
  • 連續與離散動作空間
  • 代理人性能、穩定性和採樣效率的指標

將 RL 整合至代理式 AI 系統

  • 在混合代理人架構中結合推理和 RL
  • 將強化學習與使用工具的人整合
  • 擴展和部署的運營考量

綜合專案

  • 為模擬任務設計並實現強化學習代理人
  • 分析訓練性能並優化超參數
  • 在代理情境中展示適應性行為和決策能力

總結與下一步

最低要求

  • 精通 Python 編程
  • 紮實的機器學習和深度學習概念理解
  • 熟悉線性代數、概率論和基本優化方法

受眾

  • 強化學習工程師和應用 AI 研究人員
  • 機器人和自動化開發人員
  • 從事適應性和代理式 AI 系統的工程團隊
 28 小時

客戶評論 (3)

課程分類