聯繫我們

課程簡介

強化學習與代理式 AI 簡介

  • 不確定性下的決策制定與序列規劃
  • RL 的關鍵組件:智能體、環境、狀態和獎勵
  • RL 在自適應和代理式 AI 系統中的角色

馬可夫決策過程 (MDPs)

  • MDPs 的形式化定義和屬性
  • 價值函數、貝爾曼方程和動態規劃
  • 策略評估、改進和迭代

無模型強化學習

  • 蒙特卡羅 (Monte Carlo) 和時間差分 (TD) 學習
  • Q 學習 (Q-learning) 和 SARSA
  • 動手實踐:在 Python 中實現表格型 RL 方法

深度強化學習

  • 結合神經網絡與 RL 進行函數逼近
  • 深度 Q 網絡 (DQN) 和經驗重放
  • Actor-Critic 架構和策略梯度
  • 動手實踐:使用 Stable-Baselines3 和 DQN 及 PPO 訓練智能體

探索策略與獎勵塑形

  • 平衡探索與利用 (ε-greedy, UCB, 熵方法)
  • 設計獎勵函數並避免非預期行為
  • 獎勵塑形和課程學習

RL 與決策制定的高級主題

  • 多智能體強化學習和協作策略
  • 分層強化學習和選項框架
  • 離線 RL 和模仿學習以實現更安全部署

模擬環境與評估

  • 使用 OpenAI Gym 和自定義環境
  • 連續與離散動作空間
  • 智能體性能、穩定性和樣本效率的指標

將 RL 整合到代理式 AI 系統中

  • 在混合智能體架構中結合推理與 RL
  • 將強化學習與工具使用智能體整合
  • 擴展和部署的操作考量的

綜合項目

  • 設計並實現一個用於模擬任務的強化學習智能體
  • 分析訓練性能並優化超參數
  • 在代理式情境中演示自適應行為和決策制定

總結與後續步驟

最低要求

  • 精通 Python 編程
  • 對機器學習和深度學習概念有紮實理解
  • 熟悉線性代數、概率論和基本優化方法

目標聽眾

  • 強化學習工程師和應用 AI 研究人员
  • 機器人技術和自動化開發人員
  • 從事自適應和代理式 AI 系統的工程團隊
 28 小時

客戶評論 (3)

課程分類