聯繫我們

課程簡介

運維領域的Agentic AI入門

  • 從靜態運行手冊到推理智能體:IT自動化的演進
  • 智能體解剖:推理循環、工具使用、記憶與規劃
  • 何時自動化 vs 何時保留人工介入

智能體框架與架構

  • 單智能體模式:ReAct、Plan-and-Execute 及工具調用循環
  • 多智能體架構:監督者、層級式和群體模式
  • 框架對比:LangGraph、CrewAI、AutoGen 及自定義智能體
  • 構建您的第一個運維智能體:查詢監控、診斷、建議

IT運維的工具集成

  • 將智能體連接至 Prometheus、Grafana、Datadog 和 PagerDuty API
  • 使用智能體進行日誌查詢:Elasticsearch、Loki 和 Splunk 集成
  • 基礎設施工具使用:通過智能體操作 kubectl、Terraform、Ansible
  • 設計安全的工具接口,包括參數驗證和冪等性

事件響應自動化

  • 自動事件分級:嚴重度分類與路由
  • 根因假設生成與證據收集
  • 自動修復:重啟、擴縮容、回滾和故障轉移操作
  • 構建具有漸進式自主級別的事件運行手冊智能體

安全、護欄與人工介入

  • 操作分類:只讀、低風險、高風險和破壞性操作
  • 關鍵操作的審批門控和升級策略
  • 護欄模式:操作白名單、影響範圍限制和回滾保證
  • 用於合規的審計軌跡和決策溯源

複雜事件的多智能體編排

  • 協調專家智能體:分級智能體、診斷智能體、修復智能體
  • 智能體間通信與共享上下文管理
  • 當智能體提出矛盾操作時的衝突解決
  • 多智能體響應的端到端重大事件模擬

可觀察性與評估

  • 追蹤智能體推理鏈以進行除錯和審計
  • 評估智能體決策質量:精確率、召回率、解決時間
  • 反饋循環:從操作員覆蓋和結果中學習
  • 運維智能體的成本追蹤和Token經濟學

生產部署與運維

  • 將智能體部署為服務:API、Webhooks 和定時任務
  • 漸進式自主推出:從影子模式到全自動修復
  • 智能體故障運行手冊:當智能體本身故障時怎麼辦
  • 為自主運維構建商業案例並衡量ROI

最低要求

  • 具備IT運維、DevOps或SRE實踐經驗。
  • 熟悉Python腳本編程和REST API。
  • 了解LLM能力和提示詞工程的基本知識。

目標受眾

  • 探索AI驅動自動化的SRE和DevOps工程師。
  • 構建自愈基礎設施的平台工程師。
  • 評估Agentic AI用於事件管理的IT運維負責人。
 14 小時

課程分類