感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
運維領域的Agentic AI入門
- 從靜態運行手冊到推理智能體:IT自動化的演進
- 智能體解剖:推理循環、工具使用、記憶與規劃
- 何時自動化 vs 何時保留人工介入
智能體框架與架構
- 單智能體模式:ReAct、Plan-and-Execute 及工具調用循環
- 多智能體架構:監督者、層級式和群體模式
- 框架對比:LangGraph、CrewAI、AutoGen 及自定義智能體
- 構建您的第一個運維智能體:查詢監控、診斷、建議
IT運維的工具集成
- 將智能體連接至 Prometheus、Grafana、Datadog 和 PagerDuty API
- 使用智能體進行日誌查詢:Elasticsearch、Loki 和 Splunk 集成
- 基礎設施工具使用:通過智能體操作 kubectl、Terraform、Ansible
- 設計安全的工具接口,包括參數驗證和冪等性
事件響應自動化
- 自動事件分級:嚴重度分類與路由
- 根因假設生成與證據收集
- 自動修復:重啟、擴縮容、回滾和故障轉移操作
- 構建具有漸進式自主級別的事件運行手冊智能體
安全、護欄與人工介入
- 操作分類:只讀、低風險、高風險和破壞性操作
- 關鍵操作的審批門控和升級策略
- 護欄模式:操作白名單、影響範圍限制和回滾保證
- 用於合規的審計軌跡和決策溯源
複雜事件的多智能體編排
- 協調專家智能體:分級智能體、診斷智能體、修復智能體
- 智能體間通信與共享上下文管理
- 當智能體提出矛盾操作時的衝突解決
- 多智能體響應的端到端重大事件模擬
可觀察性與評估
- 追蹤智能體推理鏈以進行除錯和審計
- 評估智能體決策質量:精確率、召回率、解決時間
- 反饋循環:從操作員覆蓋和結果中學習
- 運維智能體的成本追蹤和Token經濟學
生產部署與運維
- 將智能體部署為服務:API、Webhooks 和定時任務
- 漸進式自主推出:從影子模式到全自動修復
- 智能體故障運行手冊:當智能體本身故障時怎麼辦
- 為自主運維構建商業案例並衡量ROI
最低要求
- 具備IT運維、DevOps或SRE實踐經驗。
- 熟悉Python腳本編程和REST API。
- 了解LLM能力和提示詞工程的基本知識。
目標受眾
- 探索AI驅動自動化的SRE和DevOps工程師。
- 構建自愈基礎設施的平台工程師。
- 評估Agentic AI用於事件管理的IT運維負責人。
14 小時