感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
預測性 AIOps 介紹
- IT 運維中預測性分析概覽
- 預測數據來源(日誌、指標、事件)
- 時間序列預測和異常模式中的關鍵概念
設計事件預測模型
- 對歷史事件和系統行為進行標註
- 選擇和訓練模型(例如 LSTM、Random Forest、AutoML)
- 評估模型性能及處理誤報
數據收集與特徵工程
- 引入並對齊日誌和指標數據作為模型輸入
- 從結構化和非結構化數據中提取特徵
- 在運維管道中處理噪聲和缺失數據
自動化根本原因分析 (RCA)
- 服務和基礎設施的圖關聯分析
- 使用 ML 從事件鏈中推斷可能的根本原因
- 使用基於拓撲的儀表板可視化 RCA
修復與工作流自動化
- 與自動化平台集成(例如 Ansible、Rundeck)
- 觸發回滾、重啟或流量重定向
- 審計和記錄自動化干預措施
擴展智能 AIOps 管道
- 可觀測性的 MLOps:重新訓練和模型版本控制
- 在分布式節點上運行實時預測
- 在生產環境中部署 AIOps 的最佳實踐
案例研究與實際應用
- 使用預測性 AIOps 模型分析真實事件數據
- 使用合成數據和生產數據部署 RCA 管道
- 行業應用案例回顧:雲服務中斷、微服務不穩定、網絡性能下降
總結與下一步
最低要求
- 擁有 Prometheus 或 ELK 等監控系統的經驗
- 具備 Python 及基礎機器學習的實際操作知識
- 熟悉事件管理工作流
目標受眾
- 高級站點可靠性工程師 (SRE)
- IT 自動化架構師
- DevOps 和可觀測性平台負責人