聯繫我們
 課程時長 14 時間:

課程簡介

預測性 AIOps 介紹

  • IT 運維中預測性分析概覽
  • 預測數據來源(日誌、指標、事件)
  • 時間序列預測和異常模式中的關鍵概念

設計事件預測模型

  • 對歷史事件和系統行為進行標註
  • 選擇和訓練模型(例如 LSTM、Random Forest、AutoML)
  • 評估模型性能及處理誤報

數據收集與特徵工程

  • 引入並對齊日誌和指標數據作為模型輸入
  • 從結構化和非結構化數據中提取特徵
  • 在運維管道中處理噪聲和缺失數據

自動化根本原因分析 (RCA)

  • 服務和基礎設施的圖關聯分析
  • 使用 ML 從事件鏈中推斷可能的根本原因
  • 使用基於拓撲的儀表板可視化 RCA

修復與工作流自動化

  • 與自動化平台集成(例如 Ansible、Rundeck)
  • 觸發回滾、重啟或流量重定向
  • 審計和記錄自動化干預措施

擴展智能 AIOps 管道

  • 可觀測性的 MLOps:重新訓練和模型版本控制
  • 在分布式節點上運行實時預測
  • 在生產環境中部署 AIOps 的最佳實踐

案例研究與實際應用

  • 使用預測性 AIOps 模型分析真實事件數據
  • 使用合成數據和生產數據部署 RCA 管道
  • 行業應用案例回顧:雲服務中斷、微服務不穩定、網絡性能下降

總結與下一步

最低要求

  • 擁有 Prometheus 或 ELK 等監控系統的經驗
  • 具備 Python 及基礎機器學習的實際操作知識
  • 熟悉事件管理工作流

目標受眾

  • 高級站點可靠性工程師 (SRE)
  • IT 自動化架構師
  • DevOps 和可觀測性平台負責人

課程分類