聯繫我們
 課程時長 14 時間:

課程簡介

使用開源工具入門 AIOps

  • AIOps 概念和優勢概覽
  • 可觀察性棧中的 Prometheus 和 Grafana
  • 機器學習在 AIOps 中的角色:預測分析與被動分析

設置 Prometheus 和 Grafana

  • 安裝和配置 Prometheus 以進行時間序列數據收集
  • 使用實時指標在 Grafana 中創建儀表板
  • 探索 exporters、重標簽和服務發現

機器學習的數據預處理

  • 提取和轉換 Prometheus 指標
  • 為異常檢測和預測準備數據集
  • 使用 Grafana 的轉換功能或 Python 管道

應用機器學習進行異常檢測

  • 基本機器學習模型用於離群值檢測(例如 Isolation Forest, One-Class SVM)
  • 在時間序列數據上訓練和評估模型
  • 在 Grafana 儀表板中可視化異常

使用機器學習預測指標

  • 構建簡單的預測模型(ARIMA, Prophet, LSTM 入門)
  • 預測系統負載或資源使用
  • 利用預測進行早期告警和擴容決策

將機器學習與告警和自動化集成

  • 基於機器學習輸出或閾值定義告警規則
  • 使用 Alertmanager 和通知路由
  • 觸發腳本或自動化工作流進行異常檢測

擴展和運營化 AIOps

  • 集成外部可觀察性工具(例如 ELK 棧、Moogsoft、Dynatrace)
  • 在可觀察性管道中運營化機器學習模型
  • 大規模 AIOps 的最佳實踐

總結與下一步

最低要求

  • 對系統監控和可觀察性概念的瞭解
  • 使用 Grafana 或 Prometheus 的經驗
  • 熟悉 Python 及基本的機器學習原理

受眾

  • 可觀察性工程師
  • 基礎設施和 DevOps 團隊
  • 監控平台架構師和網站可靠性工程師(SREs)

課程分類