聯繫我們
 課程時長 14 時間:

課程簡介

AIOps 簡介

  • 什麼是 AIOps 及其重要性
  • 傳統監控與 AIOps 驅動的可觀測性之比較
  • AIOps 架構與關鍵組件

收集與標準化運維數據

  • 可觀測性數據類型:指標、日誌與追蹤
  • 從多個來源(伺服器、容器、雲端)攝取數據
  • 使用代理程式與導出器(Prometheus、Beats、Fluentd)

數據關聯與異常檢測

  • 時間序列關聯與統計方法
  • 使用 ML 模型進行異常檢測
  • 在分布式系統中檢測事件

告警與噪音減少

  • 設計智慧的告警規則與閾值
  • 抑制、去重與告警分組
  • 與 Alertmanager、Slack、PagerDuty 或 Opsgenie 整合

根本原因分析與視覺化

  • 使用儀表板視覺化指標並檢測趨勢
  • 探索事件與時間線以進行 RCA(根本原因分析)
  • 使用分布式追蹤工具跨層級追蹤問題

自動化與修復

  • 從事件觸發自動化腳本或工作流
  • 與 ITSM 系統(ServiceNow、Jira)整合
  • 應用場景:自我修復、擴展、流量重新路由

開源與商業 AIOps 平台

  • 工具概覽:Prometheus、Grafana、ELK、Moogsoft、Dynatrace
  • 選擇 AIOps 平台的評估標準
  • 對選定技術棧進行演示與動手操作

總結與後續步驟

最低要求

  • 對 IT 運維及系統監控概念有所理解
  • 具備監控工具或儀表板的使用經驗
  • 熟悉基本的日誌與指標格式

目標受眾

  • 負責基礎設施與應用程式的運維團隊
  • 網站可靠性工程師 (SREs)
  • IT 監控與可觀測性團隊

課程分類