感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
設計開放式 AIOps 架構
- 開放式 AIOps 管線中關鍵組件概覽
- 從數據攝取到告警的數據流
- 工具比較及整合策略
數據收集與聚合
- 使用 Prometheus 攝取時間序列數據
- 使用 Logstash 及 Beats 捕捉日誌
- 規範化數據以進行跨來源關聯分析
構建可觀測性儀表板
- 使用 Grafana 可視化指標
- 建立 Kibana 儀表板進行日誌分析
- 利用 Elasticsearch 查詢提取運維洞察
異常檢測與事故預測
- 將可觀測性數據輸出至 Python 管線
- 訓練 ML 模型以檢測離群值及進行預測
- 部署模型以在可觀測性管線中進行即時推理
使用開源工具進行告警與自動化
- 創建 Prometheus 告警規則及 Alertmanager 路由
- 觸發腳本或 API 工作流程以實現自動響應
- 使用開源編排工具(例如 Ansible、Rundeck)
整合及擴展性考量
- 處理高吞吐量攝取及長期數據留存
- 開源技術棧中的安全性及訪問控制
- 獨立擴展每一層:攝取、處理、告警
真實應用與擴展
- 案例研究:性能調優、中斷預防及成本優化
- 使用追蹤工具或服務圖擴展管線
- 在生產環境中運行及維護 AIOps 的最佳實踐
總結與後續步驟
最低要求
- 具有 Prometheus 或 ELK 等可觀測性工具的使用經驗
- 熟悉 Python 及機器學習基本概念
- 了解 IT 運維及告警工作流程
適合對象
- 高級服務可靠性工程師 (SREs)
- 從事運維工作的數據工程師
- DevOps 平台負責人及基礎架構架構師