聯繫我們

課程簡介

AI 可觀測性全景

  • 從儀表板到對話:向 AI 增強的可觀測性的轉變
  • 與可觀測性相關的 LLM 能力:摘要、推理、模式匹配
  • 架構模式:將 AI 嵌入現有可觀測性堆棧

自然語言遥測查詢

  • 文本到 PromQL:將自然語言轉換為監控查詢
  • Elasticsearch、OpenSearch 和 Loki 日誌存儲的 NL 查詢
  • 用於結構化遥測的自然語言 SQL 生成
  • 構建具有工具使用和上下文感知能力的查詢助手代理

LLM 驅動的日誌分析

  • 使用 LLM 進行自動日誌解析和結構化
  • 使用嵌入相似性在日誌流中檢測異常
  • 大規模的日誌聚類和模式發現
  • 從原始日誌序列生成易於理解的解釋

智能警報與事件增強

  • 基於語義理解的警報關聯和去重
  • 從運行手冊、歷史事件和文檔中自動收集事件上下文
  • 基於內容理解和團隊專業知識的智能警報路由
  • 使用 AI 驅動的降噪減少警報疲勞

AI 輔助的根因分析

    \r
  • 通過多源遥測關聯生成假設
  • 證據鏈接:連接指標、日誌和追蹤中的症狀
  • 通過互動式 AI 診斷會話進行引導式故障排除
  • 構建具有漸進式調查能力的根因分析代理

自動化事件響應與溝通

  • 從遥測數據生成事件摘要和狀態更新
  • 通過時間線重建自動起草事後報告
  • 針對技術和高層管理受眾定製利益相關者溝通
  • 運行手冊建議和自動修復推薦

可觀測性中的機器學習

  • 用於容量規劃和異常預測的時間序列預測
  • 用於指標零樣本異常檢測的基礎模型
  • 基於嵌入的服務依賴映射拓撲發現
  • 在可觀測性管道旁訓練和部署輕量級 ML 模型

生產部署與倫理

  • 實時 AI 可觀測性的延遲和成本考慮
  • 數據隱私:確保 LLM 不洩漏敏感遥測數據
  • 人工監督:何時需要操作員驗證 AI 診斷
  • 衡量影響:MTTD、MTTR 和當值體驗指標

最低要求

  • 具備 Prometheus、Grafana、Datadog 或 OpenTelemetry 等可觀測性工具的經驗。
  • 熟悉日誌管理和指標概念。
  • 具備用於數據處理的基本 Python 編程腳本能力。

受眾

  • 採用 AI 增強工具的 SRE 和可觀測性工程師。
  • 構建下一代監控管道的平台工程師。
  • 評估將 LLM 整合到事件工作流中的 DevOps 負責人。
 14 小時

課程分類