聯繫我們
 課程時長 35 時間:

課程簡介

SRE 反模式

  • 識別反成效的做法
  • 認知反模式對可靠性的影響
  • 最佳實務與矯正替代方案

以 SLO 作為客戶滿意度的代理指標

  • 定義服務層級指標(SLI)和服務層級目標(SLO)
  • 管理錯誤預算並平衡創新與可靠性
  • 理解分布式系統的局限性

構建安全且可靠的系統

  • 設計容錯與韌性
  • 將安全性整合至可靠性工程中
  • 擴展性與數據保護策略

全棧可觀察性

  • instrumentation 和指標收集
  • 分布式追蹤與合成監控
  • 以可觀察性為驅動的开发模式

平台工程與 AIOps

  • 以平台為中心的工程方法
  • SRE 中的自動化與編排
  • 運用 DataOps 與運營智能

SRE 中的事故管理

  • 事故回應中的角色與職責
  • 應用 OODA 等框架
  • 自動化修復及由 AI/ML 輔助的解決方案

混沌工程

  • 韌性測試的原則與策略
  • 規劃與執行「遊戲日」演練
  • 從受控失敗實驗中學習

SRE 作為 DevOps 的純粹形式

  • 將 SRE 整合至 DevOps 工作流程
  • 文化對齊與協作實務
  • 透過 SRE 推動組織轉型

課後演練

  • 大規模系統設計案例研究
  • 進階 instrumentation 和監控場景
  • 真實世界可靠性問題解決

複習與考試準備

  • 最終複習 DevOps 學院 SRE 執行人員大綱
  • 樣題與模擬測試
  • 應試策略與建議

總結與下一步

最低要求

  • 了解核心網站可靠性工程原則
  • 具備 DevOps 實務及相關工具的經驗
  • 熟悉系統監控、事故管理和自動化

受眾對象

  • 尋求 DevOps 學院 SRE 執行人員認證的 SRE 專業人員
  • 希望擴展至可靠性相關職位的 DevOps 工程師
  • 負責可靠性策略與執行的運營主管

客戶評論 (2)

課程分類