聯繫我們

課程簡介

AI增強型Kubernetes運營介紹

  • 為什麼AI對現代集群運營至關重要。
  • 傳統擴展和調度邏輯的局限性。
  • 資源管理中ML的關鍵概念。

Kubernetes資源管理基礎

  • CPU、GPU和內存分配基本原理。
  • 理解配額、限制和請求。
  • 識別瓶頸與低效環節。

調度中的機器學習方法

  • 用於工作負載分佈的監督與非監督模型。
  • 資源需求的預測算法。
  • 在自定義調度器中使用ML功能。

智能自動擴展中的強化學習

  • RL代理如何從集群行為中學習。
  • 設計提升效率的獎勵函數。
  • 構建基於RL的自動擴展策略。

基於指標與遥測數據的預測性自動擴展

  • 利用Prometheus數據進行預測。
  • 將時間序列模型應用於自動擴展。
  • 評估預測準確性並調優模型。

實施AI驅動優化工具

  • 將ML框架與Kubernetes控制器集成。
  • 部署智能控制迴路。
  • 擴展KEDA以支持AI輔助決策。

成本與性能優化策略

  • 通過預測性擴展降低計算成本。
  • 透過基於ML的分佈提升GPU利用率。
  • 平衡延遲、吞吐量與效率。

實踐場景與真實案例

  • 使用AI自動擴展高負載應用。
  • 優化異構節點池。
  • 將ML應用於多租戶環境。

總結與後續步驟

最低要求

  • 理解Kubernetes的基本概念。
  • 擁有容器化應用部署經驗。
  • 熟悉集群操作與資源管理。

受眾

  • 處理大型分佈式系統的SRE人員。
  • 管理高需求工作負載的Kubernetes運維人員。
  • 優化計算基礎設施的平台工程師。
 21 小時

客戶評論 (3)

課程分類