聯繫我們

課程簡介

AI 增強的 Kubernetes 操作簡介

  • AI 對現代集群運營的重要性
  • 傳統擴縮和排程邏輯的局限性
  • 機器學習在資源管理中的核心概念

Kubernetes 資源管理基礎

  • CPU、GPU 和內存分配的基礎知識
  • 理解配額、限制和請求
  • 識別瓶頸和低效環節

用於排程的機器學習方法

  • 用於工作負載放置的監督式和無監督式模型
  • 資源需求的預測算法
  • 在自定義調度器中應用 ML 特徵

用於智能自動擴縮的強化學習

  • RL 代理如何從集群行為中學習
  • 設計提升效率的獎勵函數
  • 構建基於 RL 的自動擴縮策略

基於指標和遙測的預測性自動擴縮

  • 使用 Prometheus 數據進行預測
  • 將時間序列模型應用於自動擴縮
  • 評估預測準確性並調整模型

實施 AI 驅動的優化工具

  • 將 ML 框架與 Kubernetes 控制器集成
  • 部署智能控制循環
  • 擴展 KEDA 以實現 AI 輔助決策

成本和性能優化策略

  • 通過預測性擴縮降低計算成本
  • 利用 ML 驅動的放置提高 GPU 利用率
  • 平衡延遲、吞吐量和效率

實際場景和真實世界應用案例

  • 使用 AI 對高負載應用程式進行自動擴縮
  • 優化異構節點池
  • 在多租戶環境中應用 ML

總結與後續步驟

最低要求

  • 理解 Kubernetes 基礎知識
  • 具備容器化應用程式部署經驗
  • 熟悉集群操作和資源管理

受眾對象

  • 處理大規模分佈式系統的 SRE(網站可靠性工程師)
  • 管理高需求工作負載的 Kubernetes 運維人員
  • 優化計算基礎設施的平台工程師
 21 小時

客戶評論 (4)

課程分類