聯繫我們

課程簡介

Kafka 管理基礎

  • Kafka 在現代數據平台中的定位及典型生產責任
  • 運維人員的核心概念:Broker、主題、分區、偏移量、消費者組
  • 複製基礎:Leader 和 Follower,ISR,可用性權衡
  • Kafka 操作亮點及運行手冊中常用的術語

KRaft 模式與叢集設計

  • KRaft 基礎:Controller、元數據法定人數、選舉及其對運維的重要性
  • 部署規劃:為吞吐量、分區、保留策略和增長進行規模調整
  • 節點角色與佈局:合併式與專用 Controller,故障域考量
  • 實驗:檢查 KRaft 元數據,驗證法定人數健康狀況,並解讀 Controller 日誌

安裝、配置與日常運維

  • 安裝方法(包管理器、tarball、容器)以及在企業環境中標準化的重點
  • 影響可靠性的核心 Broker 配置:Listeners、複製、日誌目錄、保留策略
  • 安全的服務操作:啟動順序、優雅關閉以及驗證檢查
  • 實驗:部署多節點叢集,驗證 Broker 註冊,並確認基本的生產和消費功能

管理主題、分區與數據放置

  • 使用 Kafka CLI 的主題生命週期:創建、描述、更新配置、刪除
  • 為真實工作負載選擇分區數和複製因子,包括常見的錯誤模式
  • 重新分配與平衡:何時移動分區以及如何安全地驗證進度
  • 實驗:創建主題,觸發分區重新分配,模擬 Broker 故障,並確認恢復情況

Kafka 生產安全加固

  • TLS 用於客戶端和 Broker 間通信:證書、信任鏈和驗證步驟
  • SASL 認證:選擇常見的機制並避免配置錯誤
  • ACL 授權:針對管理員、生產者和消費者的最小權限模式
  • 實驗:啟用 TLS 和 SASL,驗證客戶端連接,並為應用角色應用 ACLs

可觀測性、可靠性與故障排除

  • 監控基礎:Controller 健康狀況、副本不足的 partitions、請求延遲、磁盤和網絡飽和度
  • 日誌與指標:解讀 Broker 日誌,並通過 JMX exporter 將指標暴露給常見的可觀測性堆棧
  • 運維手冊:滾動重啟、安全的配置更改、處理磁盤滿和 ISR 問題
  • 實驗:構建最小警報集,診斷退化叢集,並恢復健康的複製狀態

升級與災難準備

  • Kafka 升級規劃:兼容性檢查、階段性部署及回滾方案
  • 備份與恢復預期:可備份的內容、不可備份的內容以及配置恢復基礎
  • 跨叢集複製概述,以及在 DR 和遷移中使用 MirrorMaker 2 的時機
  • 總結:運維檢查清單、交接文檔及生產部署的後續步驟

最低要求

  • 了解基本的 Linux 管理(用戶、服務、文件、權限)
  • 具備 TCP/IP 網絡概念的經驗(DNS、端口、防火牆、負載平衡器)
  • 具備基本的腳本編程經驗(Bash、PowerShell 或類似),用於日常運維任務

目標受眾

  • Kafka 管理員和平台工程師,負責運行 Kafka 叢集
  • 支持流數據平台的 Site Reliability Engineer (SRE) 和 DevOps 工程師
  • 正在部署新的基於 KRaft 的 Kafka 叢集或從 ZooKeeper 遷移的基礎設施和運維團隊
 21 小時

客戶評論 (5)

課程分類