聯繫我們
 課程時長 35 時間:

課程簡介

簡介、目標和遷移策略

  • 課程目標、參與者檔案對齊和成功標準
  • 高層遷移方法和風險考量
  • 設置工作區、存儲庫和實驗室數據集

第一日 — 遷移基礎和架構

  • 湖倉概念、Delta Lake 概述和 Databricks 架構
  • SMP 與 MPP 的差異及其對遷移的影響
  • Medallion(銅層→銀層→金層)設計和 Unity Catalog 概述

第一日實驗室 — 轉換一個儲存程序

  • 將一個示例儲存程序遷移到筆記本的實操
  • 將臨時表和游標映射到 DataFrame 轉換
  • 與原始輸出進行驗證和比較

第二日 — 高級 Delta Lake 和增量載入

  • ACID 事務、提交日誌、版本控制和時間旅行
  • Auto Loader、MERGE INTO 模式、UPSERT 和模式演進
  • OPTIMIZE、VACUUM、Z-ORDER、分區和存儲調優

第二日實驗室 — 增量攝取和優化

  • 實現 Auto Loader 攝取和 MERGE 工作流程
  • 應用 OPTIMIZE、Z-ORDER 和 VACUUM;驗證結果
  • 測量讀取/寫入性能改進

第三日 — Databricks 中的 SQL、性能和調試

  • 分析型 SQL 功能:窗口函數、高階函數、JSON/數組處理
  • 閱讀 Spark UI、DAG、Shuffles、階段、任務和瓶頸診斷
  • 查詢調優模式:廣播連接、提示、緩存和減少溢寫

第三日實驗室 — SQL 重構和性能調優

  • 將一個重 SQL 過程重構為優化的 Spark SQL
  • 使用 Spark UI 追蹤識別和修復偏斜和 Shuffle 問題
  • 基準測試前後並記錄調優步驟

第四日 — 戰術型 PySpark:替代程式化邏輯

  • Spark 執行模型:驅動程序、執行器、延遲評估和分區策略
  • 將循環和游標轉化為向量化 DataFrame 操作
  • 模塊化、UDF/pandas UDF、小工具和可重用庫

第四日實驗室 — 重構程式化腳本

  • 將一個程式化 ETL 腳本重構為模塊化 PySpark 筆記本
  • 引入參數化、單元測試風格和可重用函數
  • 代碼審查和應用最佳實踐檢查清單

第五日 — 編排、端到端管道和最佳實踐

  • Databricks 工作流程:作業設計、任務依賴、觸發器和錯誤處理
  • 設計具有質量規則和模式驗證的增量 Medallion 管道
  • 與 Git(GitHub/Azure DevOps)、CI 和 PySpark 邏輯測試策略的集成

第五日實驗室 — 構建完整的端到端管道

  • 組裝由 Workflows 編排的銅層→銀層→金層管道
  • 實現日誌記錄、審計、重試和自動驗證
  • 運行完整管道,驗證輸出並準備部署說明

運營化、治理和生产準備

  • Unity Catalog 治理、血緣和訪問控制最佳實踐
  • 成本、集群大小、自動縮放和作業並發模式
  • 部署檢查清單、回滾策略和運行手冊創建

最終審查、知識轉移和下一步

  • 參與者展示遷移工作和經驗教訓
  • 差距分析、建議的後續活動和培訓材料移交
  • 參考文獻、進一步學習路徑和支援選項

最低要求

  • 理解數據工程概念
  • 具有 SQL 和儲存程序經驗(Synapse / SQL Server)
  • 熟悉 ETL 編排概念(ADF 或類似工具)

受眾

  • 具有數據工程背景的技術管理人員
  • 將程式化 OLAP 邏輯轉化為湖倉模式的數據工程師
  • 負責 Databricks 採納的平台工程師

課程分類