感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 35 時間:
課程簡介
簡介、目標和遷移策略
- 課程目標、參與者檔案對齊和成功標準
- 高層遷移方法和風險考量
- 設置工作區、存儲庫和實驗室數據集
第一日 — 遷移基礎和架構
- 湖倉概念、Delta Lake 概述和 Databricks 架構
- SMP 與 MPP 的差異及其對遷移的影響
- Medallion(銅層→銀層→金層)設計和 Unity Catalog 概述
第一日實驗室 — 轉換一個儲存程序
- 將一個示例儲存程序遷移到筆記本的實操
- 將臨時表和游標映射到 DataFrame 轉換
- 與原始輸出進行驗證和比較
第二日 — 高級 Delta Lake 和增量載入
- ACID 事務、提交日誌、版本控制和時間旅行
- Auto Loader、MERGE INTO 模式、UPSERT 和模式演進
- OPTIMIZE、VACUUM、Z-ORDER、分區和存儲調優
第二日實驗室 — 增量攝取和優化
- 實現 Auto Loader 攝取和 MERGE 工作流程
- 應用 OPTIMIZE、Z-ORDER 和 VACUUM;驗證結果
- 測量讀取/寫入性能改進
第三日 — Databricks 中的 SQL、性能和調試
- 分析型 SQL 功能:窗口函數、高階函數、JSON/數組處理
- 閱讀 Spark UI、DAG、Shuffles、階段、任務和瓶頸診斷
- 查詢調優模式:廣播連接、提示、緩存和減少溢寫
第三日實驗室 — SQL 重構和性能調優
- 將一個重 SQL 過程重構為優化的 Spark SQL
- 使用 Spark UI 追蹤識別和修復偏斜和 Shuffle 問題
- 基準測試前後並記錄調優步驟
第四日 — 戰術型 PySpark:替代程式化邏輯
- Spark 執行模型:驅動程序、執行器、延遲評估和分區策略
- 將循環和游標轉化為向量化 DataFrame 操作
- 模塊化、UDF/pandas UDF、小工具和可重用庫
第四日實驗室 — 重構程式化腳本
- 將一個程式化 ETL 腳本重構為模塊化 PySpark 筆記本
- 引入參數化、單元測試風格和可重用函數
- 代碼審查和應用最佳實踐檢查清單
第五日 — 編排、端到端管道和最佳實踐
- Databricks 工作流程:作業設計、任務依賴、觸發器和錯誤處理
- 設計具有質量規則和模式驗證的增量 Medallion 管道
- 與 Git(GitHub/Azure DevOps)、CI 和 PySpark 邏輯測試策略的集成
第五日實驗室 — 構建完整的端到端管道
- 組裝由 Workflows 編排的銅層→銀層→金層管道
- 實現日誌記錄、審計、重試和自動驗證
- 運行完整管道,驗證輸出並準備部署說明
運營化、治理和生产準備
- Unity Catalog 治理、血緣和訪問控制最佳實踐
- 成本、集群大小、自動縮放和作業並發模式
- 部署檢查清單、回滾策略和運行手冊創建
最終審查、知識轉移和下一步
- 參與者展示遷移工作和經驗教訓
- 差距分析、建議的後續活動和培訓材料移交
- 參考文獻、進一步學習路徑和支援選項
最低要求
- 理解數據工程概念
- 具有 SQL 和儲存程序經驗(Synapse / SQL Server)
- 熟悉 ETL 編排概念(ADF 或類似工具)
受眾
- 具有數據工程背景的技術管理人員
- 將程式化 OLAP 邏輯轉化為湖倉模式的數據工程師
- 負責 Databricks 採納的平台工程師