聯繫我們

課程簡介

Databricks平台與Lakehouse基礎

  • Databricks Lakehouse架構與組件
  • 組織工作區與目錄

Databricks工作區與筆記本

  • 工作區導航與基於筆記本的開發
  • 將代碼結構化為可復用的筆記本

Apache Spark架構與執行

  • Spark運行時架構與執行模型
  • 惰性求值與作業DAG

PySpark DataFrames與DataFrame API

  • DataFrame抽象與結構
  • 核心DataFrame操作與列表達式

將SQL轉換為PySpark DataFrames

  • 將核心SQL子句轉換為DataFrame操作
  • PySpark中的窗口函數與聚合

在Databricks中讀取與寫入數據

  • 從常見文件與數據庫源讀取
  • 在Lakehouse中寫入並分區數據

Delta Lake與表管理

  • Delta表與ACID事務
  • 時間旅行與結構演化

數據清洗與轉換模式

  • 數據清洗與類型轉換
  • 構建可復用的轉換邏輯

用戶定義函數與模塊化代碼

  • Python UDFs與pandas UDFs
  • 將過程式邏輯模塊化為函數

性能調優與優化

  • 分區與緩存策略
  • 使用Spark UI診斷瓶頸

結構化流基礎

  • 批處理與流處理模型
  • 流DataFrame與基本聚合

Databricks任務與工作流編排

  • 調度筆記本為任務與任務
  • 構建具有依賴關係的多步驟工作流

Unity Catalog與數據治理

  • Unity Catalog架構與命名空間
  • 訪問控制與數據血統

測試、調試與生產實踐

  • 對PySpark邏輯進行單元測試
  • 調試與代碼質量標準

端到端金融服務用例

  • 構建端到端銀行ETL流水線
  • 將傳統SQL流程轉換為PySpark

將SQL工作負載遷移至PySpark

  • 遷移策略與規劃模式
  • 將SQL工作流增量轉換為PySpark

最低要求

  • 具備Python編程經驗,包括函數和數據類型。
  • 了解SQL,包括聯接、聚合和子查詢。
  • 無需先前Databricks或PySpark的使用經驗。

受眾

  • 數據工程師、數據分析師及數據專業人士。
  • 將現有基於SQL的工作流遷移至Databricks和PySpark的團隊。
 35 小時

客戶評論 (1)

課程分類