感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
Databricks平台與Lakehouse基礎
- Databricks Lakehouse架構與組件
- 組織工作區與目錄
Databricks工作區與筆記本
- 工作區導航與基於筆記本的開發
- 將代碼結構化為可復用的筆記本
Apache Spark架構與執行
- Spark運行時架構與執行模型
- 惰性求值與作業DAG
PySpark DataFrames與DataFrame API
- DataFrame抽象與結構
- 核心DataFrame操作與列表達式
將SQL轉換為PySpark DataFrames
- 將核心SQL子句轉換為DataFrame操作
- PySpark中的窗口函數與聚合
在Databricks中讀取與寫入數據
- 從常見文件與數據庫源讀取
- 在Lakehouse中寫入並分區數據
Delta Lake與表管理
- Delta表與ACID事務
- 時間旅行與結構演化
數據清洗與轉換模式
- 數據清洗與類型轉換
- 構建可復用的轉換邏輯
用戶定義函數與模塊化代碼
- Python UDFs與pandas UDFs
- 將過程式邏輯模塊化為函數
性能調優與優化
- 分區與緩存策略
- 使用Spark UI診斷瓶頸
結構化流基礎
- 批處理與流處理模型
- 流DataFrame與基本聚合
Databricks任務與工作流編排
- 調度筆記本為任務與任務
- 構建具有依賴關係的多步驟工作流
Unity Catalog與數據治理
- Unity Catalog架構與命名空間
- 訪問控制與數據血統
測試、調試與生產實踐
- 對PySpark邏輯進行單元測試
- 調試與代碼質量標準
端到端金融服務用例
- 構建端到端銀行ETL流水線
- 將傳統SQL流程轉換為PySpark
將SQL工作負載遷移至PySpark
- 遷移策略與規劃模式
- 將SQL工作流增量轉換為PySpark
最低要求
- 具備Python編程經驗,包括函數和數據類型。
- 了解SQL,包括聯接、聚合和子查詢。
- 無需先前Databricks或PySpark的使用經驗。
受眾
- 數據工程師、數據分析師及數據專業人士。
- 將現有基於SQL的工作流遷移至Databricks和PySpark的團隊。
35 小時
客戶評論 (1)
我喜歡它的實用性。非常喜歡將理論知識應用到實際例子中。
Aurelia-Adriana - Allianz Services Romania
課程 - Python and Spark for Big Data (PySpark)
機器翻譯