感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
PySpark 與機器學習
模塊 1:大數據與 Spark 基礎
- 大數據生態系統概覽及 Spark 在現代數據平台中的角色
- 理解 Spark 架構:驅動程序、執行者、集群管理器、惰性求值、DAG 及執行計劃
- RDD 與 DataFrame API 之間的差異及使用時機
- 創建和配置 SparkSession,理解應用程序配置的基本原理
模塊 2:PySpark DataFrames
- 從企業源和格式(CSV、JSON、Parquet、Delta)讀取和寫入數據
- 使用 PySpark DataFrames:轉換、操作、列表達式、過濾、連接和聚合
- 實施高級操作,如窗口函數、處理時間戳記和處理嵌套數據
- 應用數據質量檢查,編寫可重用且易於維護的 PySpark 代碼
模塊 3:高效處理大型數據集
- 理解性能基礎知識:分區策略、洗牌行為、緩存和持久化
- 使用優化技術,包括廣播連接和執行計劃分析
- 高效處理大型數據集及可擴展數據工作流的最佳實踐
- 理解架構演變及企業環境中使用的現代存儲格式
模塊 4:大規模特徵工程
- 使用 Spark MLlib 進行特徵工程:處理缺失值、對分類變量進行編碼及特徵縮放
- 設計可重用的預處理步驟,為機器學習管道準備數據集
- 入門級特徵選擇及處理不平衡數據集
模塊 5:使用 Spark MLlib 進行機器學習
- 理解 MLlib 架構及 Estimator/Transformer 模式
- 大規模訓練回歸和分類模型(線性回歸、邏輯回歸、決策樹、隨機森林)
- 在分布式機器學習工作流程中比較模型並解釋結果
模塊 6:端到端 ML 管道
- 構建結合預處理、特徵工程和建模的端到端機器學習管道
- 應用訓練/驗證/測試分割策略
- 使用網格搜索和隨機搜索進行交叉驗證及超參數調優
- 結構化可復現的機器學習實驗
模塊 7:模型評估與實際 ML 決策
- 應用適用的回歸和分類問題評估指標
- 識別過度擬合和欠擬合,並做出實際的模型選擇決策
- 解釋特徵重要性並理解模型行為
模塊 8:生產與企業實踐
- 在 Spark 中持久化和加載模型
- 實施大型數據集上的批量推理工作流
- 理解企業環境中的機器學習生命週期
- 入門級版本控制、實驗跟蹤概念及基本測試策略
實踐成果
- 能夠獨立使用 PySpark
- 能夠高效處理大型數據集
- 能夠在大規模下進行特徵工程
- 能夠構建可擴展的機器學習管道
最低要求
參與者应具备以下背景知識:
Python 編程基礎,包括使用函數、數據結構和庫;
對數據分析概念的基礎理解,如數據集、轉換和聚合;
SQL 及關聯式數據概念的基礎知識;
對機器學習概念的入門級理解,如訓練數據集、特徵和評估指標;
建議熟悉命令列環境和基本軟件開發實踐。
具有 Pandas、NumPy 或類似數據處理庫的經驗將有所幫助,但非必需。
21 小時
客戶評論 (1)
我喜歡它的實用性。非常喜歡將理論知識應用到實際例子中。
Aurelia-Adriana - Allianz Services Romania
課程 - Python and Spark for Big Data (PySpark)
機器翻譯