聯繫我們

課程簡介

PySpark 與機器學習

模塊 1:大數據與 Spark 基礎

  • 大數據生態系統概覽及 Spark 在現代數據平台中的角色
  • 理解 Spark 架構:驅動程序、執行者、集群管理器、惰性求值、DAG 及執行計劃
  • RDD 與 DataFrame API 之間的差異及使用時機
  • 創建和配置 SparkSession,理解應用程序配置的基本原理

模塊 2:PySpark DataFrames

  • 從企業源和格式(CSV、JSON、Parquet、Delta)讀取和寫入數據
  • 使用 PySpark DataFrames:轉換、操作、列表達式、過濾、連接和聚合
  • 實施高級操作,如窗口函數、處理時間戳記和處理嵌套數據
  • 應用數據質量檢查,編寫可重用且易於維護的 PySpark 代碼

模塊 3:高效處理大型數據集

  • 理解性能基礎知識:分區策略、洗牌行為、緩存和持久化
  • 使用優化技術,包括廣播連接和執行計劃分析
  • 高效處理大型數據集及可擴展數據工作流的最佳實踐
  • 理解架構演變及企業環境中使用的現代存儲格式

模塊 4:大規模特徵工程

  • 使用 Spark MLlib 進行特徵工程:處理缺失值、對分類變量進行編碼及特徵縮放
  • 設計可重用的預處理步驟,為機器學習管道準備數據集
  • 入門級特徵選擇及處理不平衡數據集

模塊 5:使用 Spark MLlib 進行機器學習

  • 理解 MLlib 架構及 Estimator/Transformer 模式
  • 大規模訓練回歸和分類模型(線性回歸、邏輯回歸、決策樹、隨機森林)
  • 在分布式機器學習工作流程中比較模型並解釋結果

模塊 6:端到端 ML 管道

  • 構建結合預處理、特徵工程和建模的端到端機器學習管道
  • 應用訓練/驗證/測試分割策略
  • 使用網格搜索和隨機搜索進行交叉驗證及超參數調優
  • 結構化可復現的機器學習實驗

模塊 7:模型評估與實際 ML 決策

  • 應用適用的回歸和分類問題評估指標
  • 識別過度擬合和欠擬合,並做出實際的模型選擇決策
  • 解釋特徵重要性並理解模型行為

模塊 8:生產與企業實踐

  • 在 Spark 中持久化和加載模型
  • 實施大型數據集上的批量推理工作流
  • 理解企業環境中的機器學習生命週期
  • 入門級版本控制、實驗跟蹤概念及基本測試策略

 

實踐成果

  • 能夠獨立使用 PySpark
  • 能夠高效處理大型數據集
  • 能夠在大規模下進行特徵工程
  • 能夠構建可擴展的機器學習管道

最低要求

參與者应具备以下背景知識:

Python 編程基礎,包括使用函數、數據結構和庫;
對數據分析概念的基礎理解,如數據集、轉換和聚合;
SQL 及關聯式數據概念的基礎知識;
對機器學習概念的入門級理解,如訓練數據集、特徵和評估指標;
建議熟悉命令列環境和基本軟件開發實踐。

具有 Pandas、NumPy 或類似數據處理庫的經驗將有所幫助,但非必需。

 21 小時

客戶評論 (1)

課程分類