課程簡介
引言
理解大數據
Spark 概覽
Python 概覽
PySpark 概覽
- 利用彈性分散式資料集框架分配數據。
- 利用 Spark API 運算子分配計算任務。
設定 Python 與 Spark
設定 PySpark
使用 Amazon Web Services (AWS) EC2 實例進行 Spark
設定 Databricks
設定 AWS EMR 叢集
學習 Python 程式設計基礎
- Python 入門。
- 使用 Jupyter Notebook。
- 使用變數與簡單資料類型。
- 處理列表。
- 使用 if 條件陳述式。
- 接收使用者輸入。
- 處理 while 迴圈。
- 實作函式。
- 處理類別。
- 處理檔案與例外狀況。
- 處理專案、數據與 API。
學習 Spark DataFrame 基礎
- Spark DataFrames 入門。
- 實作 Spark 基本操作。
- 使用 Groupby 與聚合操作。
- 處理時間戳記與日期。
進行 Spark DataFrame 專案練習
理解透過 MLlib 的機器學習
透過 MLlib、Spark 和 Python 執行機器學習
理解迴歸分析
- 學習線性迴歸理論。
- 實作迴歸評估程式碼。
- 進行範例線性迴歸練習。
- 學習邏輯迴歸理論。
- 實作邏輯迴歸程式碼。
- 進行範例邏輯迴歸練習。
理解隨機森林與決策樹
- 學習樹狀方法理論。
- 實作決策樹與隨機森林程式碼。
- 進行範例隨機森林分類練習。
處理 K-means 聚類
- 理解 K-means 聚類理論。
- 實作 K-means 聚類程式碼。
- 進行範例聚類練習。
處理推薦系統
實作自然語言處理
- 理解自然語言處理 (NLP)。
- NLP 工具概覽。
- 進行範例 NLP 練習。
透過 Spark 進行 Python 串流處理
- Spark 串流處理概覽。
- Spark 串流處理範例練習。
總結致詞
最低要求
- 具備一般程式設計技能。
對象
- 開發人員。
- IT 專業人士。
- 數據科學家。
客戶評論 (6)
我喜歡它的實用性。非常喜歡將理論知識應用到實際例子中。
Aurelia-Adriana - Allianz Services Romania
課程 - Python and Spark for Big Data (PySpark)
機器翻譯
課程涉及一系列非常複雜的相關主題,Pablo對每個主題都有深入的專長。有時由於溝通或時間壓力,一些細微之處未能完全傳達,可能因此未能完全達到預期。此外,遇到了一些UHG/Azure Databricks的設置問題,但Pablo/UHG在問題顯現後迅速解決了這些問題——這讓我看到了UHG與Pablo之間的高度理解與專業素養。
Michael Monks - Tech NorthWest Skillnet
課程 - Python and Spark for Big Data (PySpark)
機器翻譯
個性化關注。
ARCHANA ANILKUMAR - PPL
課程 - Python and Spark for Big Data (PySpark)
機器翻譯
實踐培訓。
Abraham Thomas - PPL
課程 - Python and Spark for Big Data (PySpark)
機器翻譯
課程在Jupyter notebook中進行。主題按照邏輯順序編排,自然地幫助課程從較簡單的部分過渡到更復雜的內容。我已是Python的高級用戶,並有機器學習背景,因此發現這門課程比可能參加培訓的一些同學更容易跟上。我很欣賞跳過了一些最基本的概念,而專注於最重要的內容。
Angela DeLaMora - ADT, LLC
課程 - Python and Spark for Big Data (PySpark)
機器翻譯
實踐任務
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
課程 - Python and Spark for Big Data (PySpark)
機器翻譯