聯繫我們

課程簡介

介紹

本節提供「機器學習」適用時機的一般性介紹,探討應考慮的因素及其含義,包括優點與缺點。數據類型(結構化/非結構化/靜態/流式)、數據有效性/量、數據驅動與用戶驅動分析、統計模型與機器學習模型的對比、無監督學習的挑戰、偏差-方差权衡、迭代/評估、交叉驗證方法以及監督式/無監督式/強化式學習。

主要主題

1. 理解朴素貝葉斯

  • 貝葉斯方法的基礎概念
  • 概率論
  • 聯合概率
  • 基於貝葉斯定理的條件概率
  • 朴素貝葉斯演算法
  • 朴素貝葉斯分類
  • 拉普拉斯估計器
  • 在朴素貝葉斯中使用數值特徵

2. 理解決策樹

  • 分而治之
  • C5.0 決策樹演算法
  • 選擇最佳分裂點
  • 剪枝決策樹

3. 理解神經網絡

  • 從生物神經元到人工神經元
  • 激活函數
  • 網絡拓撲結構
  • 層數
  • 信息流動方向
  • 各層的神經元數量
  • 使用反向傳播訓練神經網絡
  • 深度學習

4. 理解支持向量機

  • 使用超平面進行分類
  • 尋找最大邊距
  • 線性可分數據的情況
  • 非線性可分數據的情況
  • 使用核函數處理非線性空間

5. 理解聚類

  • 聚類作為機器學習任務
  • k-means 聚類演算法
  • 使用距離分配和更新聚類
  • 選擇合適的聚類數量

6. 測量分類性能

  • 處理分類預測數據
  • 詳細檢視混淆矩陣
  • 利用混淆矩陣測量性能
  • 超越準確率——其他性能指標
  • Kappa 統計量
  • 靈敏度與特異性
  • 精確率與召回率
  • F-measure
  • 可視化性能权衡
  • ROC 曲線
  • 估算未來性能
  • 留一法(Holdout method)
  • 交叉驗證
  • 自助抽樣法

7. 調參基礎模型以提升性能

  • 使用 caret 進行自動參數調優
  • 構建簡單的調優模型
  • 自定義調優過程
  • 利用元學習提升模型性能
  • 理解集成學習
  • Bagging
  • Boosting
  • 隨機森林
  • 訓練隨機森林
  • 評估隨機森林性能

次要主題

8. 理解基於最近鄰的分類

  • kNN 演算法
  • 計算距離
  • 選擇合適的 k 值
  • 為使用 kNN 準備數據
  • 為什麼 kNN 演算法是懶惰的?

9. 理解分類規則

  • 各自為政(Separate and conquer)
  • One Rule 演算法
  • RIPPER 演算法
  • 從決策樹生成規則

10. 理解回歸分析

  • 簡單線性回歸
  • 普通最小二乘法估計
  • 相關性分析
  • 多元線性回歸

11. 理解回歸樹與模型樹

  • 在樹中加入回歸功能

12. 理解關聯規則

  • 用於關聯規則學習的 Apriori 演算法
  • 測量規則興趣度——支持度與置信度
  • 基於 Apriori 原理構建規則集

額外內容

  • Spark/PySpark/MLlib 及多臂老虎機(Multi-armed bandits)

最低要求

Python 知識

 21 小時

客戶評論 (7)

課程分類