聯繫我們

課程簡介

詳細培訓大綱

  1. NLP 簡介
    • 理解 NLP
    • NLP 框架
    • NLP 的商業應用
    • 從網路爬取數據
    • 使用各種 API 獲取文本數據
    • 處理並儲存文本語料庫,保存內容及相關元數據
    • 使用 Python 和 NLTK 的優勢及速成課程
  2. 語料庫與數據集的實用理解
    • 為何需要語料庫?
    • 語料庫分析
    • 數據屬性類型
    • 語料庫的不同文件格式
    • 為 NLP 應用準備數據集
  3. 理解句子結構
    • NLP 組件
    • 自然語言理解
    • 形態分析:詞幹、詞、標記、詞性標籤
    • 句法分析
    • 語義分析
    • 處理歧義
  4. 文本數據預處理
    • 語料庫 - 原始文本
      • 句子標記化
      • 原始文本的詞幹提取
      • 原始文本的字形還原
      • 停用詞移除
    • 語料庫 - 原始句子
      • 單詞標記化
      • 單詞字形還原
    • 處理詞項-文檔/文檔-詞項矩陣
    • 將文本標記化為 n-grams 與句子
    • 實用且自訂的預處理
  5. 文本數據分析
    • NLP 的基本特徵
      • 解析器與解析
      • 詞性標記與標記器
      • 命名實體識別
      • n-grams
      • 詞袋模型
    • NLP 的統計特徵
      • NLP 中的線性代數概念
      • NLP 的概率理論
      • TF-IDF
      • 向量化
      • 編碼器與解碼器
      • 正規化
      • 概率模型
    • 高級特徵工程與 NLP
      • word2vec 基礎
      • word2vec 模型組件
      • word2vec 模型的邏輯
      • word2vec 概念的擴展
      • word2vec 模型的應用
    • 案例研究:詞袋應用的自動文本摘要,使用簡化及真實的 Luhn 演算法
  6. 文檔聚類、分類與主題建模
    • 文檔聚類與模式挖掘(層次聚類、k-means 聚類等)
    • 使用 TFIDF、Jaccard 和餘弦距離度量比較與分類文檔
    • 使用樸素貝葉斯與最大熵進行文檔分類
  7. 識別重要文本元素
    • 降維:主成分分析、奇異值分解、非負矩陣因式分解
    • 使用潛在語義分析進行主題建模與資訊檢索
  8. 實體提取、情感分析與高級主題建模
    • 正面 vs 負面:情感程度
    • 項目反應理論
    • 詞性標記及其應用:找出文本中提到的人物、地點與組織
    • 高級主題建模:潛在狄利克雷分配
  9. 案例研究
    • 挖掘非結構化用戶評論
    • 產品評論數據的情感分類與可視化
    • 挖掘搜尋日誌以獲取使用模式
    • 文本分類
    • 主題建模

最低要求

具備 NLP 原理的知識與認知,並了解人工智慧在商業中的應用價值

 21 小時

客戶評論 (1)

課程分類