聯繫我們
 課程時長 21 時間: (3 天)

課程簡介

音訊分類基礎

  • 聲音事件類型:環境聲、機械聲、人聲
  • 應用場景概覽:監控、監測、自動化
  • 音訊分類、偵測與分段之區別

音訊數據與特徵提取

  • 音訊檔案類型與格式
  • 取樣率、加窗與幀大小考量
  • 提取 MFCC、色度特徵及梅爾頻譜圖

數據準備與標註

  • UrbanSound8K、ESC-50 及自定義數據集
  • 標註聲音事件及時間邊界
  • 數據集平衡與音訊增強

構建音訊分類模型

  • 使用卷積神經網路(CNN)進行音訊處理
  • 模型輸入:原始波形 vs 特徵
  • 損失函數、評估指標及過擬合問題

事件偵測與時間定位

  • 基於幀與基於片段的偵測策略
  • 使用閾值和平滑技術對偵測結果進行後處理
  • 在音訊時間軸上視覺化預測結果

進階主題與實時處理

  • 低數據場景下的遷移學習
  • 使用 TensorFlow Lite 或 ONNX 部署模型
  • 串流音訊處理與延遲考量

項目開發與應用場景

  • 設計完整管線:從數據攝取到分類
  • 為監控、質量控制或監測開發概念驗證(PoC)
  • 日誌記錄、告警及與儀表板或 API 的整合

總結與後續步驟

最低要求

  • 了解機器學習概念及模型訓練
  • 具備 Python 編程及數據預處理經驗
  • 熟悉數位音訊基礎知識

目標學員

  • 數據科學家
  • 機器學習工程師
  • 音訊訊號處理領域的研究員與開發者

課程分類