聯繫我們

課程簡介

語音識別技術概覽

  • 語音識別的歷史與演進
  • 聲學模型、語言模型與解碼技術
  • 現代架構:RNN、Transformer及Whisper

音訊預處理與轉寫基礎

  • 處理音訊格式及採樣率
  • 音訊的清理、修剪與分段
  • 從音訊生成文字:實時與批量處理

Whisper及其他API的實作

  • 安裝與使用OpenAI Whisper
  • 呼叫雲端API(如Google、Azure)進行轉寫
  • 比較效能、延遲與成本

語言、口音與領域適應性

  • 處理多種語言及口音
  • 自定義詞彙庫與噪聲容忍度
  • 處理法律、醫療或技術語言

輸出格式與整合

  • 添加時間戳記、標點符號及說話者標籤
  • 匯出為文字、SRT或JSON格式
  • 將轉寫內容整合至應用程式或資料庫

應用案例實作實驗室

  • 轉寫會議、訪談或 Podcast(網播)
  • 語音轉文字指令系統
  • 為視頻/音訊串流提供實時字幕

評估、局限性與倫理

  • 準確性指標與模型基準測試
  • 語音模型中的偏見與公平性
  • 隱私保護與合規性考量

總結與下一步驟

最低要求

  • 具備一般AI及機器學習概念的認知
  • 熟悉音訊或媒體檔案格式及相關工具

目標受眾

  • 處理語音數據的數據科學家及AI工程師
  • 開發基於轉寫功能應用程式的軟體開發者
  • 探索語音識別以實現自動化的機構或組織
 14 小時

課程分類