聯繫我們

課程簡介

多模態AI導論

  • 何謂多模態AI?
  • 關鍵挑戰與應用場景
  • 領先多模態模型概覽

文字處理與自然語言理解

  • 運用大型語言模型(LLM)構建基於文字的AI代理
  • 理解多模態任務的提示工程(Prompt Engineering)
  • 針對領域特定應用微調文字模型

影像識別與生成

  • AI處理影像:分類、標題生成與物件偵測
  • 使用擴散模型(Stable Diffusion、DALLE)生成影像
  • 將影像數據整合至基於文字的模型中

語音與音訊處理

  • 使用Whisper ASR進行語音識別
  • 文字轉語音(TTS)合成技術
  • 強化基於語音的AI以改善用戶互動

整合多模態輸入

  • 構建處理多種輸入類型的AI管線
  • 融合技術:結合文字、影像與語音數據
  • 多模態AI代理的真實應用場景

部署多模態AI代理

  • 構建基於API的多模態AI解決方案
  • 優化模型效能與擴展性
  • 多模態AI生產環境部署的最佳實踐

倫理考量與未來趨勢

  • 多模態AI中的偏見與公平性問題
  • 多模態數據的隱私疑慮
  • 多模態AI的未來發展

總結與後續步驟

最低要求

  • 具備機器學習基礎知識
  • 擁有Python程式設計經驗
  • 熟悉深度學習框架(如TensorFlow、PyTorch)

受訓對象

  • AI開發人員
  • 研究人員
  • 多媒體工程師
 21 小時

課程分類