感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
多模態AI導論
- 何謂多模態AI?
- 關鍵挑戰與應用場景
- 領先多模態模型概覽
文字處理與自然語言理解
- 運用大型語言模型(LLM)構建基於文字的AI代理
- 理解多模態任務的提示工程(Prompt Engineering)
- 針對領域特定應用微調文字模型
影像識別與生成
- AI處理影像:分類、標題生成與物件偵測
- 使用擴散模型(Stable Diffusion、DALLE)生成影像
- 將影像數據整合至基於文字的模型中
語音與音訊處理
- 使用Whisper ASR進行語音識別
- 文字轉語音(TTS)合成技術
- 強化基於語音的AI以改善用戶互動
整合多模態輸入
- 構建處理多種輸入類型的AI管線
- 融合技術:結合文字、影像與語音數據
- 多模態AI代理的真實應用場景
部署多模態AI代理
- 構建基於API的多模態AI解決方案
- 優化模型效能與擴展性
- 多模態AI生產環境部署的最佳實踐
倫理考量與未來趨勢
- 多模態AI中的偏見與公平性問題
- 多模態數據的隱私疑慮
- 多模態AI的未來發展
總結與後續步驟
最低要求
- 具備機器學習基礎知識
- 擁有Python程式設計經驗
- 熟悉深度學習框架(如TensorFlow、PyTorch)
受訓對象
- AI開發人員
- 研究人員
- 多媒體工程師
21 小時