聯繫我們

課程簡介

視覺語言模型介紹

  • VLM 及其在多模態 AI 中的角色概述
  • 流行架構:CLIP、Flamingo、BLIP 等
  • 用例:檢索、標題生成、自主系統、內容分析

準備微調環境

  • 設置 OpenCLIP 及其他 VLM 庫
  • 圖像-文本對的數據集格式
  • 視覺和語言輸入的預處理流水線

微調 CLIP 及類似模型

  • 對比損失與聯合嵌入空間
  • 實戰:在自定義數據集上微調 CLIP
  • 處理領域特定和多語言數據

高級微調技術

  • 使用 LoRA 和基於適配器的方法提高效率
  • 提示調優與視覺提示注入
  • 零樣本與微調評估的權衡

評估與基準測試

  • VLM 指標:檢索準確率、BLEU、CIDEr、召回率
  • 視覺-文本對齊診斷
  • 可視化嵌入空間與錯誤分類

部署與實際應用

  • 導出模型以進行推理(TorchScript、ONNX)
  • 將 VLM 集成到流水線或 API 中
  • 資源考量與模型擴展

案例研究與應用場景

  • 媒體分析與內容審核
  • 電子商務和數字庫中的檢索
  • 機器人與自主系統中的多模態交互

總結與後續步驟

最低要求

  • 理解視覺和自然語言處理的深度學習
  • 具備 PyTorch 和基於轉換器的模型經驗
  • 熟悉多模態模型架構

受眾

  • 計算機視覺工程師
  • AI 開發者
 14 小時

課程分類