聯繫我們
 課程時長 21 時間:

課程簡介

多模態 AI 與 Ollama 簡介

  • 多模態學習概述
  • 視覺與語言整合的關鍵挑戰
  • Ollama 的功能與架構

設置 Ollama 環境

  • 安裝與配置 Ollama
  • 本地模型部署實務
  • Ollama 與 Python 及 Jupyter 的整合

處理多模態輸入

  • 文本與圖像的整合
  • 納入音頻及結構化數據
  • 設計預處理管線

文件理解應用

  • 從 PDF 和圖像中提取結構化信息
  • OCR 與語言模型的結合
  • 構建智能文件分析工作流

視覺問答(VQA)

  • 設置 VQA 數據集與基準測試
  • 訓練與評估多模態模型
  • 構建交互式 VQA 應用

設計多模態智能體

  • 基於多模態推理的智能體設計原則
  • 感知、語言與行動的結合
  • 面向實際應用場景的智能體部署

高級整合與優化

  • 使用 Ollama 微調多模態模型
  • 優化推理性能
  • 擴展性與部署考量

總結與後續步驟

最低要求

  • 深入理解機器學習概念
  • 具備使用 PyTorch 或 TensorFlow 等深度學習框架的經驗
  • 熟悉自然語言處理及計算機視覺技術

目標受眾

  • 機器學習工程師
  • AI 研究員
  • 整合視覺與文本工作流的產品開發者

課程分類