聯繫我們

課程簡介

Mistral 多模態模型介紹

  • Mistral Medium 及多模態能力概述。
  • OCR/文件模型及用例。
  • 與開源生態系統集成。

OCR 與視覺流水線

  • Mistral 模型的 OCR 基礎知識。
  • 圖像和掃描文件的預處理。
  • 從圖像中提取結構化文本。

文件理解

  • 為文件設計 NLP 流水線。
  • 實體識別、摘要生成與分類。
  • 文本與視覺數據的跨模態鏈接。

搜索與知識應用

  • 視覺-文本搜索系統。
  • 基於 OCR 輸出構建語義搜索。
  • 企業文件存儲庫。

輔助與交互應用

  • 多模態助手的 UI 設計。
  • 輔助應用(例如:視覺轉文本)。
  • 實用生產力工具。

性能與優化

  • 擴展多模態流水線。
  • 推理性能調優。
  • 評估準確性與效率的權衡。

案例研究與未來方向

  • 多模態 AI 的行業應用。
  • OCR 和文件 AI 的研究趨勢。
  • 視覺-文本任務中的負責任 AI 考量。

總結與下一步

最低要求

  • 理解自然語言處理概念。
  • 具備 Python 和 ML 框架使用經驗。
  • 熟悉計算機視覺基礎知識。

受眾對象

  • 產品團隊。
  • ML 研究人員。
  • 應用 ML 工程師。
 14 小時

課程分類