聯繫我們
 課程時長 14 時間:

課程簡介

Gemini 3 多模態入門

  • 文字、圖像、音頻和影片的功能
  • 模型選擇和端點概覽
  • 多模態推斷的關鍵概念

處理文字和結構化輸入

  • 文字生成的提示詞策略
  • 元數據、上下文窗口和嵌入
  • 基於文字的多模態任務編排

圖像理解與視覺工作流程

  • 使用 Gemini 3 進行圖像分析和解釋
  • 創建視覺搜索和標記工具
  • 構建圖像到文字和文字到圖像的交互

音頻輸入處理

  • 語音識別和轉錄工作流程
  • 音頻事件檢測和解釋
  • 將音頻與文字和視覺輸入整合

影片智能與場景分析

  • 逐幀和連續影片推斷
  • 構建摘要和高光提取工具
  • 基於影片的自動化與內容工作流程

設計多模態應用架構

  • 在單一管道中結合多種輸入類型
  • 延遲、成本和計算考量
  • 可擴展多模態系統的最佳實踐

原型化多模態應用

  • 動手創建多模態原型
  • 通過提示詞工程進行快速迭代
  • 測試和優化用戶體驗流程

部署多模態解決方案

  • 部署策略和環境設置
  • 監控實時性能
  • 安全和合規考量

總結與下一步

最低要求

  • 了解現代 AI 概念
  • 具備 Python 或 JavaScript 使用經驗
  • 熟悉 REST API

目標受眾

  • 設計師
  • 內容創作者
  • 技術產品團隊

客戶評論 (1)

課程分類