聯繫我們
 課程時長 21 時間:

課程簡介

擴展 Ollama 簡介

  • Ollama 的架構及擴展考量
  • 多用戶部署中常見的瓶頸
  • 基礎設施就緒的最佳實務

資源分配及 GPU 最佳化

  • 高效的 CPU/GPU 使用策略
  • 記憶體及頻寬考量
  • 容器級資源約束

使用容器及 Kubernetes 進行部署

  • 使用 Docker 將 Ollama 容器化
  • 在 Kubernetes 叢集中運行 Ollama
  • 負載平衡及服務發現

自動擴展及批次處理

  • 為 Ollama 設計自動擴展策略
  • 用於吞吐量最佳化的批次推論技術
  • 延遲與吞吐量之間的取捨

延遲最佳化

  • 推論性能分析
  • 緩存策略及模型預熱
  • 減少 I/O 及通信開銷

監控及可觀測性

  • 整合 Prometheus 以收集指標
  • 使用 Grafana 建立儀表板
  • Ollama 基礎設施的警報及事件響應

成本管理及擴展策略

  • 具備成本意識的 GPU 分配
  • 雲端與本地部署的考量
  • 可持續擴展策略

總結及後續步驟

最低要求

  • 具備 Linux 系統管理經驗
  • 理解容器化及編排技術
  • 熟悉機器學習模型部署

目標受眾

  • DevOps 工程師
  • ML 基礎架構團隊
  • 網站可靠性工程師

課程分類