聯繫我們

課程簡介

騰訊混元生產基礎

  • 騰訊混元模型服務場景概覽。
  • 大型及MoE模型的生產特性。
  • 常見的延遲、吞吐量與成本瓶頸。
  • 定義推理負載的服務級目標。

部署架構與服務流程

  • 生產推理堆棧的核心組件。
  • 在容器化、本地部署與雲端部署模型之間做出選擇。
  • 模型加載、請求路由及GPU分配基礎知識。
  • 設計可靠性與運營簡潔性。

實踐中的延遲優化

  • 在適用時使用如TensorRT等優化推理引擎。
  • KV緩存概念及實際緩存調優。
  • 減少啟動、預熱與響應開銷。
  • 測量首Token時間與Token生成速度。

吞吐量、批處理與GPU效率

  • 連續批處理與請求批處理策略。
  • 管理併發與隊列行為。
  • 在不損害用戶體驗的情況下提高GPU利用率。
  • 處理長上下文與混合負載請求。

量化與成本控制

  • 量化對於生產服務的重要性。
  • FP16、INT8及其他常見精度選項的實際權衡。
  • 平衡模型質量、延遲與基礎設施成本。
  • 構建簡單的成本優化清單。

運營、監控與就緒性審查

  • 推理服務的自動擴展觸發器。
  • 監控延遲、吞吐量、緩存使用情況及GPU健康狀況。
  • 日誌記錄、警報與事故響應基礎知識。
  • 審查參考部署並制定改進計劃。

最低要求

  • 具備大型語言模型部署與推理工作流程的基本理解。
  • 有容器、雲端或本地基礎設施以及基於API的服務的使用經驗。
  • 掌握Python或系統工程任務的工作知識。

目標受眾

  • 將LLM部署到生產環境的ML工程師。
  • 負責基於GPU的推理服務的架構工程師。
  • 設計可擴展AI服務平台的解決方案架構師。
 14 小時

課程分類