聯繫我們

課程簡介

性能概念與指標

  • 延遲、吞吐量、功耗、資源利用率
  • 系統層與模型層瓶頸
  • 推理與訓練的剖析

華為昇騰的剖析

  • 使用CANN Profiler和MindInsight
  • 核心與運算元診斷
  • 卸載模式與記憶體映射

壁仞GPU的剖析

  • 壁仞SDK性能監控功能
  • 核心融合、記憶體對齊與執行佇列
  • 感知功耗與溫度的剖析

寒武紀MLU的剖析

  • BANGPy和Neuware性能工具
  • 核心層可見性與日誌解讀
  • MLU剖析器與部署框架的整合

圖層與模型層優化

  • 圖剪枝與量化策略
  • 運算元融合與計算圖重構
  • 輸入尺寸標準化與批次調整

記憶體與核心優化

  • 最佳化記憶體佈局與重用
  • 跨芯片組的高效緩衝區管理
  • 各平台的核心層調參技術

跨平台最佳實踐

  • 性能可移植性:抽象策略
  • 為多芯片環境構建共享調參流程
  • 範例:在昇騰、壁仞和MLU上調優物體檢測模型

總結與下一步

最低要求

  • 具備AI模型訓練或部署工作流程的經驗
  • 理解GPU/MLU運算原理及模型優化
  • 熟悉性能剖析工具和指標

受眾

  • 性能工程師
  • 機器學習基礎設施團隊
  • AI系統架構師
 21 小時

課程分類