聯繫我們

課程簡介

性能概念與指標

  • 延遲、吞吐量、功耗、資源利用率
  • 系統級別與模型級別的瓶頸
  • 針對推理與訓練的性能分析

華為 Ascend 上的性能分析

  • 使用 CANN Profiler 與 MindInsight
  • 內核與操作符診斷
  • 卸载模式與內存映射

Biren GPU 上的性能分析

  • Biren SDK 的性能監控功能
  • 內核融合、內存對齊與執行隊列
  • 感知功耗與溫度的性能分析

Cambricon MLU 上的性能分析

  • BANGPy 與 Neuware 性能工具
  • 內核級別的可視化及日誌解讀
  • MLU Profiler 與部署框架的集成

圖與模型級別優化

  • 圖剪枝與量化策略
  • 操作符融合與計算圖重構
  • 輸入尺寸標準化與批量調優

內存與內核優化

  • 優化內存佈局與重用
  • 跨芯片集的高效緩衝管理
  • 各平台的內核級別調優技術

跨平台最佳實踐

  • 性能可移植性:抽象策略
  • 為多芯片環境構建共享調優流水線
  • 案例:跨 Ascend、Biren 及 MLU 平台調優目標檢測模型

總結與後續步驟

最低要求

  • 具備 AI 模型訓練或部署流水線的實際經驗
  • 理解 GPU/MLU 計算原理及模型優化知識
  • 熟悉基本的性能分析工具與指標

目標受眾

  • 性能工程師
  • 機器學習基礎架構團隊
  • AI 系統架構師
 21 小時

課程分類