Ascend、Biren 及 Cambricon 上的性能優化培訓
Ascend、Biren 及 Cambricon 是中國領先的 AI 硬件平台,各自針對大規模生產級 AI 工作負載提供了獨特的加速與分析工具。
這門由講師主導的實時培訓課程(可線上或線下授課)專為高級 AI 基礎架構及性能工程師設計,旨在幫助學員在多個中國 AI 芯片平台上優化模型推理與訓練工作流。
完成本課程後,學員將能夠:
- 在 Ascend、Biren 及 Cambricon 平台上對模型進行基準測試。
- 識別系統瓶頸以及內存/計算效率問題。
- 應用圖級別、內核級別及操作符級別的優化技術。
- 調整部署流水線以提升吞吐量並降低延遲。
課程形式
- 互動式講座與討論。
- 在各平台上實地操作分析及優化工具。
- 專注於實際調優場景的指導練習。
課程定制選項
- 若希望根據您的性能環境或模型類型定制本課程的培訓內容,請與我們聯繫以作安排。
感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
性能概念與指標
- 延遲、吞吐量、功耗、資源利用率
- 系統級別與模型級別的瓶頸
- 針對推理與訓練的性能分析
華為 Ascend 上的性能分析
- 使用 CANN Profiler 與 MindInsight
- 內核與操作符診斷
- 卸载模式與內存映射
Biren GPU 上的性能分析
- Biren SDK 的性能監控功能
- 內核融合、內存對齊與執行隊列
- 感知功耗與溫度的性能分析
Cambricon MLU 上的性能分析
- BANGPy 與 Neuware 性能工具
- 內核級別的可視化及日誌解讀
- MLU Profiler 與部署框架的集成
圖與模型級別優化
- 圖剪枝與量化策略
- 操作符融合與計算圖重構
- 輸入尺寸標準化與批量調優
內存與內核優化
- 優化內存佈局與重用
- 跨芯片集的高效緩衝管理
- 各平台的內核級別調優技術
跨平台最佳實踐
- 性能可移植性:抽象策略
- 為多芯片環境構建共享調優流水線
- 案例:跨 Ascend、Biren 及 MLU 平台調優目標檢測模型
總結與後續步驟
最低要求
- 具備 AI 模型訓練或部署流水線的實際經驗
- 理解 GPU/MLU 計算原理及模型優化知識
- 熟悉基本的性能分析工具與指標
目標受眾
- 性能工程師
- 機器學習基礎架構團隊
- AI 系統架構師
21 小時
需要幫助選擇合適的課程嗎?
macao@nobleprog.com 或 +852 81990613
Ascend、Biren 及 Cambricon 上的性能優化培訓 - 詢問
Ascend、Biren 及 Cambricon 上的性能優化 - 咨詢詢問
相關課程
開發基於華為昇騰與CANN的AI應用程式
21 小時
這門授課者主導的澳門培訓指導中級AI工程師使用華為昇騰平台和CANN工具包構建並優化神經網絡模型。參與者將配置環境、使用MindSpore開發應用,並部署到邊緣或雲端環境。
更多...
使用 CANN 及 Ascend AI 處理器部署 AI 模型
14 小時
本 澳門 實地培訓旨在指導中級 AI 開發人員使用 CANN 工具包在 Ascend 處理器上部署模型。學習如何轉換 PyTorch 和 TensorFlow 等框架,優化性能,並調試問題,以實現高效的邊緣及雲端推理場景。
更多...
使用 CloudMatrix 進行 AI 推理與部署
21 小時
這門由導師帶領的 澳門 培訓課程介紹了用於可擴展 AI 推理的 CloudMatrix。學習如何使用 CANN 和 MindSpore 部署、優化和監控模型。動手練習涵蓋打包、轉換、服務提供以及針對實時和批量工作負載的性能調優。
更多...
在壁仞AI加速器上進行GPU編程
21 小時
這門澳門的實地培訓為開發人員提供了在壁仞AI加速器上編程和優化應用程序的技能。參與者將學習GPU架構,設置SDK,並將CUDA代碼轉換為壁仞代碼。課程重點在於性能調優和除錯技術。
更多...
使用 BANGPy 和 Neuware 進行寒武紀 MLU 開發
21 小時
這門在 澳門 進行的講師授課式現場培訓,旨在使開發人員掌握使用 BANGPy 和 Neuware 在寒武紀 MLU 上構建及部署 AI 模型的技能。學員將配置環境、開發優化模型,並將 MLU 加速功能整合到邊緣及數據中心應用中。
更多...
AI框架開發者的CANN入門
7 小時
本門在澳門進行的實地培訓為AI框架開發者介紹了CANN工具包。學員將學習如何設置環境、轉換模型,並利用MindSpore、TensorFlow或PyTorch在Ascend硬體上部署應用,涵蓋從訓練到推理的完整工作流程。
更多...
CANN 用於邊緣 AI 部署
14 小時
這門在 澳門 舉行的講師主導實地培訓課程,涵蓋了使用 CANN 工具包在 Ascend 邊緣設備上部署 AI 模型的核心概念與實作基礎,協助學員建立編譯、最佳化及管理受限環境的實用技能。
更多...
深入了解華為 AI 計算堆疊:從 CANN 到 MindSpore
14 小時
本講師引導的實地培訓 澳門 探討了華為的 AI 堆疊,涵蓋從 CANN SDK 到 MindSpore 框架。協助初級及中級專業人員了解這些組件如何在 Ascend 硬體上整合,以實現生命週期管理與部署。
更多...
使用CANN SDK優化神經網絡性能
14 小時
通過這門高級的講師主導培訓課程,在昇騰AI處理器上優化神經網絡推斷性能,深入學習澳門。探索CANN的運行時架構,利用圖引擎、TIK和TVM進行性能分析、自定義算子開發及解決內存瓶頸。
更多...
用於電腦視覺與自然語言處理管線的 CANN SDK
14 小時
本講師帶領的 澳門 課程涵蓋如何使用 CANN SDK 在 Ascend 硬體上部署與優化 CV 及 NLP 模型。參與者將學習如何轉換模型、將其整合至即時管線,並提升即時偵測與分析的推論效能。
更多...
使用 CANN TIK 和 TVM 建構自訂 AI 運算子
14 小時
此課程為講師帶領的實地培訓 澳門,使進階開發人員具備建構、部署和調整自訂 AI 運算子的技能。參與者將掌握 CANN TIK 和 Apache TVM 的整合,從而能在華為 Ascend 硬體上實現先進的最佳化和調度,以滿足實際生產環境的效能需求。
更多...
將CUDA應用程式遷移至中國GPU架構
21 小時
在澳門中,將CUDA應用程式遷移至華為昇騰和壁仞等中國GPU架構。這門由講師主導的課程指導高階程式設計師進行程式碼轉換和效能最佳化,涵蓋將CUDA程式碼庫移植到新SDK的實作實驗。
更多...