GPU 程式設計使用 OpenACC培訓
OpenACC 是一個異構編程的開放標準,使代碼能在不同平台及設備上運行,包括多核 CPU、GPU、FPGA 等。
此課程為現場指導的實地培訓(線上或線下),旨在幫助初級至中級開發者使用 OpenACC 程式設計異構設備,並發揮其平行運算能力。
參加完培訓後,學員將能夠:
- 配置 OpenACC 開發環境。
- 撰寫及運行基本的 OpenACC 程序。
- 為代碼添加 OpenACC 指令和子句。
- 使用 OpenACC API 和庫。
- 分析、除錯及優化 OpenACC 程序。
課程形式
- 互動講解與討論。
- 大量練習與實踐。
- 在實驗室環境中實作。
課程定制選項
- 如需為本課程申請定制化培訓,請聯繫我們以安排。
感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
簡介
- 什麼是 OpenACC?
- OpenACC 與 OpenCL、CUDA、SYCL 的比較
- OpenACC 功能與架構概述
- 配置開發環境
快速上手
- 在 Visual Studio Code 中建立 OpenACC 項目
- 探索項目結構與文件
- 編譯並運行程序
- 使用 printf 和 fprintf 顯示輸出
OpenACC 指令和子句
- 理解 OpenACC 指令和子句
- 使用平行指令建立平行區域
- 使用內核指令進行編譯器管理的平行運算
- 使用循環指令實現循環平行化
- 使用數據指令管理數據遷移
- 使用更新指令同步數據
- 通過快取指令提高數據重用率
- 使用常規指令創建設備函數
- 使用等待指令同步事件
OpenACC API
- 理解 OpenACC API 的作用
- 查詢設備信息及能力
- 設置設備數量與類型
- 處理錯誤和異常
- 創建並同步事件
OpenACC 庫與互操作性
- 理解 OpenACC 庫與互操作性
- 使用數學、隨機數及複雜庫
- 整合其他模型(CUDA、OpenMP、MPI)
- 與 GPU 庫集成(cuBLAS、cuFFT)
OpenACC 工具
- 理解開發中的 OpenACC 工具
- 分析及除錯 OpenACC 程序
- 使用 PGI Compiler、NVIDIA Nsight Systems、Allinea Forge 進行性能分析
優化
- 影響 OpenACC 程序性能的相關因素
- 優化數據局部性並減少遷移
- 優化循環平行化與融合
- 優化內核平行化與融合
- 優化向量化及自動調參
總結和下一步
最低要求
- 理解 C/C++ 或 Fortran 語言及平行編程概念
- 具備計算機架構及內存層次結構的基本知識
- 熟悉命令行工具和代碼編輯器
受眾
- 希望學習如何使用 OpenACC 程式設計異構設備並發揮其平行運算能力的開發者
- 希望編寫可在不同平台及設備上運行的可移植且具擴展性的代碼的開發者
- 希望探索異構編程的高級層面並優化生產力的程式設計師
28 小時
需要幫助選擇合適的課程嗎?
macao@nobleprog.com 或 +852 81990613
GPU 程式設計使用 OpenACC培訓 - 詢問
GPU 程式設計使用 OpenACC - 咨詢詢問
相關課程
開發基於華為昇騰與CANN的AI應用程式
21 小時
這門授課者主導的澳門培訓指導中級AI工程師使用華為昇騰平台和CANN工具包構建並優化神經網絡模型。參與者將配置環境、使用MindSpore開發應用,並部署到邊緣或雲端環境。
更多...
使用 CANN 及 Ascend AI 處理器部署 AI 模型
14 小時
本 澳門 實地培訓旨在指導中級 AI 開發人員使用 CANN 工具包在 Ascend 處理器上部署模型。學習如何轉換 PyTorch 和 TensorFlow 等框架,優化性能,並調試問題,以實現高效的邊緣及雲端推理場景。
更多...
使用 CloudMatrix 進行 AI 推理與部署
21 小時
這門由導師帶領的 澳門 培訓課程介紹了用於可擴展 AI 推理的 CloudMatrix。學習如何使用 CANN 和 MindSpore 部署、優化和監控模型。動手練習涵蓋打包、轉換、服務提供以及針對實時和批量工作負載的性能調優。
更多...
在壁仞AI加速器上進行GPU編程
21 小時
這門澳門的實地培訓為開發人員提供了在壁仞AI加速器上編程和優化應用程序的技能。參與者將學習GPU架構,設置SDK,並將CUDA代碼轉換為壁仞代碼。課程重點在於性能調優和除錯技術。
更多...
使用 BANGPy 和 Neuware 進行寒武紀 MLU 開發
21 小時
這門在 澳門 進行的講師授課式現場培訓,旨在使開發人員掌握使用 BANGPy 和 Neuware 在寒武紀 MLU 上構建及部署 AI 模型的技能。學員將配置環境、開發優化模型,並將 MLU 加速功能整合到邊緣及數據中心應用中。
更多...
AI框架開發者的CANN入門
7 小時
本門在澳門進行的實地培訓為AI框架開發者介紹了CANN工具包。學員將學習如何設置環境、轉換模型,並利用MindSpore、TensorFlow或PyTorch在Ascend硬體上部署應用,涵蓋從訓練到推理的完整工作流程。
更多...
CANN 用於邊緣 AI 部署
14 小時
這門在 澳門 舉行的講師主導實地培訓課程,涵蓋了使用 CANN 工具包在 Ascend 邊緣設備上部署 AI 模型的核心概念與實作基礎,協助學員建立編譯、最佳化及管理受限環境的實用技能。
更多...
深入了解華為 AI 計算堆疊:從 CANN 到 MindSpore
14 小時
本講師引導的實地培訓 澳門 探討了華為的 AI 堆疊,涵蓋從 CANN SDK 到 MindSpore 框架。協助初級及中級專業人員了解這些組件如何在 Ascend 硬體上整合,以實現生命週期管理與部署。
更多...
使用CANN SDK優化神經網絡性能
14 小時
通過這門高級的講師主導培訓課程,在昇騰AI處理器上優化神經網絡推斷性能,深入學習澳門。探索CANN的運行時架構,利用圖引擎、TIK和TVM進行性能分析、自定義算子開發及解決內存瓶頸。
更多...
用於電腦視覺與自然語言處理管線的 CANN SDK
14 小時
本講師帶領的 澳門 課程涵蓋如何使用 CANN SDK 在 Ascend 硬體上部署與優化 CV 及 NLP 模型。參與者將學習如何轉換模型、將其整合至即時管線,並提升即時偵測與分析的推論效能。
更多...
使用 CANN TIK 和 TVM 建構自訂 AI 運算子
14 小時
此課程為講師帶領的實地培訓 澳門,使進階開發人員具備建構、部署和調整自訂 AI 運算子的技能。參與者將掌握 CANN TIK 和 Apache TVM 的整合,從而能在華為 Ascend 硬體上實現先進的最佳化和調度,以滿足實際生產環境的效能需求。
更多...
將CUDA應用程式遷移至中國GPU架構
21 小時
在澳門中,將CUDA應用程式遷移至華為昇騰和壁仞等中國GPU架構。這門由講師主導的課程指導高階程式設計師進行程式碼轉換和效能最佳化,涵蓋將CUDA程式碼庫移植到新SDK的實作實驗。
更多...
Ascend、Biren 及 Cambricon 上的性能優化
21 小時
透過這門 澳門 的實戰培訓,掌握如何在 Ascend、Biren 及 Cambricon 平台上優化 AI 工作負載。學習進行模型基準測試、識別瓶頸,並應用圖級別、內核級別及操作符級別的優化技術。調整部署流水線,以增強這些領先平台的吞吐量並優化延遲表現。
更多...