感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
GPU計算與CUDA架構
- CPU與GPU架構差異
- NVIDIA GPU流式多處理器模型
- CUDA編程模型概述
- 異構計算及主機-設備範式
設置CUDA開發環境
- 安裝CUDA Toolkit 13.x
- NVCC編譯器及構建工作流
- 通過設備查詢驗證環境
- IDE集成及開發工具
編寫與啓動CUDA內核
- 內核函數語法及限定符
- 啓動配置與執行
- 向量加法及基本數據並行模式
- CUDA錯誤檢查宏
CUDA線程層次結構與執行模型
- 網格、塊和線程的組織
- 線程索引與全局ID計算
- Warp執行及SIMT模型
- 佔用率與資源利用率
GPU內存架構與管理
- 內存類型:全局、共享、常量和寄存器內存
- 分配與釋放設備內存
- 主機到設備及設備到主機的數據傳輸
- 用於塊內協作的共享內存
統一內存與數據遷移
- 統一內存模型及託管分配
- 頁面遷移與按需分頁
- 使用cudaMemPrefetchAsync進行異步預取
- 針對訪問模式的內存建議提示
使用Nsight Systems進行系統級剖析
- Nsight Systems時間線分析
- 識別CPU-GPU同步點
- 可視化內核執行與內存傳輸
- 解讀系統級性能數據
使用Nsight Compute進行內核優化
- Nsight Compute交互式內核剖析
- 內存吞吐量與帶寬分析
- 計算利用率與Warp狀態統計
- 引導式分析與優化規則
併發流與異步操作
- CUDA流及默認流
- 內核執行與數據傳輸的重疊
- 流同步與CUDA事件
- 多流管道設計模式
錯誤處理與調試工具
- CUDA API錯誤代碼與恢復策略
- 使用Compute-sanitizer進行內存訪問檢查
- 使用cuda-gdb進行內核調試
- 斷言與同步錯誤檢測
基於剖析的優化工作流
- 迭代式剖析方法
- 瓶頸識別與優先級排序
- 性能迴歸測試
- 記錄優化決策
端到端加速應用項目
- 設計完整的GPU加速解決方案
- 在開發過程中集成剖析
- 性能基準測試與報告
- 生產環境的部署考量
最低要求
- 具備基本的C/C++編程能力,包括變量類型、循環、條件語句、函數和數組操作
- 熟悉從命令行編譯和運行程序
- 無需GPU或CUDA編程經驗
目標學員
- 尋求利用GPU加速C/C++應用的軟件開發人員和工程師
- 正在從純CPU計算轉向異構計算的科學研究人員和高性能計算(HPC)從業者
- 評估生產工作負載中GPU加速的技術負責人
8 小時