聯繫我們

課程簡介

GPU計算與CUDA架構

  • CPU與GPU架構差異
  • NVIDIA GPU流式多處理器模型
  • CUDA編程模型概述
  • 異構計算及主機-設備範式

設置CUDA開發環境

  • 安裝CUDA Toolkit 13.x
  • NVCC編譯器及構建工作流
  • 通過設備查詢驗證環境
  • IDE集成及開發工具

編寫與啓動CUDA內核

  • 內核函數語法及限定符
  • 啓動配置與執行
  • 向量加法及基本數據並行模式
  • CUDA錯誤檢查宏

CUDA線程層次結構與執行模型

  • 網格、塊和線程的組織
  • 線程索引與全局ID計算
  • Warp執行及SIMT模型
  • 佔用率與資源利用率

GPU內存架構與管理

  • 內存類型:全局、共享、常量和寄存器內存
  • 分配與釋放設備內存
  • 主機到設備及設備到主機的數據傳輸
  • 用於塊內協作的共享內存

統一內存與數據遷移

  • 統一內存模型及託管分配
  • 頁面遷移與按需分頁
  • 使用cudaMemPrefetchAsync進行異步預取
  • 針對訪問模式的內存建議提示

使用Nsight Systems進行系統級剖析

  • Nsight Systems時間線分析
  • 識別CPU-GPU同步點
  • 可視化內核執行與內存傳輸
  • 解讀系統級性能數據

使用Nsight Compute進行內核優化

  • Nsight Compute交互式內核剖析
  • 內存吞吐量與帶寬分析
  • 計算利用率與Warp狀態統計
  • 引導式分析與優化規則

併發流與異步操作

  • CUDA流及默認流
  • 內核執行與數據傳輸的重疊
  • 流同步與CUDA事件
  • 多流管道設計模式

錯誤處理與調試工具

  • CUDA API錯誤代碼與恢復策略
  • 使用Compute-sanitizer進行內存訪問檢查
  • 使用cuda-gdb進行內核調試
  • 斷言與同步錯誤檢測

基於剖析的優化工作流

  • 迭代式剖析方法
  • 瓶頸識別與優先級排序
  • 性能迴歸測試
  • 記錄優化決策

端到端加速應用項目

  • 設計完整的GPU加速解決方案
  • 在開發過程中集成剖析
  • 性能基準測試與報告
  • 生產環境的部署考量

最低要求

  • 具備基本的C/C++編程能力,包括變量類型、循環、條件語句、函數和數組操作
  • 熟悉從命令行編譯和運行程序
  • 無需GPU或CUDA編程經驗

目標學員

  • 尋求利用GPU加速C/C++應用的軟件開發人員和工程師
  • 正在從純CPU計算轉向異構計算的科學研究人員和高性能計算(HPC)從業者
  • 評估生產工作負載中GPU加速的技術負責人
 8 小時

人數


每位參與者的報價

即將到來的課程

課程分類