聯繫我們

課程簡介

效能概念和指標

  • 延遲、吞吐量、功耗、資源利用率
  • 系統級與模型級瓶頸
  • 推論與訓練的剖析

在華為昇騰上進行剖析

  • 使用CANN Profiler和MindInsight
  • 核心和運算子診斷
  • 卸載模式和記憶體映射

在壁仞GPU上進行剖析

  • 壁仞SDK效能監控功能
  • 核心融合、記憶體對齊和執行佇列
  • 功耗和溫度感知剖析

在寒武紀MLU上進行剖析

  • BANGPy和Neuware效能工具
  • 核心級可見性和日誌解讀
  • MLU剖析器與部署框架的整合

圖和模型級最佳化

  • 圖剪枝和量化策略
  • 運算子融合和計算圖重構
  • 輸入大小標準化和批次調整

記憶體和核心最佳化

  • 最佳化記憶體佈局和重用
  • 跨晶片組的有效緩衝區管理
  • 各平台的內核級調整技術

跨平台最佳實踐

  • 效能可攜性:抽象策略
  • 為多晶片環境建立共享調整管線
  • 範例:在昇騰、壁仞和MLU上調整物體偵測模型

總結和後續步驟

最低要求

  • 具備AI模型訓練或部署管線的經驗
  • 了解GPU/MLU計算原理和模型最佳化
  • 對效能剖析工具和指標有基本熟悉度

目標學員

  • 效能工程師
  • 機器學習基礎設施團隊
  • AI系統架構師
 21 小時

人數


每位參與者的報價

即將到來的課程

課程分類