感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
效能概念和指標
- 延遲、吞吐量、功耗、資源利用率
- 系統級與模型級瓶頸
- 推論與訓練的剖析
在華為昇騰上進行剖析
- 使用CANN Profiler和MindInsight
- 核心和運算子診斷
- 卸載模式和記憶體映射
在壁仞GPU上進行剖析
- 壁仞SDK效能監控功能
- 核心融合、記憶體對齊和執行佇列
- 功耗和溫度感知剖析
在寒武紀MLU上進行剖析
- BANGPy和Neuware效能工具
- 核心級可見性和日誌解讀
- MLU剖析器與部署框架的整合
圖和模型級最佳化
- 圖剪枝和量化策略
- 運算子融合和計算圖重構
- 輸入大小標準化和批次調整
記憶體和核心最佳化
- 最佳化記憶體佈局和重用
- 跨晶片組的有效緩衝區管理
- 各平台的內核級調整技術
跨平台最佳實踐
- 效能可攜性:抽象策略
- 為多晶片環境建立共享調整管線
- 範例:在昇騰、壁仞和MLU上調整物體偵測模型
總結和後續步驟
最低要求
- 具備AI模型訓練或部署管線的經驗
- 了解GPU/MLU計算原理和模型最佳化
- 對效能剖析工具和指標有基本熟悉度
目標學員
- 效能工程師
- 機器學習基礎設施團隊
- AI系統架構師
21 小時