聯繫我們

課程簡介

騰訊混元生產基礎

  • 騰訊混元模型服務場景概覽
  • 大型和MoE模型的生產特性
  • 常見的延遲、吞吐量及成本瓶頸
  • 爲推理工作流定義服務級別目標

部署架構與服務流程

  • 生產推理堆棧的核心組件
  • 在容器化、本地和雲部署模式之間做出選擇
  • 模型加載、請求路由及GPU分配基礎
  • 設計可靠性與運維簡便性

延遲優化實踐

  • 在適用場景中使用優化的推理引擎,如TensorRT
  • KV緩存概念及實際的緩存調優
  • 減少啓動、預熱和響應開銷
  • 測量首字延遲和令牌生成速度

吞吐量、批處理與GPU效率

  • 連續批處理與請求批處理策略
  • 管理併發與隊列行爲
  • 提升GPU利用率而不損害用戶體驗
  • 處理長上下文和混合工作負載請求

量化與成本控制

  • 爲何量化對生產服務至關重要
  • FP16、INT8及其他常見精度選項的實用權衡
  • 平衡模型質量、延遲與基礎設施成本
  • 制定簡易的成本優化清單

運維、監控與就緒審查

  • 推理服務的自動擴縮容觸發機制
  • 監控延遲、吞吐量、緩存使用及GPU健康狀況
  • 日誌記錄、警報與事件響應基礎
  • 審查參考部署方案並制定改進計劃

最低要求

  • 對大型語言模型部署和推理工作流有基本瞭解
  • 具備容器、雲或本地基礎設施以及基於API的服務使用經驗
  • 掌握Python或系統工程任務的工作知識

受衆

  • 將LLM部署到生產環境的ML工程師
  • 負責基於GPU的推理服務的平臺工程師
  • 設計可擴展AI服務平臺的解決方案架構師
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類