聯繫我們

課程簡介

生產環境中 Agent 型系統的基礎

  • Agent 型架構:迴圈、工具、記憶與編排層
  • Agent 生命週期:開發、部署與持續運行
  • 生產級 Agent 管理的挑戰

基礎設施與部署模型

  • 在容器化與雲端環境中部署 Agent
  • 擴展模式:水平與垂直擴展、並行度與節流
  • 多 Agent 編排與工作負載平衡

監控與可觀察性

  • 關鍵指標:延遲、成功率、記憶體使用量與 Agent 呼叫深度
  • 追蹤 Agent 活動與呼叫圖
  • 使用 Prometheus、OpenTelemetry 及 Grafana 建置可觀察性

日誌、稽核與合規

  • 集中式日誌與結構化事件收集
  • Agent 型工作流中的合規與可審計性
  • 設計稽核軌跡與回放機制以利除錯

效能調優與資源優化

  • 降低推論開銷,優化 Agent 編排週期
  • 模型快取與輕量級嵌入,加速檢索
  • AI 流水線的負載測試與壓力測試

成本控制與治理

  • 理解 Agent 成本驅動因素:API 呼叫、記憶體、運算與外部整合
  • 追蹤 Agent 級成本並實施分攤成本模型
  • 自動化政策以防止 Agent 蔓延及閒置資源消耗

Agent 的 CI/CD 與發佈策略

  • 將 Agent 流水線整合至 CI/CD 系統
  • 針對迭代式 Agent 更新的測試、版本管理與回滾策略
  • 漸進式發佈與安全部署機制

失敗恢復與可靠性工程

  • 設計容錯與優雅降級機制
  • Agent 可靠性的重試、超時與斷路器模式
  • AI 運維的事件回應與事後複盤框架

綜合項目

  • 建置並部署具完整監控與成本追蹤的 Agent 型 AI 系統
  • 模擬負載、量測效能並優化資源使用
  • 向同儕展示最終架構與監控儀表板

總結與下一步

最低要求

  • 深刻理解 MLOps 及生產級機器學習系統
  • 具備容器化部署經驗(Docker/Kubernetes)
  • 熟悉雲端成本優化與可觀察性工具

目標受眾

  • MLOps 工程師
  • 網站可靠性工程師(SRE)
  • 負責監督 AI 基礎設施的工程主管
 21 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類