感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
預測性AIOps簡介
- IT營運中預測分析的概覽
- 預測的資料來源(日誌、指標、事件)
- 時間序列預測與異常模式的關鍵概念
設計事件預測模型
- 標記歷史事件與系統行為
- 選擇並訓練模型(如LSTM、隨機森林、AutoML)
- 評估模型效能與誤報處理
資料收集與特徵工程
- 擷取並對齊日誌與指標資料,作為模型輸入
- 從結構化與非結構化資料中提取特徵
- 處理營運管線中的雜訊與缺失資料
自動化根因分析(RCA)
- 基於圖形的服務與基礎設施關聯
- 使用ML從事件鏈推斷可能的根因
- 使用拓撲感知儀表板視覺化RCA
修復與工作流程自動化
- 與自動化平台整合(如Ansible、Rundeck)
- 觸發回滾、重啟或流量重新導向
- 稽核並記錄自動化介入
擴展智慧型AIOps管線
- 可觀測性的MLOps:重新訓練與模型版本管理
- 在分散式節點上即時執行預測
- 在生產環境部署AIOps的最佳實務
案例研究與實務應用
- 使用預測性AIOps模型分析真實事件資料
- 使用合成與生產資料部署RCA管線
- 產業使用案例回顧:雲端中斷、微服務不穩定、網路效能衰退
總結與後續步驟
最低要求
- 具備監控系統(如Prometheus或ELK)的使用經驗
- 具備Python與基礎機器學習的工作知識
- 熟悉事件管理工作流程
目標學員
- 資深網站可靠性工程師(SRE)
- IT自動化架構師
- DevOps與可觀測性平台負責人