聯繫我們
 課程時長 14 時間:

課程簡介

預測性AIOps簡介

  • IT營運中預測分析的概覽
  • 預測的資料來源(日誌、指標、事件)
  • 時間序列預測與異常模式的關鍵概念

設計事件預測模型

  • 標記歷史事件與系統行為
  • 選擇並訓練模型(如LSTM、隨機森林、AutoML)
  • 評估模型效能與誤報處理

資料收集與特徵工程

  • 擷取並對齊日誌與指標資料,作為模型輸入
  • 從結構化與非結構化資料中提取特徵
  • 處理營運管線中的雜訊與缺失資料

自動化根因分析(RCA)

  • 基於圖形的服務與基礎設施關聯
  • 使用ML從事件鏈推斷可能的根因
  • 使用拓撲感知儀表板視覺化RCA

修復與工作流程自動化

  • 與自動化平台整合(如Ansible、Rundeck)
  • 觸發回滾、重啟或流量重新導向
  • 稽核並記錄自動化介入

擴展智慧型AIOps管線

  • 可觀測性的MLOps:重新訓練與模型版本管理
  • 在分散式節點上即時執行預測
  • 在生產環境部署AIOps的最佳實務

案例研究與實務應用

  • 使用預測性AIOps模型分析真實事件資料
  • 使用合成與生產資料部署RCA管線
  • 產業使用案例回顧:雲端中斷、微服務不穩定、網路效能衰退

總結與後續步驟

最低要求

  • 具備監控系統(如Prometheus或ELK)的使用經驗
  • 具備Python與基礎機器學習的工作知識
  • 熟悉事件管理工作流程

目標學員

  • 資深網站可靠性工程師(SRE)
  • IT自動化架構師
  • DevOps與可觀測性平台負責人

人數


每位參與者的報價

即將到來的課程

課程分類