感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
AIOps簡介
- 什麼是AIOps及其重要性
- 傳統監控與AIOps驅動的可觀測性
- AIOps架構與關鍵元件
收集與正規化運營數據
- 可觀測性數據類型:指標、日誌與追蹤
- 從多個來源(伺服器、容器、雲端)攝取數據
- 使用代理程式與匯出器(Prometheus、Beats、Fluentd)
數據關聯與異常偵測
- 時間序列關聯與統計方法
- 使用機器學習模型進行異常偵測
- 偵測分散式系統中的事件
警報與噪音降低
- 設計智能警報規則與閾值
- 抑制、去重複與警報分組
- 整合Alertmanager、Slack、PagerDuty或Opsgenie
根本原因分析與視覺化
- 使用儀表板視覺化指標並偵測趨勢
- 探索事件與時間軸以進行RCA
- 使用分散式追蹤工具跨層級追蹤問題
自動化與修復
- 從事件觸發自動化腳本或工作流程
- 整合ITSM系統(ServiceNow、Jira)
- 使用案例:自我修復、擴展、流量重新路由
開源與商業AIOps平台
- 工具概述:Prometheus、Grafana、ELK、Moogsoft、Dynatrace
- 選擇AIOps平台的評估標準
- 所選堆疊的示範與實作
總結與後續步驟
最低要求
- 具備IT運營與系統監控概念的理解
- 有使用監控工具或儀表板的經驗
- 熟悉基本的日誌與指標格式
目標學員
- 負責基礎設施與應用程式的運營團隊
- 網站可靠性工程師(SRE)
- IT監控與可觀測性團隊