感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
使用开源工具介绍AIOps
- AIOps概念与优势概述
- Prometheus和Grafana在观测栈中的角色
- 机器学习在AIOps中的定位:预测分析与反应式分析
搭建Prometheus和Grafana
- 安装并配置Prometheus进行时间序列收集
- 使用实时指标在Grafana中创建仪表盘
- 探索导出器、重标记和服务发现
用于机器学习的数据预处理
- 提取并转换Prometheus指标
- 为异常检测和预测准备数据集
- 使用Grafana的转换功能或Python管道
应用机器学习进行异常检测
- 用于异常值检测的基础机器学习模型(如孤立森林、单类支持向量机)
- 在时间序列数据上训练和评估模型
- 在Grafana仪表盘中可视化异常
使用机器学习进行指标预测
- 构建简单的预测模型(ARIMA、Prophet、LSTM入门)
- 预测系统负载或资源使用情况
- 利用预测进行早期告警和扩缩容决策
将机器学习与告警和自动化集成
- 基于机器学习输出或阈值定义告警规则
- 使用Alertmanager和通知路由
- 在检测到异常时触发脚本或自动化工作流
扩展并运营化AIOps
- 集成外部观测工具(如ELK栈、Moogsoft、Dynatrace)
- 在观测管道中运营化机器学习模型
- 大规模AIOps的最佳实践
总结与后续步骤
最低要求
- 理解系统监控和观测概念
- 具有使用Grafana或Prometheus的经验
- 熟悉Python和基本机器学习原理
受众
- 观测工程师
- 基础设施与DevOps团队
- 监控平台架构师与站点可靠性工程师(SRE)