聯繫我們
 課程時長 14 時間:

課程簡介

使用开源工具介绍AIOps

  • AIOps概念与优势概述
  • Prometheus和Grafana在观测栈中的角色
  • 机器学习在AIOps中的定位:预测分析与反应式分析

搭建Prometheus和Grafana

  • 安装并配置Prometheus进行时间序列收集
  • 使用实时指标在Grafana中创建仪表盘
  • 探索导出器、重标记和服务发现

用于机器学习的数据预处理

  • 提取并转换Prometheus指标
  • 为异常检测和预测准备数据集
  • 使用Grafana的转换功能或Python管道

应用机器学习进行异常检测

  • 用于异常值检测的基础机器学习模型(如孤立森林、单类支持向量机)
  • 在时间序列数据上训练和评估模型
  • 在Grafana仪表盘中可视化异常

使用机器学习进行指标预测

  • 构建简单的预测模型(ARIMA、Prophet、LSTM入门)
  • 预测系统负载或资源使用情况
  • 利用预测进行早期告警和扩缩容决策

将机器学习与告警和自动化集成

  • 基于机器学习输出或阈值定义告警规则
  • 使用Alertmanager和通知路由
  • 在检测到异常时触发脚本或自动化工作流

扩展并运营化AIOps

  • 集成外部观测工具(如ELK栈、Moogsoft、Dynatrace)
  • 在观测管道中运营化机器学习模型
  • 大规模AIOps的最佳实践

总结与后续步骤

最低要求

  • 理解系统监控和观测概念
  • 具有使用Grafana或Prometheus的经验
  • 熟悉Python和基本机器学习原理

受众

  • 观测工程师
  • 基础设施与DevOps团队
  • 监控平台架构师与站点可靠性工程师(SRE)

人數


每位參與者的報價

即將到來的課程

課程分類