聯繫我們
 課程時長 35 時間:

課程簡介

SRE 反模式

  • 识别适得其反的实践
  • 认识反模式对可靠性的影响
  • 最佳实践与纠正性替代方案

以 SLO 作为客户满意度的代理指标

  • 定义服务水平指标(SLI)和服务水平目标(SLO)
  • 管理错误预算,平衡创新与可靠性
  • 理解分布式系统的局限性

构建安全可靠的系统

  • 面向容错和韧性的设计
  • 将安全融入可靠性工程
  • 可扩展性与数据保护策略

全栈可观测性

  • 仪表化与指标采集
  • 分布式追踪与合成监控
  • 可观测性驱动开发

平台工程与 AIOps

  • 以平台为中心的工程方法
  • SRE 中的自动化与编排
  • 利用 DataOps 和运维智能

SRE 中的事件管理

  • 事件响应中的角色与职责
  • 应用 OODA 等框架
  • 自动化修复与 AI/ML 辅助解决

混沌工程

  • 韧性测试的原则与策略
  • 规划并执行“游戏日”演练
  • 从受控故障实验中学习

SRE 作为 DevOps 的纯粹形式

  • 将 SRE 集成到 DevOps 工作流中
  • 文化对齐与协作实践
  • 通过 SRE 推动组织转型

课后练习

  • 大规模系统设计案例研究
  • 高级仪表化与监控场景
  • 真实世界的可靠性问题解决

复习与备考

  • DevOps Institute SRE 从业者大纲最终复习
  • 样题与模拟测试
  • 应试策略与建议

总结与后续步骤

最低要求

  • 理解核心站点可靠性工程原则
  • 具有 DevOps 实践及相关工具的经验
  • 熟悉系统监控、事件管理和自动化

目标受众

  • 寻求 DevOps Institute SRE 从业者认证的 SRE 专业人士
  • 希望拓展到以可靠性为重点岗位的 DevOps 工程师
  • 负责可靠性战略与执行的运维负责人

人數


每位參與者的報價

客戶評論 (2)

即將到來的課程

課程分類