聯繫我們

課程簡介

AI 觀測性全景

  • 從儀表板到對話:向 AI 增強型觀測性的轉變
  • 與觀測性相關的 LLM 能力:摘要、推理、模式匹配
  • 架構模式:將 AI 集成到現有觀測性技術棧中

自然語言遙測查詢

  • Text-to-PromQL:將自然語言轉換爲監控查詢
  • 針對 Elasticsearch、OpenSearch 和 Loki 日誌存儲的 NL 查詢
  • 從自然語言生成結構化遙測數據的 SQL 語句
  • 構建具備工具使用能力和上下文感知能力的查詢助手代理

基於 LLM 的日誌分析

  • 利用 LLM 進行自動日誌解析和結構化
  • 使用嵌入相似度在日誌流中進行異常檢測
  • 大規模日誌聚類和模式發現
  • 從原始日誌序列生成人類可讀的解釋

智能告警與事件豐富

  • 基於語義理解的告警關聯與去重
  • 從運行手冊、過往事件和文檔中自動收集事件上下文
  • 基於內容理解和團隊專業知識進行智能告警路由
  • 通過 AI 驅動噪聲減少降低告警疲勞

AI 輔助的根本原因分析

  • 從多源遙測關聯中生成假設
  • 證據鏈:連接跨指標、日誌和跟蹤的症狀
  • 通過交互式 AI 診斷會話進行引導式故障排除
  • 構建具備漸進式調查功能的根本原因分析代理

自動事件響應與溝通

  • 從遙測數據生成事件摘要和狀態更新
  • 通過時間線重建自動生成事後報告草稿
  • 針對技術和管理受衆定製利益相關者溝通
  • 運行手冊建議及自動修復推薦

觀測性中的機器學習

  • 用於容量規劃和異常預測的時間序列預測
  • 用於指標零樣本異常檢測的基礎模型
  • 基於嵌入的服務依賴映射和拓撲發現
  • 在觀測性流水線旁訓練和部署輕量級 ML 模型

生產部署與倫理

  • 即時 AI 觀測性的延遲與成本考量
  • 數據隱私:確保 LLM 不泄露敏感遙測數據
  • 人工監督:何時需要操作員驗證 AI 診斷結果
  • 衡量影響:平均檢測時間 (MTTD)、平均修復時間 (MTTR) 及值班體驗指標

最低要求

  • 具備 Prometheus、Grafana、Datadog 或 OpenTelemetry 等觀測性工具的使用經驗。
  • 熟悉日誌管理和指標概念。
  • 具備用於數據處理的基礎 Python 腳本編寫能力。

受衆

  • 採用 AI 增強型工具的 SRE 和觀測性工程師。
  • 構建下一代監控流水線的平臺工程師。
  • 評估將 LLM 集成到事件工作流中的 DevOps 負責人。
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類