聯繫我們
 課程時長 21 時間:

課程簡介

Ollama扩展入门

  • Ollama的架构与扩展考量
  • 多用户部署中的常见瓶颈
  • 基础设施就绪的最佳实践

资源分配与GPU优化

  • 高效的CPU/GPU利用策略
  • 内存与带宽考量
  • 容器级资源限制

使用容器和Kubernetes进行部署

  • 使用Docker容器化Ollama
  • 在Kubernetes集群中运行Ollama
  • 负载均衡与服务发现

自动扩展与批处理

  • 为Ollama设计自动扩展策略
  • 用于吞吐量优化的批量推理技术
  • 延迟与吞吐量之间的权衡

延迟优化

  • 推理性能分析
  • 缓存策略与模型预热
  • 减少I/O与通信开销

监控与可观测性

  • 集成Prometheus以获取指标
  • 使用Grafana构建仪表盘
  • Ollama基础设施的告警与事件响应

成本管理与扩展策略

  • 成本感知的GPU分配
  • 云部署与本地部署的考量
  • 可持续扩展的策略

总结与后续步骤

最低要求

  • 具备Linux系统管理经验
  • 理解容器化与编排技术
  • 熟悉机器学习模型部署

目标受众

  • DevOps工程师
  • 机器学习基础设施团队
  • 站点可靠性工程师

人數


每位參與者的報價

即將到來的課程

課程分類