联系我们
 课程时长 21 小时

课程大纲

Ollama扩展简介

  • Ollama的架构和扩展考虑因素
  • 多用户部署中的常见瓶颈
  • 基础设施就绪的最佳实践

资源分配与GPU优化

  • 高效的CPU/GPU利用策略
  • 内存和带宽考虑因素
  • 容器级别的资源限制

使用容器和Kubernetes进行部署

  • 使用Docker容器化Ollama
  • 在Kubernetes集群中运行Ollama
  • 负载均衡和服务发现

自动扩展和批处理

  • 为Ollama设计自动扩展策略
  • 用于吞吐量优化的批处理推理技术
  • 延迟与吞吐量的权衡

延迟优化

  • 分析推理性能
  • 缓存策略和模型预热
  • 减少I/O和通信开销

监控与可观测性

  • 集成Prometheus获取指标
  • 使用Grafana构建仪表板
  • 针对Ollama基础设施的告警和事件响应

成本管理与扩展策略

  • 成本感知的GPU分配
  • 云与本地部署的考虑因素
  • 可持续扩展的策略

总结与后续步骤

要求

  • 具备Linux系统管理经验
  • 理解容器化和编排
  • 熟悉机器学习模型部署

目标受众

  • DevOps工程师
  • ML基础设施团队
  • 站点可靠性工程师

即将举行的公开课程

课程分类