联系我们
 课程时长 35 小时

课程大纲

引言与诊断基础

  • LLM系统故障模式概述及常见Ollama特定问题
  • 建立可重现实验和受控环境
  • 调试工具集:本地日志、请求/响应捕获和沙箱

重现与隔离故障

  • 创建最小失败示例和种子的技术
  • 有状态与无状态交互:隔离上下文相关错误
  • 确定性、随机性及控制非确定性行为

行为评估与指标

  • 定量指标:准确性、ROUGE/BLEU变体、校准和困惑度代理
  • 定性评估:人机回环评分和评分标准设计
  • 任务特定保真度检查和验收标准

自动化测试与回归

  • 提示词和组件的单元测试、场景和端到端测试
  • 创建回归套件和黄金示例基线
  • Ollama模型更新的CI/CD集成和自动化验证门禁

可观测性与监控

  • 结构化日志、分布式追踪和关联ID
  • 关键运维指标:延迟、令牌使用量、错误率和质量信号
  • 基于模型服务的告警、仪表板以及SLI/SLO

高级根因分析

  • 追踪图形化提示词、工具调用和多轮流程
  • 比较性A/B诊断和消融研究
  • 数据溯源、数据集调试及解决数据集引发的故障

安全性、稳健性与修复策略

  • 缓解措施:过滤、接地、检索增强和提示词脚手架
  • 模型更新的回滚、金丝雀发布和分阶段推出模式
  • 事后复盘、经验总结和持续改进循环

总结与后续步骤

要求

  • 具备构建和部署LLM应用的丰富经验
  • 熟悉Ollama工作流程和模型托管
  • 熟练使用Python、Docker和基本可观测性工具

目标学员

  • AI工程师
  • ML Ops专业人员
  • 负责生产LLM系统的QA团队

即将举行的公开课程

课程分类