感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程时长 35 小时
课程大纲
引言与诊断基础
- LLM系统故障模式概述及常见Ollama特定问题
- 建立可重现实验和受控环境
- 调试工具集:本地日志、请求/响应捕获和沙箱
重现与隔离故障
- 创建最小失败示例和种子的技术
- 有状态与无状态交互:隔离上下文相关错误
- 确定性、随机性及控制非确定性行为
行为评估与指标
- 定量指标:准确性、ROUGE/BLEU变体、校准和困惑度代理
- 定性评估:人机回环评分和评分标准设计
- 任务特定保真度检查和验收标准
自动化测试与回归
- 提示词和组件的单元测试、场景和端到端测试
- 创建回归套件和黄金示例基线
- Ollama模型更新的CI/CD集成和自动化验证门禁
可观测性与监控
- 结构化日志、分布式追踪和关联ID
- 关键运维指标:延迟、令牌使用量、错误率和质量信号
- 基于模型服务的告警、仪表板以及SLI/SLO
高级根因分析
- 追踪图形化提示词、工具调用和多轮流程
- 比较性A/B诊断和消融研究
- 数据溯源、数据集调试及解决数据集引发的故障
安全性、稳健性与修复策略
- 缓解措施:过滤、接地、检索增强和提示词脚手架
- 模型更新的回滚、金丝雀发布和分阶段推出模式
- 事后复盘、经验总结和持续改进循环
总结与后续步骤
要求
- 具备构建和部署LLM应用的丰富经验
- 熟悉Ollama工作流程和模型托管
- 熟练使用Python、Docker和基本可观测性工具
目标学员
- AI工程师
- ML Ops专业人员
- 负责生产LLM系统的QA团队