联系我们

课程大纲

简介、目标和迁移策略

  • 课程目标、学员画像匹配以及成功标准
  • 高层级的迁移方法和风险考量
  • 设置工作区、仓库和实验室数据集

第1天 — 迁移基础和架构

  • 湖仓概念、Delta Lake概览和Databricks架构
  • SMP与MPP的区别及其对迁移的影响
  • Medallion(青铜层、白银层、黄金层)设计和Unity Catalog概览

第1天实验室 — 转换存储过程

  • 动手将示例存储过程迁移到Notebook
  • 将临时表和游标映射为DataFrame转换
  • 验证并与原始输出进行比较

第2天 — 高级Delta Lake与增量加载

  • ACID事务、提交日志、版本控制和时间旅行
  • Auto Loader、MERGE INTO模式、upsert和架构演进
  • OPTIMIZE、VACUUM、Z-ORDER、分区和存储调优

第2天实验室 — 增量摄取与优化

  • 实现Auto Loader摄取和MERGE工作流
  • 应用OPTIMIZE、Z-ORDER和VACUUM,并验证结果
  • 衡量读写性能改进

第3天 — Databricks中的SQL、性能与调试

  • 分析型SQL特性:窗口函数、高阶函数、JSON/数组处理
  • 阅读Spark UI,分析DAG、Shuffle、Stage、任务及瓶颈诊断
  • 查询调优模式:广播连接、提示、缓存和减少溢出

第3天实验室 — SQL重构与性能调优

  • 将繁重的SQL过程重构为优化的Spark SQL
  • 使用Spark UI跟踪日志来识别和修复数据倾斜和Shuffle问题
  • 基准测试前后性能,并记录调优步骤

第4天 — 战术型PySpark:替代过程式逻辑

  • Spark执行模型:驱动器、执行器、延迟求值和分区策略
  • 将循环和游标转换为向量化DataFrame操作
  • 模块化、UDF/pandas UDF、小部件和可复用库

第4天实验室 — 重构过程式脚本

  • 将过程式ETL脚本重构为模块化的PySpark Notebook
  • 引入参数化、单元测试风格测试和可复用函数
  • 代码审查和最佳实践检查表应用

第5天 — 编排、端到端管道与最佳实践

  • Databricks Workflows:作业设计、任务依赖、触发器和错误处理
  • 设计具有质量规则和架构验证的增量Medallion管道
  • 与Git(GitHub/Azure DevOps)集成,以及PySpark逻辑的CI和测试策略

第5天实验室 — 构建完整的端到端管道

  • 组装由Workflows编排的青铜层、白银层、黄金层管道
  • 实现日志记录、审计、重试和自动化验证
  • 运行完整管道,验证输出,并准备部署说明

运维化、治理与生产就绪

  • Unity Catalog治理、数据血缘和访问控制最佳实践
  • 成本、集群规模、自动扩展和作业并发模式
  • 部署检查表、回滚策略和操作手册创建

最终回顾、知识转移与下一步

  • 学员展示迁移工作和经验教训
  • 差距分析、推荐的后续活动以及培训材料交接
  • 参考资料、进一步学习路径和支持选项

要求

  • 了解数据工程概念
  • 具有SQL和存储过程经验(Synapse / SQL Server)
  • 熟悉ETL编排概念(ADF或类似工具)

目标受众

  • 具有数据工程背景的技术经理
  • 将过程式OLAP逻辑转换为湖仓模式的数据工程师
  • 负责Databricks采用的平台工程师
 35 小时

即将举行的公开课程

课程分类