联系我们

课程大纲

Databricks平台与湖仓基础

  • Databricks湖仓架构与组件
  • 组织工作区与目录

Databricks工作区与笔记本

  • 工作区导航与基于笔记本的开发
  • 将代码结构化存入可复用的笔记本中

Apache Spark架构与执行

  • Spark运行时架构与执行模型
  • 延迟求值与作业DAG

PySpark DataFrames与DataFrame API

  • DataFrame抽象与模式
  • 核心DataFrame操作与列表达式

将SQL转换为PySpark DataFrames

  • 将核心SQL子句转换为DataFrame操作
  • PySpark中的窗口函数与聚合

在Databricks中读取和写入数据

  • 从常见文件和数据源读取数据
  • 在湖仓中写入并分区数据

Delta Lake与表管理

  • Delta表与ACID事务
  • 时间旅行与模式演化

数据清洗与转换模式

  • 数据清洗与类型转换
  • 构建可复用的转换逻辑

用户自定义函数与模块化代码

  • Python UDFs与pandas UDFs
  • 将过程化逻辑模块化为函数

性能调优与优化

  • 分区与缓存策略
  • 使用Spark UI诊断瓶颈

结构化流基础

  • 批处理与流式处理模型对比
  • 流式DataFrames与基础聚合

Databricks作业与工作流编排

  • 将笔记本计划为作业与任务
  • 构建具有依赖关系的多步骤工作流

Unity Catalog与数据治理

  • Unity Catalog架构与命名空间
  • 访问控制与数据血缘

测试、调试与生产实践

  • 单元测试PySpark逻辑
  • 调试与代码质量标准

端到端金融服务用例

  • 构建端到端银行ETL管道
  • 将遗留SQL流程转换为PySpark

将SQL工作负载迁移至PySpark

  • 迁移策略与规划模式
  • 逐步将SQL工作流转换为PySpark

要求

  • 具备Python编程经验,包括函数和数据类型
  • 理解SQL,包括连接、聚合和子查询
  • 无需Databricks或PySpark的前期经验

受众

  • 数据工程师、数据分析师和数据专业人员
  • 将现有基于SQL的工作流迁移至Databricks和PySpark的团队
 35 小时

客户评论 (1)

即将举行的公开课程

课程分类