感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程大纲
Databricks平台与湖仓基础
- Databricks湖仓架构与组件
- 组织工作区与目录
Databricks工作区与笔记本
- 工作区导航与基于笔记本的开发
- 将代码结构化存入可复用的笔记本中
Apache Spark架构与执行
- Spark运行时架构与执行模型
- 延迟求值与作业DAG
PySpark DataFrames与DataFrame API
- DataFrame抽象与模式
- 核心DataFrame操作与列表达式
将SQL转换为PySpark DataFrames
- 将核心SQL子句转换为DataFrame操作
- PySpark中的窗口函数与聚合
在Databricks中读取和写入数据
- 从常见文件和数据源读取数据
- 在湖仓中写入并分区数据
Delta Lake与表管理
- Delta表与ACID事务
- 时间旅行与模式演化
数据清洗与转换模式
- 数据清洗与类型转换
- 构建可复用的转换逻辑
用户自定义函数与模块化代码
- Python UDFs与pandas UDFs
- 将过程化逻辑模块化为函数
性能调优与优化
- 分区与缓存策略
- 使用Spark UI诊断瓶颈
结构化流基础
- 批处理与流式处理模型对比
- 流式DataFrames与基础聚合
Databricks作业与工作流编排
- 将笔记本计划为作业与任务
- 构建具有依赖关系的多步骤工作流
Unity Catalog与数据治理
- Unity Catalog架构与命名空间
- 访问控制与数据血缘
测试、调试与生产实践
- 单元测试PySpark逻辑
- 调试与代码质量标准
端到端金融服务用例
- 构建端到端银行ETL管道
- 将遗留SQL流程转换为PySpark
将SQL工作负载迁移至PySpark
- 迁移策略与规划模式
- 逐步将SQL工作流转换为PySpark
要求
- 具备Python编程经验,包括函数和数据类型
- 理解SQL,包括连接、聚合和子查询
- 无需Databricks或PySpark的前期经验
受众
- 数据工程师、数据分析师和数据专业人员
- 将现有基于SQL的工作流迁移至Databricks和PySpark的团队
35 小时
客户评论 (1)
我喜欢它的实用性。非常喜欢将理论知识应用到实际例子中。
Aurelia-Adriana - Allianz Services Romania
课程 - Python and Spark for Big Data (PySpark)
机器翻译