感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 35 時間:
課程簡介
引言、目标和迁移策略
- 课程目标、学员背景匹配和成功标准
- 高层次迁移方法和风险考量
- 设置工作区、代码仓库和实验数据集
第1天——迁移基础与架构
- Lakehouse概念、Delta Lake概述和Databricks架构
- SMP与MPP的差异及其对迁移的影响
- Medallion(铜层→银层→金层)设计和Unity Catalog概述
第1天实验——转换一个存储过程
- 动手将一个示例存储过程迁移到笔记本
- 将临时表和游标映射为DataFrame转换
- 验证并与原始输出进行比较
第2天——高级Delta Lake与增量加载
- ACID事务、提交日志、版本控制和时间旅行
- Auto Loader、MERGE INTO模式、upsert和模式演进
- OPTIMIZE、VACUUM、Z-ORDER、分区和存储调优
第2天实验——增量摄取与优化
- 实现Auto Loader摄取和MERGE工作流
- 应用OPTIMIZE、Z-ORDER和VACUUM,并验证结果
- 衡量读写性能的提升
第3天——Databricks中的SQL、性能与调试
- 分析型SQL功能:窗口函数、高阶函数、JSON/数组处理
- 阅读Spark UI、DAG、shuffle、stage、task和瓶颈诊断
- 查询调优模式:广播连接、提示、缓存和减少溢出
第3天实验——SQL重构与性能调优
- 将繁重的SQL流程重构为优化的Spark SQL
- 使用Spark UI追踪来识别和修复数据倾斜和shuffle问题
- 对比前后基准并记录调优步骤
第4天——战术性PySpark:替换过程式逻辑
- Spark执行模型:driver、executor、惰性求值和分区策略
- 将循环和游标转换为向量化的DataFrame操作
- 模块化、UDF/pandas UDF、widget和可复用库
第4天实验——重构过程式脚本
- 将过程式ETL脚本重构为模块化PySpark笔记本
- 引入参数化、单元式测试和可复用函数
- 代码评审和最佳实践清单应用
第5天——编排、端到端管道与最佳实践
- Databricks Workflows:作业设计、任务依赖、触发器和错误处理
- 设计带质量规则和模式验证的增量Medallion管道
- 与Git(GitHub/Azure DevOps)、CI集成,以及PySpark逻辑的测试策略
第5天实验——构建完整的端到端管道
- 构建由Workflows编排的铜层→银层→金层管道
- 实现日志记录、审计、重试和自动化验证
- 运行完整管道,验证输出并准备部署说明
运营化、治理与生产就绪
- Unity Catalog治理、数据血缘和访问控制最佳实践
- 成本、集群规模、自动扩缩容和作业并发模式
- 部署清单、回滚策略和运行手册创建
最终评审、知识转移与后续步骤
- 学员展示迁移成果和经验教训
- 差距分析、建议的后续活动和培训材料交接
- 参考资料、进一步学习路径和支持选项
最低要求
- 理解数据工程概念
- 具备SQL和存储过程经验(Synapse / SQL Server)
- 熟悉ETL编排概念(ADF或类似工具)
目标受众
- 具有数据工程背景的技术经理
- 正在将过程式OLAP逻辑迁移到Lakehouse模式的数据工程师
- 负责Databricks采用的平台工程师