基于Databricks与Spark生态的F1赛车真实数据工程项目实战

本课程依托Azure Databricks、PySpark、Spark SQL、Delta Lake、Unity Catalog、Azure Data Factory全套技术栈,结合F1赛车真实业务数据集开展完整数据工程落地实战,完整覆盖湖仓一体搭建、数据处理、调度治理全流程实操。

课程核心学习内容

  • 基于Azure Databricks与Spark Core搭建完整落地级数据工程项目,全程采用真实业务数据集开展实操教学
  • 熟练掌握Azure Databricks、Delta Lake、Spark Core、Azure Data Lake Gen2、Azure Data Factory(ADF)全套专业数据工程实操能力
  • 掌握Azure Databricks工作台实操:创建管理笔记本、可视化仪表板、计算集群、集群资源池与定时作业任务
  • 运用PySpark完成Azure Databricks内全流程数据导入、清洗、转换与结构化处理
  • 借助Spark SQL在Databricks中完成多维度数据转换、统计分析与查询开发
  • 吃透数据湖与湖仓一体两大主流架构,掌握Delta Lake落地湖仓架构完整实施方案
  • 搭建Azure Data Factory数据管道,实现Databricks笔记本自动化调用执行
  • 配置ADF定时触发器,完成管道周期调度、运行日志与异常状态全链路监控
  • 储备Azure数据工程师DP203认证考试所需Databricks、ADF核心实操技能
  • 打通Power BI与Azure Databricks数据源,实现数据可视化报表对接

前置学习要求

课程配套完整源码文件与分步实操指引,具备以下基础能力将大幅降低学习门槛:

  • 必备基础:掌握Python基础编程语法
  • 必备基础:具备基础SQL查询编写能力
  • 加分基础:了解云计算基础概念(无相关经验也可正常学习)
  • 环境要求:需拥有Azure账号,课程内提供免费试用账号注册搭建教程

课程迭代更新说明

课程上线后持续迭代优化,三大核心版本更新内容如下:

更新3:新增Unity Catalog全模块实战

新增第25、26、27三大章节,完整讲解Databricks最新一站式数据湖治理工具Unity Catalog,覆盖组件原理、配置流程、项目落地全场景实操。

更新2:适配Azure数据湖最新访问规范

新增第6、7章节,同步优化第8章节内容,对齐Databricks访问Azure Data Lake官方最新最佳实践;适配Azure学生订阅、权限受限企业订阅,降低学员项目实操门槛。

更新1:同步Databricks新版UI界面

优化第3、4、5章节内容,适配Azure Databricks新版操作界面,同步补充Databricks集群新增功能实操教学。

课程详细介绍

欢迎学习当下主流云原生数据工程工具Azure Databricks实战课程!本课程以一级方程式F1赛车真实业务数据集为载体,完整落地基于Azure Databricks与Spark Core的数据采集、处理、分析全流程项目。

本套课程是Udemy平台稀缺的完整Azure Databricks实战课程,完整学习全部章节与配套实操任务后,你可独立承接企业真实数据工程项目,深度吃透Azure Databricks核心能力;课程同步配套Azure Data Lake Storage Gen2、Azure Data Factory、Power BI配套实操教学。课程核心聚焦Azure Databricks与Spark Core,同步覆盖配套云服务的关联原理与数据源连通方案。

课程不涉及Spark流处理、Spark机器学习相关内容,全程仅采用PySpark与Spark SQL开展教学,不包含Scala、Java相关开发内容。

课程完全贴合真实数据项目开发逻辑,边讲解底层技术原理,边分步搭建Databricks业务笔记本。课程并非DP203认证专项备考课,但覆盖该认证90%以上核心实操考点,同时完整匹配Databricks认证数据工程师考核所需技术能力。

课程内容精简高效,直击核心实操要点,规避冗余理论;采用通俗化讲解方式,减少晦涩行业术语,零基础也能循序渐进入门,结业后可熟练运用整套Azure数据工程技术栈。

课程细分技术模块知识点

一、Azure Databricks 核心实操

  • 基于Azure Databricks、ADLS Gen2、ADF、Power BI搭建端到端数据工程解决方案架构
  • Azure Databricks服务创建部署,掌握云平台底层架构逻辑
  • Databricks笔记本完整使用技巧、内置工具、魔术命令实操
  • 笔记本参数传递、多笔记本串联工作流搭建
  • 集群、集群资源池、作业任务创建、参数配置与运行监控
  • 依托Azure Key Vault密钥,实现Azure存储挂载至Databricks环境
  • Databricks托管表、DBFS文件系统基础操作
  • 基于Delta Lake搭建标准化湖仓一体解决方案
  • 可视化仪表板制作,实现数据分析结果直观展示
  • Power BI对接Azure Databricks数据表,搭建可视化报表

二、Spark(仅PySpark & Spark SQL)

  • Spark底层架构、数据源API、DataFrame核心API原理与实操
  • PySpark处理CSV、标准/复杂JSON文件,批量转换为数据湖Parquet存储表
  • PySpark数据转换:过滤、多表关联、聚合统计、分组运算、窗口函数开发
  • PySpark创建本地视图、临时视图管理
  • Spark SQL数据库、数据表、视图创建与管理语法
  • Spark SQL实现数据筛选、关联、聚合、分组、窗口函数等分析逻辑
  • Spark SQL本地视图、临时视图创建与调用
  • 数据分区策略,实现全量数据刷新、增量数据加载两种主流数据同步模式

三、Delta Lake 湖仓存储

  • 数据湖仓一体发展背景,Delta Lake在湖仓架构中的核心定位
  • PySpark与SQL实现Delta表读写、更新、删除、合并操作
  • Delta历史版本、时间回溯、真空清理实操
  • 原生Parquet文件批量转换为Delta存储格式
  • 基于Delta Lake搭建稳定高效的增量数据加载流程

四、Unity Catalog 数据治理

  • 企业数据治理痛点与Unity Catalog整体功能介绍
  • Unity Catalog元存储创建,开启带统一目录的Databricks工作空间
  • 三级命名空间概念,Catalog、Schema、Table对象完整创建流程
  • 通过Unity Catalog配置、挂载外部数据湖存储并授权访问
  • 小型Unity Catalog实战项目搭建,实操数据发现、审计、数据血缘、精细化权限管控核心治理能力

五、Azure Data Factory 数据调度

  • 创建ADF数据管道,自动化调度执行Databricks笔记本任务
  • 高容错管道设计,适配文件缺失、任务异常等各类生产场景
  • 活动内依赖、跨管道依赖关系配置
  • 配置ADF定时触发器,实现管道周期性自动运行
  • 管道、触发器运行状态监控,快速定位报错与输出结果核查

课程适配人群

  • 有志于从事数据工程方向的在校学生
  • 其他IT开发岗位从业者,计划转型数据工程赛道
  • 传统本地数仓、数据工程师,希望切换至Azure云数据技术体系(含AWS、GCP其他云平台从业者)
  • 数据架构师,需要系统掌握Azure全套云数据工程技术栈
声明:本站所有资源、素材等全部来源于互联网,赞助VIP仅用于对IT资源服务器带宽等费用支出做支持,从本站下载资源,说明你已同意本条款。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。