138****5678niu****@***.com北京30男大数据仓库开发工程师在职北京25k-35k •课程聚焦数据库原理与分布式系统,业余通过Coursera学习Hive与Spark SQL,为数据仓库建模打下方法论基础。
•带队参加全国大学生大数据竞赛,基于校园一卡通数据构建分析仓库,负责ETL设计与分层清洗,产出消费热力图与异常检测报表,获华北赛区二等奖。
•担任数据科学社副社长,策划“数据仓库运维实战”工作坊,邀请企业DBA分享SQL优化与集群监控,锻炼了技术传播与项目管理能力。
北京字节跳动科技有限公司 - 数据平台与治理部互联网大厂技术创新
2018.03-2022.05
大数据仓库开发工程师数据仓库架构数据治理Spark优化数据建模
北京
•- 主导公司数据中台的数据仓库架构演进,基于Spark和Hudi构建湖仓一体方案,统一管理多条业务线的离线与实时数据,支撑日均PB级数据查询。
•- 设计并落地多维数据模型(星型与雪花模型),引入Z-Order等索引技术,使核心决策报表的查询延迟从分钟级降低至秒级,效率提升超过40%。
•- 与产品、运营团队深度协同,梳理业务口径,构建自动化ETL流水线,通过Airflow调度数千个数据处理任务,确保TB级新增数据在小时内完成清洗、聚合与加载。
•- 编写复杂SQL与Spark SQL实现用户分群、留存分析等统计逻辑,并通过Superset开发自助式分析看板,赋能业务人员自助取数。
•- 建设数据仓库全链路监控体系,利用Grafana+Prometheus采集任务运行指标,主动发现并修复数据倾斜、小文件等问题,全年数据可用性达到99.95%。
北京快手科技有限公司 - 数据工程部互联网独角兽短视频社区
2016.07-2018.02
大数据开发工程师实时数据仓库数据湖数据质量保障自动化调度
北京
•- 参与实时数据仓库搭建,使用Flink和Kafka实现用户行为日志的实时采集与处理,单日处理数据量超过20亿条。
•- 优化数据仓库存储结构,设计分区、分桶策略并结合ORC文件格式,将重点报表的产出时间从3小时压缩至20分钟以内。
•- 与数据分析师配合,提炼用户活跃度、内容消费深度等核心指标,设计数据字典和指标体系,直接支持运营策略调整。
•- 开发Python脚本实现数据质量校验自动化,通过Great Expectations框架定义质量规则,异常数据秒级告警,使数据异常响应时间缩短70%。
•- 参与建设数据资产目录,使用Apache Atlas进行元数据管理,促进数据血缘追踪与合规使用,提升团队数据复用效率。
企业级数据中台建设与数据仓库重构项目 - 大数据仓库开发工程师
2019.01-2020.12
•- **项目背景**:公司多条业务线数据分散在独立系统中,数据口径不一致,原有数仓架构难以支撑实时分析需求,急需统一数据中台。
•- **项目目标**:重构数据仓库,制定统一数据模型,融合近10个业务域的离线与实时数据,提供高性能的即席查询与报表服务。
•- 主导技术选型,采用Hive作为离线数仓底座,Spark负责复杂计算,Hudi实现数据增量更新与查询,构建分层数据架构(ODS-DWD-DWS-ADS)。
•- 进行主题域划分与数据建模,设计50+张事实表和维度表,采用星型与雪花模型,制定数据生命周期管理策略。
•- 开发ETL任务,使用DataX进行异构数据源同步,编写Spark SQL进行数据清洗、轻度聚合,并通过Airflow编排DAG,每日调度3000+任务。
•- 与业务方共建数据产品,将用户增长、内容消费等核心指标固化到数据仓库,开发自助分析看板,降低数据获取门槛。
•- 新数仓上线后,跨业务分析查询效率提升60%,核心报表从小时级产出缩短至分钟级。
•- 整合了12个业务系统的数据,数据覆盖率提升至98%,每年节省数据集成与维护成本约200万元。
•- 支撑了用户增长分析、内容推荐效果评估等多个重点项目,数据服务调用量同比增长3倍。
实时用户画像与行为分析数据平台 - 大数据仓库开发工程师
2017.01-2017.12
•- **项目背景**:为提升个性化推荐精准度,需要构建一套实时用户行为采集与分析系统,支持秒级用户画像更新。
•- **项目目标**:搭建实时数据管道,存储用户点击、播放、互动等行为,生成多维用户画像,为推荐算法和运营活动提供数据基础。
•- 设计基于事件驱动的数据模型,包含事件事实表、用户维度表、内容维度表,采用雪花模型应对异构数据关联。
•- 开发实时采集链路,使用Flume汇聚客户端埋点日志,Kafka作为消息缓冲,Flink进行实时清洗与聚合,写入ClickHouse提供毫秒级查询。
•- 编写Hive SQL进行离线回溯,将历史行为数据与实时流结合,构建用户行为宽表,供机器学习平台使用。
•- 与数据分析师协作,定义用户生命周期、内容偏好等标签体系,开发可视化看板,直观展示用户留存漏斗和转化路径。
•- 平台日处理用户行为数据超过800GB,端到端延迟小于5秒,支撑了推荐系统的实时特征计算。
•- 提供了30+个用户标签的实时查询,帮助运营团队发现内容消费低谷时段,优化推送策略后用户次日留存率提升12%。
•- 基于用户实时行为的分群营销,使活动转化率较历史经验投放提升22%,获客成本降低18%。
着迷于数据从混沌到有序的流动,享受用严谨的架构把零散业务痕迹沉淀为可靠资产;我对数据逻辑的偏差近乎偏执,习惯在部门间模糊的需求中拆解出可工程化的数据路径。能快速厘清异构数据源的血缘与转换关系,对海量数据集的治理与作业调度效率有切身敏感,善于揪出慢查询背后的资源争用并给出低侵入的优化方案。乐于将反复出现的业务规则抽象为可复用的数据模型,并主动用脚本化手段消灭重复劳动。日常关注数据社区的技术演进,但更看重方案在现有体系下的适配与可维护性。希望在一个重视数据文化的团队中,持续把信息转化为洞察,做一名沉稳、可靠的数据工匠。
数据可视化与监控看板:
熟练掌握 Apache Superset 和 Redash,能够根据业务场景快速搭建面向运营的数据看板。例如,在电商数据仓库项目中,使用 Superset 设计用户购买路径漏斗分析,通过可视化定位流失环节,辅助运营团队调整推荐策略,使次月转化率提升5%。此外,还利用 Grafana 搭建了数据仓库任务监控大盘,实时展示 ETL 作业状态与延迟,提升运维响应效率。