•加入校ACM集训队,系统训练动态规划、图论等算法,定期参加Codeforces周赛,显著提升编码效率与复杂问题拆解能力
•作为核心开发者,使用Python+Django搭建开源社区问答平台,集成Redis缓存与Elasticsearch全文检索,获院级创新创业项目优秀结题
•选修《大数据处理技术》课程,独立完成基于Spark的电商平台流量分析项目,对用户访问日志进行清洗、聚合与可视化,输出交易漏斗报告
Python大数据开发工程师数据平台开发流计算处理
北京
•设计并实现基于Spark Streaming的实时数据管道,处理每秒百万级交易日志,支撑实时风控系统
•构建分层数据仓库,利用Hive与Presto优化OLAP查询,将报表生成时间从小时级降至分钟级
•开发自动化数据质量监控系统,通过Python脚本对每日5TB数据进行一致性校验,异常数据捕获率提升至99%
•与风控业务团队协作,深入理解反欺诈策略,输出用户风险画像数据服务,减少误报率15%
•对E-MapReduce集群进行参数调优,采用列式存储与压缩技术,节省存储成本30%
高级Python大数据开发工程师流批一体架构数据中台建设
北京
•主导实时数据湖架构升级,引入Apache Hudi构建近实时数仓,支撑业务对订单状态秒级追踪,使数据新鲜度提升90%
•带领7人团队完成传统批处理向流批一体架构迁移,重构核心ETL流程,系统吞吐量提升3倍
•基于Flink与Kafka打造事件驱动型数据中台,赋能营销、物流等5条业务线,日均处理消息量达20亿
•制定团队代码规范与Code Review流程,建立技术分享双周会机制,培养2名工程师晋升为高级工程师
•预研Data Mesh治理方案,结合元数据中心与数据质量平台,提升跨部门数据信任度与复用率
•项目背景:为提升大促期间商品点击转化率,需要构建毫秒级响应的个性化推荐服务
•项目职责:负责用户行为数据实时采集、特征工程流水线开发及模型在线服务部署
•技术实现:使用Canal+Kafka捕获数据库变更,PySpark进行特征计算,Redis缓存实时画像,Azkaban调度离线模型训练
•项目成果:上线后推荐点击率相对基线提升18%,P99延迟控制在50ms内,支撑双十一峰值QPS达5万
•项目背景:原有T+1离线数仓无法满足运营对实时GMV、实时库存等指标监控需求
•项目职责:核心参与Lambda架构设计,负责实时计算模块开发与历史数据回放流程实现
•技术实现:Kafka承接全量业务日志,Flink进行多流Join与实时聚合,HBase作为实时维表存储,DolphinScheduler统一编排离线与实时任务
•项目成果:核心指标产出延迟从4小时缩短至5秒,数据一致性达到99.9%,支持了实时大屏和自动化告警等多场景
Python及数据处理生态(Pandas, PySpark) 大数据平台架构(Hadoop, Spark, Flink) 技术博客与开源贡献:
在知乎/CSDN撰写数据工程系列专栏,涵盖Airflow DAG调度、Kafka消息队列等实战内容,单篇最高阅读量5万+
作为Apache DolphinScheduler贡献者,修复ETL任务失败重试逻辑缺陷,PR被合入主分支,提升调度可靠性