AMAZING RESUME
牛敬业
138****0000niu****@***.com北京30 岁男Python 大数据开发工程师在职北京25k-35k •在校期间专注于算法与数据结构优化,曾参加 ACM 程序设计竞赛并获省级奖项,具备扎实的代码逻辑与性能调优思维。
•主导数据库系统课程大作业,从底层实现简易存储引擎,深入理解 B+ 树索引与事务日志机制,为后续大数据存储研究打下基础。
Python 大数据开发工程师离线数仓建模ETL 流程自动化
北京
•主导公司供应链数据平台的离线数仓分层设计,利用 Python 编写标准化 ETL 脚本,自动化处理日均 TB 级业务日志,重构清洗规则后将数据交付准时率从 85% 提升至 98%。
•基于 Hadoop 生态搭建统一数据底座,针对历史积压数据开发并行处理任务,通过优化 MapReduce 分片策略,使大规模数据迁移任务的执行周期缩短了 50%。
•负责核心指标仓库的建模与维护,设计星型模型以支撑运营报表查询,通过索引优化和分区裁剪策略,将复杂多维分析的查询延迟控制在秒级。
•推动数据开发规范落地,编写 Python 代码检查工具集成至 CI/CD 流程,减少因代码不规范导致的线上事故,并定期组织内部技术复盘,提升团队整体工程化能力。
北京云端智能技术有限公司 - 大数据研发中心技术领先
2019.01-2022.06
资深 Python 大数据开发工程师实时计算架构集群资源调度
北京
•负责 SaaS 平台实时数据中台的技术选型与架构落地,引入 Flink 构建流式处理链路,实现了对用户行为事件的毫秒级采集与计算,支撑了实时推荐系统的落地。
•优化大数据集群的资源调度策略,通过动态调整 YARN 容器配额与 Spark 执行参数,在业务高峰期降低了 30% 的计算资源闲置率,显著削减云资源成本。
•主导实时计算引擎的稳定性治理,设计反压监控与故障自动恢复机制,解决了高并发场景下的数据丢失问题,确保核心业务数据零丢失,SLA 达到 99.99%。
•跨部门协作推动数据产品化,将底层数据能力封装为 API 服务供业务线调用,降低了业务团队的数据接入成本,加速了数据洞察在业务决策中的应用频率。
•该项目旨在为物流企业提供运力实时调度与路径优化服务,通过采集车辆 GPS 轨迹、订单分布及交通路况数据,实现运力资源的动态匹配。
•负责实时数据接入层开发,使用 Python 对接 Kafka 消息队列,处理日均亿级车辆位置上报数据,确保数据低延迟流入计算引擎。
•基于 Flink 构建实时计算任务,设计滑动窗口算法计算车辆负载率,结合 Redis 缓存热点数据,将调度指令下发延迟降低至 100ms 以内。
•开发可视化监控大屏,集成 ClickHouse 进行多维分析,直观展示运力热力图与异常订单分布,辅助运营人员快速响应突发调度需求。
•参与在线教育平台用户全生命周期分析项目,旨在通过深度挖掘用户学习行为数据,提升课程转化率与续费率,降低获客成本。
•负责离线数仓的维度建模与事实表设计,使用 Python 对原始日志进行清洗与标准化,构建了涵盖用户画像、课程偏好等多维标签体系。
•基于 Spark SQL 开发用户流失预警模型,通过特征工程提取关键行为指标,识别高流失风险用户群,支持运营团队进行精准召回营销。
•协助业务团队搭建自助式分析工具,将复杂 SQL 查询封装为前端配置页面,使非技术人员也能独立生成业务报表,大幅减少了数据分析需求 backlog。
我是一个对数据逻辑有天然执着的人,视代码为构建数字世界的砖石。热爱 Python 生态的简洁与高效,习惯在复杂的数据链路中梳理秩序。具备严谨的数据治理意识,对数据质量有近乎洁癖的追求,坚信技术架构的稳定性是业务增长的基石。擅长在海量数据中挖掘业务价值,不满足于简单的数据搬运,更关注数据背后的业务逻辑闭环。期待在数据驱动的场景中持续深耕,用技术沉淀创造长期价值。常怀探索之心,以实干沉淀自身价值。
技术社区建设:
维护内部开发效率工具库,封装常用数据处理组件,解决团队在数据清洗环节的重复造轮子问题,提升整体开发效率。
主导搭建部门技术知识库,沉淀核心架构设计文档与故障排查手册,撰写多篇关于大数据调优的实战文章,在内部技术论坛获得高阅读量。