•加入数学建模社团,参与全国大学生数学建模竞赛,获省一等奖,擅长从数据中抽提特征并构建预测模型。
北京云速科技有限公司 - 数据运维部电商SaaS服务商
2018.07-2021.06
ETL运维工程师离线任务调度数据质量监控数据接入
北京
•负责公司电商数据平台ETL系统的日常运维,保障用户行为、订单等数据抽取、转换、加载全链路稳定,日均处理数据量达12TB,确保核心报表数据延迟在5分钟以内。
•优化离线批处理作业,通过调整Spark资源参数和分区策略,使夜间数据同步任务执行时间缩短30%,集群CPU利用率提升15%。
•与数据分析团队合作,评估并接入物流、仓储等3个新数据源,设计增量同步方案,丰富数据仓库主题域。
•搭建基于Prometheus+Grafana的ETL监控告警体系,主动发现并修复数据倾斜、脏数据等问题,全年未发生重大数据事故。
高级ETL运维工程师实时流处理技术迁移团队培养
北京
•主导公司金融数据仓库项目的ETL运维,带领三人团队完成信贷、理财、用户画像等6个数据主题域的ETL开发与日常维护,支撑风控、营销两条核心业务线。
•设计基于Airflow的ETL自动化部署方案,将作业上线时间从4小时压缩至15分钟,实现一键发布与回滚。
•推动ETL工具从DataStage迁移至Flink+Iceberg流批一体架构,针对实时授信场景定制数据清洗逻辑,处理延迟从分钟级降至秒级。
•组织部门内部技术分享,编写ETL运维规范文档,培养2名初级工程师独立承担核心链路的运维工作。
•参与实时推荐引擎项目,负责用户行为数据实时ETL管道设计与实现,为个性化推荐提供毫秒级数据支持。
•设计基于Kafka+Flink的实时数据抽取方案,从埋点、后端日志等6个数据源采集数据,峰值处理能力达8000条/秒。
•构建数据清洗与规则引擎,过滤无效流量、统一事件格式,使数据可用率达到99.5%。
•实现数据实时写入HBase和ClickHouse,供推荐模型和BI报表查询,端到端延迟控制在1秒以内。
•主导公司新旧数据仓库切换项目,负责50TB历史用户数据的清洗、转换与迁移。
•制定分批次并行迁移方案,开发自动化校验脚本,确保数据完整性和主键唯一性。
•利用分区并行和增量同步技术,将原计划6周的数据迁移工作缩短至4周完成,业务中断时间仅2小时。
•建立迁移后数据质量看板,对核心指标多维度核对,保障新旧系统切换后报表口径一致。
Hadoop/Flink基础运维
ETL工具(Informatica/Airflow) 数据治理与监控:
定制数据质量核查框架,利用Python脚本每日对比上下游表行数、校验关键字段空值率,并输出可视化报告,将数据延迟发现时间缩短至分钟级。
在ETL作业中嵌入断点校验逻辑,结合消息队列重试策略,使因格式错误导致的数据截断问题降低90%,稳定支撑下游分析师日常作业。