•在校期间重点钻研分布式系统与数据库原理,曾参加‘挑战杯’全国大学生课外学术科技作品竞赛,带领团队完成基于分布式爬虫的舆情分析系统并获省级奖项。
•担任学院技术社团副主席,组织多场大数据技术分享会与代码审查(Code Review)工作坊,培养了良好的技术社区影响力与跨组协作沟通能力。
某头部新能源科技集团 - 车联网数据平台组新能源硬科技
2018.07-2021.06
Hadoop大数据开发工程师数据底座重构时序数据处理资源调优
北京
•负责某新能源车企车联网大数据底座的重构,引入 Hadoop 3.x 生态,针对车路协同产生的高频时序数据进行分片存储优化,有效降低了磁盘 I/O 压力,集群资源利用率提升 25%。
•主导构建企业级数据中台,设计分层架构(ODS/DWD/DWS/ADS),清洗并标准化了来自不同车型厂商的异构日志,为上游自动驾驶算法团队提供清洗后的高质量训练数据。
•针对离线批处理任务频繁 OOM 的问题,深入分析 JVM 堆内存配置与 MapReduce 容器资源分配策略,通过参数调优将核心 ETL 作业的平均耗时从 4 小时压缩至 2.5 小时。
某智慧城市解决方案商 - 基础设施研发部智慧城市政企服务
2021.07-2023.06
Hadoop大数据开发工程师IoT数据接入流批一体化集群监控
北京
•负责某智慧城市运营中心的 IoT 设备接入层开发,基于 Hadoop 生态扩展 Kafka 消息队列,实现百万级传感器数据的高吞吐接入与实时缓冲,保障数据零丢失。
•设计并落地流批一体化处理方案,利用 Flink 替代部分 Storm 逻辑,结合 Hive 外部表实现数据的全链路追溯,支撑城市交通流量与能源消耗的实时大屏展示。
•搭建基于 Grafana 与 Prometheus 的集群监控告警体系,对 HDFS 健康度与 YARN 队列状态进行可视化追踪,将故障发现时间从小时级降低至分钟级。
•项目背景:随着互联网金融业务扩展,传统单机规则引擎无法应对毫秒级欺诈检测需求,需重构为分布式实时计算架构。
•项目目标:构建高可用、低延迟的风控计算引擎,支持复杂规则动态下发,确保交易风控决策的实时性与准确性。
•技术方案:底层采用 Hadoop YARN 进行资源调度,计算层引入 Spark Streaming 处理微批数据,存储层使用 HBase 存储用户画像标签,通过 Flink 实现复杂事件处理(CEP)。
•项目成果:系统上线后支撑每秒 5 万笔交易的并发检测,规则计算延迟控制在 50ms 以内,有效拦截了多起团伙欺诈案例,为公司挽回潜在损失超千万元。
•项目背景:为满足等保 2.0 合规要求,需对城市运营中心所有网络设备产生的海量日志进行集中存储、审计与快速检索。
•项目目标:建设统一的日志审计平台,实现 PB 级日志数据的长期归档与秒级全文检索,满足安全溯源需求。
•技术方案:使用 Flume 进行日志采集,Kafka 削峰填谷,Spark 进行日志清洗与脱敏,存储层选用 HDFS 配合 Hive 分区表管理冷热数据,检索层引入 Elasticsearch 提供快速查询接口。
•项目成果:系统成功接入 200+ 个业务节点,日均处理日志量达 500GB,查询响应时间稳定在 3 秒内,顺利通过第三方安全机构等保测评。
数据治理与特征工程:
熟悉数据血缘分析与元数据管理规范,具备设计数据质量监控规则的能力,能够识别并修复数据倾斜与脏数据问题。
有实际的特征工程落地经验,擅长结合业务场景提取高价值特征,曾协助算法团队优化模型特征库,提升模型 AUC 指标约 3 个百分点。