188****4274niu****@***.com北京30男中级大数据开发工程师在职北京25k-35k •参加校内算法竞赛团队,负责数据预处理与特征分析部分,获得校级二等奖,积累了Python与早期数据处理经验。
•参与物流行业实时数据中台建设,重构原有离线ETL管线为Lambda架构,使核心报表产出时效缩短40%。
•基于Flink与Kafka搭建实时清洗与分发通道,支撑日均近50亿条运单轨迹数据的毫秒级延迟处理。
•联合业务方梳理指标口径,设计20余个主题域宽表,直接赋能运营调度与时效监控看板。
•调研并落地Apache Hudi作为增量更新引擎,解决订单状态频繁更新的数据一致性问题。
北京安诚保险科技服务有限公司 - 大数据开发部保险科技
2021.01-至今
•主导保险行业数据仓库升级项目,带领4人小组完成旧版离线数仓向维度建模新体系的迁移。
•重新规划数据分层与事实表粒度,消除跨主题冗余存储,整体存储占用下降25%,常用分析场景查询效率提升50%。
•制定开发规范与代码评审流程,指导团队成员掌握Spark SQL优化技巧,减少线上慢查询70%以上。
•协同精算与产品部门,将风险特征宽表封装为自助分析数据集,支撑车险定价和理赔反欺诈模型迭代。
•项目为某头部生鲜连锁企业构建全链路供应链分析系统,覆盖采购、仓储、配送等环节。
•采用Canal监听MySQL binlog并写入Kafka,结合Spark Streaming实现库存变动及订单状态近实时同步。
•主导离线数仓建设,使用Hive按星型模型设计销售主题与库存主题,预计算上百个聚合指标,支持多维下钻。
•开发面向区域经理的移动端驾驶舱,利用ECharts绘制损耗趋势、周转天数等图表,辅助每日补货决策。
•参与保险公司理赔反欺诈系统升级,负责特征工程流水线与数据服务接口的开发。
•清洗并关联保单、报案、查勘及第三方信用等多源异构数据,使用Spark处理近5年历史案件数据约120TB。
•设计案件关联图谱特征、时序行为特征等超过200维,通过特征重要性评估筛选后,模型KS值提高0.12。
•将特征计算逻辑部署为Flink作业,接入实时报案流,实现毫秒级欺诈评分输出,同步推送高风险预警至调查员终端。
热爱大数据技术,对数据流转与计算效率有执着追求,习惯从底层原理理解框架;数据敏感度高,善于从业务指标中定位技术瓶颈,注重代码健壮与性能优化;具备扎实的数据建模、流批处理与调优能力,能在复杂场景下快速落地可靠方案,希望在数据开发领域持续深耕。
业务洞察呈现:
熟练运用Quick BI与Apache Superset搭建自助分析门户,曾针对履约时效专题设计下钻路径与预警色阶,使运营团队能独立定位延迟根因。
注重图表叙事逻辑,善于将复杂数据关系转化为清晰的信息图,多次在跨部门汇报中帮助非技术同事理解数据结论。