•作为队长带队参加中国大学生服务外包创新创业大赛,主导构建电商数据采集与清洗流水线,利用 Scrapy 抓取多源商品信息并通过 Pandas 进行去重、缺失值处理,最终进入区域赛决赛,深刻体会到数据质量对分析结果的决定性影响。
•课余与同学合作开发校园失物招领小程序,独立负责数据库架构设计与操作日志采集模块,基于 MySQL 触发器 + Kafka 实现用户行为日志的准实时收集,并编写存储过程定期清理过期记录,积累了 DBA 开发与数据采集的实战经验。
•选修《实时数据处理与流计算》课程,以交通卡口数据为场景完成课程设计,使用 Flume 采集模拟传感器数据,经 Kafka 缓冲后消费至 ClickHouse,并利用自研脚本对车牌和轨迹数据进行清洗与格式标准化,成果被纳入课程示范案例。
北京惠购科技有限公司 - 数据研发部新零售科技数据驱动
2015.07-2018.12
数据采集与清洗DBA开发工程师数据采集引擎数据清洗规则设计DBA运维实时数据处理
北京
•负责公司零售业务线的数据采集链路,基于Python和Flink搭建了覆盖门店POS、供应链ERP、线上商城日志的实时与批量采集管道,日均处理数据量达40GB,将数据延迟控制在3秒以内,确保业务大屏和库存预警的实时性。
•主导数据清洗工坊的设计与落地,针对会员信息、交易流水、物流轨迹等数据,沉淀了包含空值校验、格式归一化、关联性验证在内的30+清洗规则,通过自研的SQL脚本与Python组件,将下游数据可用率从92%提升至99.2%,大幅减少了数据团队的二次排查成本。
•参与核心数据库的运维优化,针对MySQL和Greenplum集群,定期进行慢查询分析、索引重建和表分区调整,将核心报表的查询响应时间从8秒缩短至2秒,并配合业务高峰完成数据库扩容,零故障支撑了双十一大促。
•与商品运营、供应链团队形成敏捷协作模式,通过快速理解业务痛点,独立开发了库存健康度分析、门店复购率预测等数据模型,并输出可视化的临时查询页面,帮助业务方在选品节奏和补货决策上获得及时的数据支撑。
北京每日鲜科互联网有限公司 - 大数据研发部生鲜电商大数据应用
2019.01-2021.06
高级数据采集与清洗DBA开发工程师数据架构设计数据管道治理数据质量监控分布式数据库
北京
•带领4人团队,重构公司生鲜电商平台的数据采集与清洗架构,引入Kafka+Structured Streaming实现高吞吐的实时采集,将日均数据处理能力提升至3TB,同时通过增量采集与文件合并策略,将清洗环节的计算资源消耗降低了40%。
•负责数据库架构的升级与治理,主导从单一MySQL到分库分表+TiDB的混合架构迁移,设计了按城市哈希和用户ID取模的分片策略,在数据量增长10倍的情况下,依然保持核心交易查询的亚秒级延迟,且迁移过程实现业务零中断。
•建立数据质量管控闭环,定义了数据完整性、一致性、及时性等6大维度20余项指标,并基于Grafana+Prometheus开发了数据质量监控驾驶舱,使数据异常平均发现时间从4小时缩短至15分钟,推动数据质量问题回溯率提升至95%。
•深度参与新品孵化,为社区团购、预售自提等业务设计数据底座,从埋点规范、采集通道到清洗规则均提前介入,确保新业务上线首日数据落地即可用,并持续跟踪数据表现,为产品迭代提供数据信心。
连锁零售企业数据中台采集与清洗项目 - 项目负责人
2019.03-2019.09
•该项目为某全国连锁零售企业搭建数据中台的数据采集与清洗底座,以支撑智能补货、会员画像和门店运营分析等核心场景。
•作为项目负责人,我深入调研了门店POS、线上小程序、会员系统、第三方外卖平台等15个数据源,梳理出差异化的采集频率和清洗要求,并输出详细的技术方案。
•设计了混合采集架构:对结构化数据采用Canal+MySQL Binlog实时同步,对半结构化日志采用Filebeat+Kafka+Logstash管道,并利用Python多线程爬虫采集竞品价格,整体日均采集数据量达80万条。
•制定了三级数据清洗规范:基础清洗(去重、缺失值填充、格式标准化)、业务清洗(促销分摊逻辑、异常退单剔除)、一致性清洗(跨系统会员ID打通),通过Airflow编排清洗任务,最终交付数据准确率达到99.5%。
•在项目推进中,我协调了数据开发、门店运营、IT基础架构等5个角色的协作,通过周会和看板透明化进度,及时响应业务方对会员标签、动销率等指标的调整需求,项目上线后,支撑了门店缺货率下降12%和会员复购率提升8%。
•此项目针对某医疗健康集团数据仓库长期存在的采集链路不稳定、数据质量差、报表产出延迟等问题,进行系统性治理。
•作为技术骨干,我首先梳理了上游HIS、EMR、LIS等医疗系统的数据接口,发现原有采用定时全量拉取的方式导致数据延迟和IO压力,因此改用Change Data Capture与消息队列,实现患者就诊记录、医嘱等核心数据的实时捕获,采集延迟降至10秒以内。
•在清洗环节,针对医疗数据强合规、高精度的特点,我设计了基于规则引擎的清洗流程,植入药物剂量合规性校验、诊断编码映射、重复检查记录过滤等40余条专业规则,并引入随机森林模型识别异常计费数据,将数据错误率从0.8%降至0.02%以下。
•同时对Oracle数据仓库进行性能优化,重构了就诊事实表的分区键,建立复合索引和物化视图,并优化了20余条核心ETL任务的SQL,使每日报表产出时间提前了3小时,重点查询响应时间缩短60%。
•项目结束后,该集团的数据仓库稳定支撑了医保控费、临床科研等分析,得到了客户CTO和数据中心的书面感谢,并复购了后续的运维支持服务。
实时数据采集(Flume/Kafka/Logstash)
分布式数据库(MySQL/TiDB/OceanBase)
数据采集监控与运维看板:
熟练使用 Grafana 与 Prometheus 搭建数据采集任务的全链路监控仪表盘,实时展示爬虫吞吐量、清洗错误率以及数据库连接池状态,并配置 Alertmanager 在管道堵塞或数据延迟时通过企业微信告警,大幅缩短故障响应时间。
曾为内部数据工场设计质量分析看板,将清洗前后的字段缺失率、重复率、格式异常数等指标以时间序列和热力图呈现,帮助数据团队快速定位源头问题,推动上游系统修复,使主数据库的入库数据合格率提升至 99.5%。