•系统掌握计算机组成原理、编译原理、数据库系统等核心课程,对分布式存储与计算框架(如HDFS、Spark)有深入理解,为爬虫后期数据清洗与存储打下坚实基础。
•代表院系参加全国大学生数学建模竞赛,获省级一等奖,负责数据预处理与模型求解,通过协作快速迭代出有效方案,大幅提升复杂场景下的抽象与拆解能力。
•主导校园二手交易信息聚合爬虫项目,基于Scrapy-Redis构建分布式采集集群,日均抓取50万+商品数据,并利用Bloom Filter进行URL去重,项目获校级优秀毕设,展现了完整的工程落地能力。
北京某金融科技有限公司 - 技术研发部金融科技数据服务商
2016.07-2019.12
金融爬虫工程师金融数据抓取架构设计分布式爬虫开发反爬对抗方案
北京
•• 负责设计与开发金融数据采集系统,针对交易所公开数据、财经资讯平台及行业报告等来源,制定多源异构数据抓取策略,累计采集超过5亿条金融数据,涵盖期货、外汇、指数等品种,为投研决策提供坚实数据基础。
•• 持续优化采集性能,引入Scrapy-Redis分布式架构与消息队列解耦,搭建动态IP代理池并实现浏览器指纹随机化,成功将整体采集效率提升40%,同时将目标网站封禁率降低至0.3%以下。
•• 与数据产品团队紧密配合,根据业务需求调整抓取规则与数据清洗逻辑,建立数据质量准入标准,确保入库数据满足后续分析加工要求。
北京某大型金融集团 - 信息技术部金融控股集团知名企业
2020.01-至今
资深金融爬虫工程师系统架构升级技术团队组织实时行情数据获取
北京
•• 主导公司爬虫中台的升级重构,引入Kafka流处理与微服务架构,将原有的单体爬虫改造为弹性可扩展的采集集群,支撑日均数千万级金融行情数据的稳定抓取,运维成本降低30%。
•• 带领小组攻克高频交易数据采集难题,针对股票逐笔成交、Level-2深度行情等实时数据,设计基于FIX协议与WebSocket的混合接入方案,将数据延迟控制在10毫秒以内,满足量化策略的实时性要求。
•• 搭建数据质量监控体系,开发自动化数据校验管道与可视化看板,对采集数据的完整性、准确性及一致性进行实时监控,异常数据自动告警并触发修复流程,保障下游业务的数据可靠性。
•• 项目背景:为支撑全球市场投资研究,需从NYSE、NASDAQ、LSE等主要交易所及专业财经平台批量获取上市公司财报原文和关键财务指标。
•• 技术实现:采用Python + Playwright处理动态渲染页面,结合Scrapy框架进行任务调度,利用BeautifulSoup与正则表达式解析异构文档。接入海外住宅代理网络,并实现请求特征随机化,有效规避区域访问限制。
•• 项目成果:成功采集超过3000家海外上市公司的季报、年报数据,数据准确率达99.2%,为海外投资团队提供了丰富的可比分析素材,辅助其发现多个价值标的,相关策略报告产生显著收益。
•• 项目背景:社交媒体舆情对短期市场波动影响加剧,公司需实时获取微博、雪球、东方财富等平台的金融相关讨论,用于市场情绪分析与风险预警。
•• 技术实现:设计分布式爬虫架构,以Scrapy为核心,结合Kafka实现任务分发与结果归集。针对平台的请求频率限制与验证码,引入基于深度学习的OCR识别模块,验证码识别准确率达95%以上,并自研动态请求间隔算法。
•• 项目成果:实现覆盖100余个金融话题的实时监控,日均采集舆情数据超10万条,为情绪模型提供充足输入。系统上线后成功预警多次市场异动,帮助公司提前调整仓位,规避潜在损失。
数据安全与隐私保护实践:
深入研读《数据安全法》《个人信息保护法》及《金融数据安全 数据安全分级指南》,在采集任务启动前输出合规风险评估报告,明确禁采字段与频控边界,形成可复用的合规准入清单。
自研数据脱敏与分级存储模块,对身份证号、手机号、卡号等敏感字段自动进行掩码或哈希处理,并根据数据敏感等级实施热、温、冷分层存储,确保采集链路无明文泄露风险。
每季度牵头组织数据安全攻防演练与法规更新培训,通过沙箱模拟未授权爬取与越权访问场景,使团队全员具备合规红线意识,连续两年所负责数据产品零通报、零处罚,有效护航业务稳健增长。