北京工业大学 - 本科211工程双一流学科建设高校
2012.09-2016.06
•深入学习了分布式系统、编译原理、数据库内核等课程,对数据一致性、并发控制和查询优化产生了浓厚兴趣,主动在课后实验了基于LSM树的小型存储引擎,巩固了底层认知。
•作为项目发起人,带领3人小组开发了校园信息聚合平台,其中的爬虫模块负责实时抓取校内各学院通知、论坛招聘帖,并利用Java多线程与Redis去重,日均处理5万条数据,该项目获评院级优秀实践成果。
•连续两年参加“蓝桥杯”全国软件和信息技术专业人才大赛,针对Java组的高并发编程和算法优化题目进行了专项训练,获得省赛二等奖,这段经历强化了在资源受限场景下写出高效、稳健代码的工程意识。
北京某数据科技有限公司 - 技术研发部企业服务数据智能公司
2016.07-2019.06
Java爬虫工程师Java爬虫开发数据采集引擎反爬对抗
北京
•主导公司舆情监控平台数据采集模块的构建,基于Java和HttpClient、WebMagic研发了一套可配置的抓取引擎,覆盖财经、社交媒体等十余个信源,实现高频、准实时的信息入库。
•通过线程池调度与布隆过滤器去重,对采集链路进行精细化改造,使单日有效数据吞吐量提升约35%,同时降低了对下游服务的压力。
•针对验证码、请求频率限制等反爬约束,设计了一套自适应的策略中心,集成代理资源池与Cookie热更新机制,保障了在严格风控环境下的采集成功率与持续运行稳定性。
•与数据开发团队配合,利用Kafka和Spark Streaming对采集数据进行清洗和特征提取,将原始半结构化数据加工为可用的分析指标,为舆情预警提供实时数据支撑。
北京某互联网科技有限公司 - 大数据研发部互联网头部企业创新型企业
2019.07-2022.06
高级Java爬虫工程师高级Java爬虫分布式调度智能爬虫策略
北京
•带领小组完成证券行情数据统一采集平台,设计并落地了基于ZooKeeper和消息队列的分布式爬虫架构,支持对多个交易所公示页面及财经门户的百万级数据分钟级同步。
•引入强化学习思路对爬虫调度策略进行动态调整,结合历史响应特征预测目标站点的风控节点,使人工介入频次降低40%,显著提升了爬虫的自动化运维水平。
•重构数据同步链路,采用增量快照与版本号比对机制,有效避免了全量抓取造成的资源浪费和存储膨胀,同时将行情数据的时效性偏差控制在秒级。
•负责技术方案评审与新技术引入,在团队内推动无头浏览器集群、智能解析等实践,并沉淀了爬虫开发规范,为后续数据中台建设提供了重要的技术积累。
•项目背景:构建一套面向钢材、能源等大宗商品的价格监测平台,实时抓取多个行业门户及交易平台的报价、库存等数据,为企业的采购决策与成本控制提供依据。
•技术实现:采用Java作为主力语言,结合OkHttp与WebMagic定制多级翻页爬取逻辑,针对不同站点设计扁平化与树形解析规则,并借助XPath和正则表达式实现高精准字段提取。
•反爬对抗:针对目标网站频繁变换的Cookie校验、动态令牌和验证码,搭建了基于Selenium Grid的浏览器渲染集群,并训练了一个轻量级CNN模型用于验证码自动识别,保障了在复杂人机验证环境下的持续采集能力。
•数据处理:将采集到的非结构化数据通过管道清洗、补齐和标准化后存入ClickHouse,并利用Elasticsearch建立全文索引,为业务方提供多维度的价格走势分析和异动监控。
•项目成果:累计采集了超过500万条商品报价记录,数据完整度达到98%以上。帮助采购部门缩短了信息搜集时间,并通过比价模型发现了多个成本优化机会,直接支撑了年度采购策略的制定。
•项目背景:为一家投资研究机构打造政策信息聚合平台,实时抓取政府部门、行业协会及头部智库的公开政策文件与解读文章,并自动生成摘要,以提高研究员的信息获取效率。
•技术架构:采用分布式爬虫框架,基于消息队列和Redis实现任务分发与状态管理,利用Docker Swarm进行容器化编排,支持按需弹性扩缩容,确保在政策发布高峰期也能稳定运转。
•数据采集:针对不同网站的HTML结构、PDF附件以及异步加载内容,分别使用Jsoup解析、PDF解析库和Playwright进行无头浏览器抓取,重点攻克了动态签名和链接失效等难题。
•数据清洗与分析:编写了一套文本规范化流水线,对采集内容进行繁简转换、格式清洗和实体识别,并调用自然语言处理模型自动生成摘要和关键政策标签,减轻了人工标注负担。
•项目成果:每日稳定更新超过2万条政策公告,端到端延迟控制在30分钟以内。通过智能摘要和标签功能,研究员检索目标政策的时间缩短了60%,有效提升了研究报告的时效性与覆盖面。
技术创新奖(2021年度,基于智能策略的自动化采集方案) 反爬攻防与自动化运维实践:
持续关注爬虫与反爬的对抗演进,业余基于Java搭建了验证码对抗实验环境,针对滑块和点选验证码实现了一套结合CNN与行为模拟的通过方案,使本地自动化通过率稳定在80%以上;同时利用InfluxDB和Grafana对爬虫集群的请求延迟、失败率建立监控,探索出集主动探测、策略切换与自动恢复于一体的爬虫运维方案,显著降低了人工干预频率。