•在校期间,系统学习了计算机网络、数据库原理、移动应用开发等核心课程,并作为核心成员参与国家级大学生创新创业项目,主导开发了基于Mitmproxy与Appium的移动端自动化数据采集框架,实现了对主流电商App商品信息的实时抓取与结构化。
•组队参加全国大学生人工智能大赛,负责移动端逆向与数据接口解析,通过Xposed模块绕过SSL Pinning并解密网络流量,获得全国三等奖,锻炼了逆向工程与快速原型开发能力。
•连续两年担任学院爬虫兴趣小组组长,组织技术分享会讲解Scrapy、Selenium与Cookie池管理,指导成员完成校内讲座信息聚合小程序,具备较强的技术传播与团队组织能力。
北京新锐信息技术有限公司 - 技术研发部信息技术服务高成长性企业
2015.07-2018.12
移动爬虫工程师移动端数据采集爬虫策略优化安全对抗
北京
•主导设计并开发公司新一代移动端数据采集平台,重构爬虫策略,将日均有效抓取量提升至百万级。
•针对不同安卓应用的自定义SSL Pinning和签名校验,创新性地实现基于Xposed的动态反制方案,使绕过成功率达到95%以上。
•与业务分析团队建立实时数据校对机制,通过异常检测算法自动标记脏数据,确保数据交付准确率超过99.5%。
•引入Headless浏览器渲染集群与智能调度算法,显著降低单条数据采集成本,并推动团队技术分享与工具链升级。
北京某大型互联网公司 - 数据技术部科技公司行业头部
2019.01-2021.12
高级移动爬虫工程师移动端爬虫架构分布式采集协议逆向
北京
•带领5人团队完成多个千万级移动爬虫项目,负责技术方案评审、代码规范制定及进度风险管控。
•重构原有单体爬虫为容器化分布式架构,利用Kubernetes实现弹性伸缩,数据抓取吞吐量提升60%。
•深入逆向分析短视频类App的私有二进制协议,通过Frida与静态插桩技术成功还原其请求逻辑,获取关键业务数据。
•搭建全链路监控与自愈系统,集成Prometheus与Grafana,对爬虫存活率、任务积压等指标进行实时预警,故障恢复时间缩短至分钟级。
某在线零售平台移动端商品数据采集项目 - 项目负责人
2016.05-2016.10
•该项目需持续采集主流电商App的商品详情、促销活动及用户评价,为公司的竞品分析系统提供数据底座。
•作为项目负责人,设计了一套基于代理漫游与设备指纹伪造的爬虫策略,绕过平台对单设备高频访问的限制。
•利用Appium集群模拟真实用户滑动、点击行为,并注入自定义脚本拦截网络请求,解决异步加载与增量更新难题。
•对采集的非结构化文本进行智能分类与实体抽取,结合价格波动曲线,为选品团队输出竞品动态日报,辅助定价决策。
某社交媒体平台移动应用数据采集项目 - 核心开发人员
2020.03-2020.08
•参与构建针对头部社交App的用户生成内容及关系链采集系统,目标是支撑平台的舆情监控与社区发现。
•通过逆向分析客户端与服务器间的加密API调用,采用Hook技术改写请求参数,实现了对私密账号内容的合规抓取。
•开发了基于HBase+Elasticsearch的数据存储与检索层,配合增量采集与布隆过滤器去重,数据时效性控制在10分钟以内。
•与数据挖掘团队协作,将清洗后的行为数据应用于用户影响力模型与传播路径分析,为App的推荐算法迭代提供了关键特征。
移动端数据采集与反爬对抗系统:
擅长移动端高并发采集系统的架构设计,能够基于Kafka与Kubernetes构建弹性伸缩的采集集群,实现多设备协同任务调度,有效应对日采千万级数据的吞吐与容错需求。在实际项目中,通过动态设备指纹轮换与请求签名算法,将采集成功率提升至99.2%,并降低了70%的IP封禁率。