北京工业大学 - 本科211工程双一流学科建设高校
2012 - 09-2016 - 06
•在《Web挖掘》课程中独立完成分布式电商商品爬虫,利用Scrapy-Redis实现多节点协同,突破反爬字体混淆,获得“最佳工程实践”奖。
•作为队长参加“中国大学生服务外包创新创业大赛”,设计电商竞品分析爬虫,负责动态渲染破解与数据去重,从500余支队伍中晋级全国决赛。
•加入校园大数据俱乐部,牵头构建本地生鲜电商价格监控系统,利用Selenium+Mitmproxy抓取隐藏API,持续采集三个月,支撑研究报告获校级优秀。
北京极客数据科技有限公司 - 技术研发部电商数据服务技术驱动型
2016 - 07-2019 - 12
电商爬虫工程师数据抓取自动化移动端抓包采集策略优化
北京
•为垂直电商导购平台搭建商品价格监控系统,设计多源规则引擎,使价格、库存、优惠券信息的采集频率提升至分钟级。
•针对不同商城的前端渲染差异,编写自适应解析器,并搭建动态User-Agent与IP切换层,有效降低封禁率。
•与商品运营团队共建数据需求模板,将采集流程标准化,输出结构化的竞品热销榜单、评价情感分析等中间表。
•定期重构历史上堆积的臃肿爬虫代码,引入状态机模式管理登录态与请求重试,将异常恢复时间缩短了60%。
•在团队内推动“爬虫练习靶场”实战训练,分享逆向调试经验,帮助新人快速上手XHR断点与AST解析技巧。
北京数联科脉科技股份有限公司 - 大数据研发部跨境电商数据智能
2020 - 01-至今
资深电商爬虫工程师分布式采集App逆向工程数据治理
北京
•主导设计面向跨境电商综合服务平台的分布式采集架构,支撑日均千万级商品数据的实时流水线。
•攻克移动端App的SSL Pinning与报文加密难题,通过Frida动态插桩结合自研脱壳方案,实现多端数据打通。
•构建数据质量中台,定义字段完备率、价格波动预警等指标,搭配自动化采样校验,将脏数据率控制在0.5%以下。
•重构调度中心,引入Kubernetes弹性伸缩集群,根据目标站点的访问窗口自动扩缩容,整体资源成本降低约35%。
•与市场情报团队定期对齐行业格局,推动数据采集从“被动响应”转向“主动感知”,提前发现新兴电商平台与品类机会。
•项目背景:公司为扩充自有品牌的市场情报来源,需要构建覆盖商超、社交电商、直播带货等多渠道的零售数据聚合平台。
•项目内容:作为安全采集模块负责人,制定多站点适配方案。针对SPA单页应用设计Puppeteer集群渲染方案,对商品详情页实现无头浏览器截获,对API接口则直接构造参数请求,两路数据合并写入Kafka消息队列。
•技术难点:电商大促期间流量突增导致目标站触发风控,通过自建隧道代理池+请求指纹随机化(如WebGL、Canvas指纹伪造)实现隐身访问,并引入强化学习动态调整请求间隔。
•项目成果:平台上线后可持续采集超过200个品类、80余万SKU的日频数据,字段完整率保持在98%以上。业务部门基于该数据调整了3条产品线的定价策略,季度毛利率提升2.1个百分点。
•项目背景:公司计划切入东南亚及拉美电商市场,需要构建一套符合当地网络环境与合规要求的数据采集底座。
•项目内容:独立承担海外站点爬虫开发工作。部署了新加坡、圣保罗等地的边缘节点实现就近访问,并针对Shopee、Mercado Libre等平台编写多语言解析模块,覆盖西班牙语、泰语等字符集处理。
•技术难点:部分国家要求数据采集必须提供用户知情同意,通过采取公开页面数据聚合加人工审核标注的方式,确保完全规避隐私风险;同时解决当地网络波动导致的会话中断,实现断点续传与增量采集。
•项目成果:系统稳定运行后,日均采集商品信息逾50万条,海外运营团队利用这些数据绘制了三大区域的价格弹性地图,辅助公司在目标市场首年营收达成预定目标的120%。
MySQL与MongoDB混合存储
分布式采集框架(Scrapy-Redis、Celery) 自研高精度验证码识别与风控智能预警系统:
开发基于EfficientNet与注意力定位的滑块验证码破解模块,在私有数据集上准确率达到96.3%,封装为稳定API服务,日均调用量超8万次。
构建基于LSTM的请求序列异常检测引擎,实时监控目标站点反爬特征,能在风控升级前3-8分钟发出预警,并自动切换代理与UA,降低爬虫中断率。