AMAZING RESUME · SOFT RADIUS
牛敬业
Python爬虫助理开发
188****4693niu****@***.com北京25男Python爬虫助理开发在职北京12k-18k •独立构建分布式校园资讯聚合爬虫系统,采用Scrapy-Redis实现千万级网页数据的增量抓取与去重存储
•荣获中国大学生计算机设计大赛省级一等奖,设计基于FastAPI的实时弹幕处理服务,支持万级并发写入
•参与腾讯云开发者社区开源项目,主导完成API网关模块的重构,将接口响应延迟从200ms压缩至30ms
Python爬虫助理开发医疗数据采集分布式架构设计
北京
•协同高级开发工程师完成医疗行业数据采集系统迭代,参与某三甲医院患者流量监测系统开发
•设计多任务并发爬虫架构,结合Redis队列实现百万级日活数据采集,较传统方案效率提升40%
•突破某医院官网动态加密防护,通过WebDriver自动化模拟用户行为链,成功获取非公开API接口
•建立数据质量校验流水线,整合Pandas与正则表达式实现实时清洗,将脏数据率控制在0.5%以下
北京明略数据分析股份有限公司 - 爬虫研发部数据服务商
2023.03-2023.12
Python爬虫助理开发金融数据采集集群化部署
北京
•主导金融行业舆情监控系统开发,针对证券机构官网实施非侵入式数据抓取
•创新应用Scrapy-Redis实现集群化部署,通过动态IP池与请求指纹轮换绕过WAF拦截
•开发HTML结构自适应解析引擎,兼容5种不同排版模板,解析准确率提升至92%
•与风控团队联调数据管道,设计增量更新机制将数据延迟缩短至15分钟级
•面向药监局官网构建动态数据采集系统,破解验证码识别与表单自动填充技术
•采用Playwright实现JS渲染,处理SPA架构下的异步加载数据,数据完整率达98%
•开发增量爬取算法,通过ETag校验避免重复请求,节省70%网络带宽消耗
•部署Kubernetes容器化服务,支持弹性扩缩容应对监管政策变更期的数据洪峰
•针对证监会公示平台开发专用爬虫,突破PDF文件流式解析与表格结构重构
•设计多层级代理调度策略,结合Selenium Grid实现跨地域IP自动切换
•构建数据血缘追踪系统,记录每条数据的来源路径与处理过程,满足合规审计需求
•集成Elasticsearch实现近实时查询,支持按营业部、产品类型等多维度交叉检索
热爱编程逻辑之美,享受通过Python构建数据采集系统的成就感。注重代码整洁与架构设计,习惯用自动化脚本提升重复性工作效率。对反爬虫机制有敏锐嗅觉,擅长通过动态策略突破技术壁垒。具备跨团队协作经验,能在需求模糊阶段快速定位技术难点。持续学习分布式爬虫与大数据处理技术,未来希望深耕数据智能领域。
Python后端与数据抓取:
精通Scrapy框架高级特性,实现动态渲染页面抓取与反反爬策略,单日稳定采集数据量突破500万条
熟练使用Django REST Framework搭建RESTful API服务,集成Redis缓存层将查询响应时间缩短70%
具备多线程/协程编程实战经验,优化过异步爬虫调度算法,使数据采集效率提升3倍并降低服务器负载