•在主修课程中,重点深耕计算机网络与数据库系统,成绩位列年级前 20%。曾参与校 ACM 协会,主导设计并实现了校内教务信息的可视化看板原型,负责后端接口开发与前端数据渲染。
•此外,担任班级技术委员,组织多期 Python 编程工坊,帮助同学快速上手数据分析基础。
•参与公司内部舆情监测系统的数据采集模块开发,编写 Python 脚本实现多源信息抓取,覆盖社交、新闻及论坛等多个平台,日均采集数据量达[X]万条。
•通过优化请求调度算法与异步处理逻辑,显著提升数据采集效率,使整体爬取速度提升[X]%。
•针对目标网站的动态渲染与频率限制,综合运用 IP 代理池、请求头随机化及验证码处理技术,保障采集任务的稳定性。
•协同数据分析师对原始数据进行清洗与格式转换,确保入库数据的准确性,为后续舆情分析与报告生成提供可靠依据。
Python后端开发实习生Django框架接口开发
北京
•参与公司内部讲师管理平台的后端模块开发,基于 Django 框架设计并实现核心业务接口。
•负责课程数据的数据库设计与维护,使用 MySQL 存储业务数据,通过索引优化与慢查询分析,使关键查询响应时间缩短[X]%。
•编写并维护单元测试与集成测试脚本,提升代码覆盖率,保障核心功能模块的稳定性。
•与前端团队紧密配合,定义 RESTful API 接口规范,确保前后端数据交互的高效与准确。
•项目旨在构建学术资源数据库,为研究人员提供便捷的文献检索服务。
•负责设计分布式爬虫架构,采用 Scrapy 框架结合 Redis 实现任务的异步调度与数据暂存。
•针对部分学术网站的访问限制,研究并实现了基于动态代理的请求分发机制,有效规避反爬策略。
•实现了对多所高校与科研机构官网的解析,成功提取论文标题、作者、摘要、关键词等核心元数据。
•最终完成了[X]个学术网站的结构化数据采集,累计入库文献[X]万余篇,为平台的智能检索与推荐功能奠定了数据基础。
•独立设计并编写了数据采集脚本,利用 Python 的 Requests 库发送请求,通过正则表达式与 XPath 解析目标网页。
•实现了股票行情、公告资讯、分析师报告等关键金融信息的结构化提取。
•考虑到金融数据的时效性要求,配置定时任务,实现了对市场数据的准实时抓取与入库。
•累计采集并处理各类市场数据[X]万条,为机构的量化分析与投资决策提供了及时、准确的数据支持。
分布式系统认知:
深入理解分布式系统的核心思想,学习过集群管理与负载均衡相关概念。能够运用 Redis 等中间件协助处理爬虫任务的分发与状态同步,以提升整体采集系统的并发处理能力与稳定性。