
AMAZING RESUME · OPEN HORIZON
牛敬业
大数据开发实习生
188****0441niu****@***.com北京22男大数据开发实习生在职北京8k-12k •主修课程涵盖《大规模数据处理》、《数据库系统实现》、《实时流计算》等,专业绩点3.8/4.0,连续两年获国家励志奖学金。
•曾参与校级大数据工程项目,使用Spark和Kafka完成“电商日志实时分析平台”,实现每秒万条数据的处理,获优秀项目奖。
北京数云科技有限公司 - 大数据平台部数据科技公司大数据服务商
2020.07-2021.01
大数据开发实习生数据平台运维数据ETL数据仓库建设
北京
•协助运维基于Hadoop生态的数据平台,监控集群节点状态,定位并解决MapReduce任务失败等问题,保证平台99.9%可用性。
•利用Python编写数据清洗脚本,对多源异构日志数据进行解析、去重与格式标准化,采用增量处理模式,数据质量检查通过率提升至98%。
•参与构建星型模型数据仓库,使用Hive完成日活用户、订单等主题的事实表与维度表设计,优化分区与桶策略,使典型查询响应时间缩短30%。
北京智联数据科技有限公司 - 大数据开发部互联网数据智能公司实时处理技术企业
2021.02-2021.06
大数据开发实习生实时数据采集用户行为分析数据可视化
北京
•负责搭建Flume+Kafka数据采集管道,实现业务系统埋点日志准实时传输至Hadoop平台,峰值处理能力达10万条/秒。
•运用Spark SQL对海量用户行为数据进行聚合分析,构建用户留存率、转化漏斗等指标,为运营策略调整提供数据支持,使次日留存率提升8%。
•独立开发数据可视化看板,利用ECharts和D3.js制作交互式图表,展示实时关键业务指标,支持按维度下钻,提升业务部门数据消费效率。
•项目背景:电商平台需分析用户从浏览到购买的完整路径,以优化推荐算法与页面布局。
•项目职责:使用Python清洗原始点击流数据,处理量约8TB,设计会话切割逻辑,将离散日志聚合成用户行为序列。
•技术实现:基于Hadoop存储原始日志,利用Spark RDD完成路径转化统计,将结果写入Hive用户行为宽表,供算法模型消费。
•项目成果:生成了推荐系统所需的高质量特征表,使后续推荐点击率提升18%,同时输出了一份用户路径洞察报告。
•项目背景:为大型社交平台构建舆情监控系统,需对每日产生的帖子进行情感倾向实时分析。
•项目职责:开发定向爬虫采集社交媒体公开数据,累计处理约3TB文本,并进行数据脱敏与去噪。
•技术实现:运用Spark MLlib构建朴素贝叶斯情感分类器,结合NLP预处理(结巴分词、停用词过滤)提升特征质量,部署至生产环境。
•项目成果:情感分类准确率达到87%,平均处理延迟低于2秒,帮助运营团队及时响应负面舆情,客户投诉量下降15%。
对海量数据处理与系统优化保持强烈好奇,习惯用严谨的代码逻辑确保数据链路稳定可控;注重执行效率与可维护性,常在任务调优中死磕细节。熟悉分布式计算与存储生态,能快速构建批流一体的处理管道;持续关注技术演进,善于从实战中沉淀体系化方法论,希望在大数据方向深入成长。
数据工程实践与工具链:
熟练搭建Hadoop/Spark集群,掌握Shell和Python脚本实现自动化运维任务,曾独立部署3节点测试环境。
基于开源Airflow搭建数据调度系统,编写DAG实现每日TB级数据的增量ETL,保障数据时效性与准确性。