牛敬业
188****3996niu****@***.com北京30男运维数据采集分析师在职北京18k-25k •参加“智能运维数据采集平台”国家级大创项目,负责开发基于Go的轻量级日志采集Agent,实现服务器性能指标与错误日志的实时推送,并通过Kafka缓冲与Prometheus对接,日均处理采集量超2TB。
•在“全国高校大数据能力竞赛”中,设计多源异构数据采集方案,运用Scrapy框架与Airflow调度,完成日志、API与数据库增量数据的统一汇聚,并针对断点续传与数据去重提出优化,获华北赛区三等奖。
北京云帆科技有限公司 - 运维数据部国家高新技术企业
2018.07-2021.12
运维数据采集分析师运维数据采集数据预处理系统监控
北京
•负责公司运维数据采集平台的日常监控与调优,通过重构部分采集节点的数据重试与缓存机制,将采集成功率从92%提升至97%以上,大幅减少了夜间值班的告警数量。
•开发了基于Python的数据质量稽核脚本,自动识别并修正异常时间戳、重复记录等脏数据,日均处理超过15TB的运维日志与指标数据,确保了分析层的输入质量。
•与业务监控团队紧密配合,针对微服务架构下的调用链数据采集需求,重新设计了Taildir Source与自定义拦截器方案,使新业务的数据接入效率提升了25%。
•按周输出《运维数据质量报告》,涵盖采集时效性、完整性、异常分布等维度,并据此推动存储端优化,报告中的改进建议被采纳率超过85%。
北京智维信息技术有限公司 - 数据产品部行业领先企业
2022.01-至今
高级运维数据采集分析师分布式采集团队建设方案定制
北京
•主导了公司新一代运维数据采集平台的升级工作,带领5人小组完成了从技术选型到落地交付的全过程,引入基于Kafka Connect的分布式采集框架,使平台的整体吞吐量提升了3倍。
•制定并推行了《运维数据采集规范V2.0》,覆盖数据格式、字段命名、采集频率等标准,并组织内部培训,半年内让组内2名初级工程师具备了独立设计复杂采集任务的能力。
•深入分析核心交易系统的性能监控短板,将关键SQL执行耗时、消息队列堆积等指标的采集延迟从分钟级压缩至2分钟以内,为实时大屏及故障自愈场景提供了可靠的数据流。
•与两家金融行业客户直接沟通其运维数据需求,定制开发了符合安全审计要求的采集接口,助力公司拓展了新的业务线,累计带来超过300万元的合同额。
•作为架构师,负责设计面向混合云环境的统一数据采集架构,采用Flume + Kafka的组合实现多源日志与指标的高效汇聚,纳管了超过2000台服务器及网络设备。
•开发了数据传输的实时压缩与断点续传模块,在弱网环境下仍能保证数据不丢失,并使整体带宽占用降低了30%。
•主导搭建了基于HDFS的冷数据存储与基于Elasticsearch的热数据查询层,支撑PB级数据的安全存储与秒级搜索,该项目上线后平稳运行至今,成为公司智能运维的基石。
•作为项目负责人,统筹数据采集、计算与可视化全链路,带领团队从CMDB、APM、日志中心等6个源头抽取运维数据,构建了统一的运维数据湖。
•运用Spark Streaming对采集数据进行实时特征计算,设计了基于历史基线的动态阈值模型,使系统性能瓶颈的提前预警准确率提升至85%以上。
•设计并落地了面向运维、研发、管理层的多角色可视化仪表盘,通过热力图、拓扑图等方式直观呈现系统健康度,帮助一线运维人员将平均故障定位时间缩短了40%。
对运维数据始终抱有刨根问底的好奇,习惯从监控曲线与日志细节里寻找系统优化的线索,享受用数据把不确定性变成确定性。做事沉稳、抗压,对线上稳定性有天然敬畏,不放过任何一次异常抖动。技术栈集中在数据采集链路、SQL调优与自动化脚本,能将分散的指标沉淀为可观测的决策依据。持续关注分布式与可观测性实践,希望在数据驱动运维的方向上长期深耕。
运维数据采集管道实践:
独立搭建基于ELK Stack的日志采集与分析管道,配置Filebeat多行采集与Logstash grok解析,将非结构化运维日志转化为结构化指标,并编写Shell脚本实现采集器健康监控与自动拉起。
在实习中主导设计异构数据库变更数据捕获方案,利用Debezium与Canal实现MySQL与MongoDB的实时增量采集,并通过Avro序列化与Schema Registry管理,降低链路耦合度,保障数据采集的稳定与高可用。