•• 完成《大数据处理技术》《机器学习基础》等核心课程,独立完成基于TensorFlow的交通流量预测项目,获校级创新实践二等奖;
•• 担任数据科学俱乐部技术部长,组织Python编程工作坊,带领12名成员完成3个商业数据集分析案例;
•• 参与校企合作智慧城市项目,负责空气质量数据可视化模块开发,成果被纳入地方环保局监测系统。
Python数据分析师工业数据分析Python工程化
北京
•• 负责制造业设备运维数据采集系统的搭建,设计ETL管道实现PLC设备日志的实时解析与存储,使数据延迟从小时级降至分钟级;
•• 使用Python开发预测性维护模型,结合时序分析与异常检测算法,提前识别设备故障风险,降低停机损失约18%;
•• 协同产线工程师优化MES系统数据接口,建立多维度的生产效能看板,帮助管理层实现动态产能调配;
•• 参与数据中台微服务化改造,用Celery异步任务框架重构批处理流程,提升系统吞吐量40%并减少内存占用。
高级Python数据分析师金融风控建模大数据架构
北京
•• 主导金融科技公司反欺诈模型迭代,基于Spark处理千万级交易流水,构建图神经网络模型识别团伙欺诈行为,命中准确率提升25%;
•• 设计数据血缘追踪系统,利用Airflow DAG可视化数据流转路径,缩短异常排查时间至30分钟内;
•• 推动数据湖架构升级,整合Hive与ClickHouse实现冷热数据分层存储,降低70%的存储成本;
•• 组建跨职能数据小组,制定《数据标注规范手册》,培训业务人员掌握基础分析能力,沉淀可复用的分析模板12个。
•• 项目背景:某新能源车企需建立动力电池全生命周期健康度预测体系;
•• 数据处理:通过CAN总线协议解析车辆充电/放电曲线数据,使用Dask处理PB级历史数据,提取SOC/SOH特征参数;
•• 模型构建:采用LSTM与随机森林融合算法,预测电池衰减趋势,模型R²达0.91,支持个性化换电建议;
•• 业务应用:将模型集成至车载诊断系统,实现实时健康度评分,助力售后部门提前介入维护,客户满意度提升22%。
•• 项目背景:某连锁餐饮品牌希望优化门店选址策略;
•• 数据整合:融合高德POI数据、商圈客流热力图及竞品分布信息,构建多维度地理特征库;
•• 算法实现:使用XGBoost分类器预测门店盈利概率,结合SHAP值解释关键影响因素,模型AUC达0.89;
•• 成果落地:指导新门店布局规划,使单店月均营收较原选址方式提升34%,选址决策周期缩短60%。
数据库优化(PostgreSQL/MongoDB) 技术社区活跃者:
• 在GitHub维护数据清洗工具库,累计提交PR 28次,其中7项被PyData官方项目采纳;
• 撰写《工业物联网数据预处理指南》技术文档,被知乎专栏收录并获2.3万次阅读;
• 参与Apache Arrow基金会线上研讨,就列式存储优化方案提出3条改进建议。