•负责湖北省自然科学基金课题“面向边缘推理的轻量化CNN加速器设计”,独立完成Winograd卷积运算单元的RTL实现与资源评估,在Xilinx ZCU104上实现126GOPS吞吐量,成果发表于《电子与信息学报》
•带队参加全国研究生电子设计竞赛,作品“基于Zynq的实时目标检测与跟踪系统”融合YOLOv2剪枝与FPGA流水线,完成软硬件协同设计,获华中赛区一等奖及全国总决赛三等奖
中兴通讯股份有限公司 - 无线产品线通信设备巨头上市公司
2017.07-2021.12
FPGA算法开发工程师5G基站FPGA开发算法架构设计
北京
•• 主导公司5G基站基带处理FPGA加速板卡的算法开发,针对大规模MIMO波束赋形算法进行架构重构,通过流水线融合与资源复用,使处理时延降低40%,板卡功耗降低25%,成功支撑新一代5G宏基站量产
•• 带领3人算法开发小组,负责项目技术路线制定与关键模块攻关,建立内部算法设计评审机制,组织专项技术分享12次,培养出2名高级FPGA开发工程师
•• 与硬件、射频团队深度协同,完成Xilinx Zynq UltraScale+ RFSoC芯片选型及JESD204B接口规范制定,推动产品从原型验证到批量交付,年出货量超5万片
北京字节跳动科技有限公司 - 基础架构部互联网大厂技术驱动
2022.01-至今
高级FPGA算法开发工程师边缘AI推理FPGA IP核开发定点化优化
北京
•• 负责公司自研“边缘AI推理加速平台”的算法移植与性能优化,针对MobileNet-SSD模型进行INT8定点化与通道剪枝,在保持mAP损失<3%的前提下,推理吞吐量提升60%,平台已在智慧零售、工业质检场景部署300+节点
•• 主导开发FPGA高速数据通路IP核(支持PCIe Gen4 x8、25G Ethernet),完成DMA引擎与协议解析的硬件实现,在Xilinx Alveo U200加速卡上实现端到端传输带宽达理论峰值92%
•• 参与制定公司FPGA开发规范与自动化验证流程,引入SystemVerilog断言与UVM框架,推动代码质量抽查与回归测试,累计发现并修复隐藏缺陷80+,显著提升IP重用性
工业机器人视觉定位FPGA加速系统 - 算法开发负责人
2019.05-2020.12
•• 项目背景:智能制造对工业机器人视觉引导的实时性要求极高,传统CPU方案难以满足毫秒级定位延迟,需引入FPGA硬件加速
•• 项目内容:作为核心算法开发人员,负责设计基于FPGA的ICP点云匹配硬件加速器。采用多级流水线架构实现最近邻搜索与刚体变换,设计局部缓存与数据预取策略,解决DDR带宽瓶颈。通过时序优化与资源平衡,在Xilinx Kintex-7 FPGA上实现单次匹配延迟<5ms,满足六轴机器人伺服控制闭环要求
•• 项目成果:加速器已集成至公司自研视觉控制器,相比ARM Cortex-A72软件方案处理速度提升8倍,已交付多家汽车零部件分拣产线,预计年装机量2000套以上
金融交易系统FPGA低延迟网络加速卡 - 算法实现工程师
2022.03-2023.06
•• 项目背景:量化交易场景下,网络数据包解析与交易指令处理延迟直接影响策略收益,需要硬件级加速突破微秒级瓶颈
•• 项目内容:负责全硬件TCP/IP协议栈与FIX协议解析的FPGA实现。采用模块化架构设计MAC、IP、TCP处理引擎,实现TCP乱序重组与流控的硬件逻辑。优化解析器并行度,在Intel Agilex 7 FPGA上实现报文解析延迟<1.2μs,端到端处理延迟<3μs
•• 项目成果:加速卡通过交易所兼容性测试,已部署于某头部期货公司核心交易系统,将订单处理时延降低90%,替代了原有软件方案,软硬件总成本下降40%以上
Xilinx FPGA开发(Vivado/Vitis) 开源项目与技术社区:
在GitHub上发起“FPGA算法加速库”(https://github.com/niu****/FPGA-Accel-Lib),提供可配置的FFT、矩阵乘法、双线性插值等硬件模块,附带Testbench与资源对比脚本,获Star 1200+,Fork 600+
深度参与开源项目“SpinalHDL”的AXI4 Full互连模块开发,贡献PR 25+,设计并实现了跨时钟域处理子模块,同时为官方文档补充中文版接口时序说明,降低社区入门门槛