
扫码联系客服
对强化学习始终抱有探索热情,喜欢从马尔可夫决策过程中提炼优雅的决策逻辑,乐于在仿真与真实环境间反复调试,追求代码的可复现性与工程美感。做事严谨,习惯从数据中找答案,对奖励函数设计和训练不稳定等问题有天然敏感,能沉下心逐步拆解复杂场景。熟练使用 PyTorch 等框架,擅长将算法原型快速落地为可验证的管线,并注重模块化与可读性。习惯每周跟踪 arXiv 上新论文,保持用笔记和简单实验验证关键 idea 的节奏,学习迁移能力较强。希望与注重技术深度的团队一起,把强化学习推至更实际的业务闭环中。
研究背景:慢性病治疗方案需频繁动态调整,强化学习为个性化序贯决策提供了新范式。
研究内容:
- 利用患者纵向电子健康记录,构建包含生理指标、用药史的状态空间,动作空间为剂量调整,奖励依据糖化血红蛋白改善和低血糖事件。
- 实验对比SAC、QR-DQN等算法在2型糖尿病模拟器上的表现,评估策略鲁棒性和分布外泛化能力。
- 引入KL散度约束与策略蒸馏,确保策略在临床可接受范围内的安全性。
研究成果:形成完整技术报告,在学术沙龙中汇报,并开发原型演示,为产学研合作提供基础。
对强化学习始终抱有探索热情,喜欢从马尔可夫决策过程中提炼优雅的决策逻辑,乐于在仿真与真实环境间反复调试,追求代码的可复现性与工程美感。做事严谨,习惯从数据中找答案,对奖励函数设计和训练不稳定等问题有天然敏感,能沉下心逐步拆解复杂场景。熟练使用 PyTorch 等框架,擅长将算法原型快速落地为可验证的管线,并注重模块化与可读性。习惯每周跟踪 arXiv 上新论文,保持用笔记和简单实验验证关键 idea 的节奏,学习迁移能力较强。希望与注重技术深度的团队一起,把强化学习推至更实际的业务闭环中。
研究背景:慢性病治疗方案需频繁动态调整,强化学习为个性化序贯决策提供了新范式。
研究内容:
- 利用患者纵向电子健康记录,构建包含生理指标、用药史的状态空间,动作空间为剂量调整,奖励依据糖化血红蛋白改善和低血糖事件。
- 实验对比SAC、QR-DQN等算法在2型糖尿病模拟器上的表现,评估策略鲁棒性和分布外泛化能力。
- 引入KL散度约束与策略蒸馏,确保策略在临床可接受范围内的安全性。
研究成果:形成完整技术报告,在学术沙龙中汇报,并开发原型演示,为产学研合作提供基础。
奇秒简历AmazingCV 强化学习算法工程师 简历免费在线制作,包含强化学习算法工程师简历范文,强化学习算法工程师简历求职模板,AI辅助一键优化强化学习算法工程师简历内容,秒变满分候选人,让心动offer拿到手软。贴合HR筛选偏好,告别千篇一律,简历通过率飙升。