【校招】强化学习算法工程师-安全基模中心
安全基模中心|正式|科研通道|上海
2026-09-29
岗位职责
1.负责大模型在AI Coding场景下的强化学习(RL)算法研发与训练,探索并落地PPO、GRPO等主流算法,提升模型在复杂代码生成、长程规划与工具调用任务中的自主推理与执行能力;
2.参与构建端到端的Agentic RL训练链路,结合过程奖励机制(Process Reward)与Critic Model,优化Agent在真实环境中的行为引导、指令跟随与自我反思能力;
3.负责AI Coding相关高质量RL训练数据的挖掘、合成与评测体系设计,针对模型能力短板构建可验证的训练闭环,持续提升模型在前沿Benchmark及真实业务场景中的表现;
4.与算法、Infra团队紧密协作,参与RL训练系统的性能优化与工程化落地,解决训推分离场景下的大规模训练稳定性、吞吐瓶颈及长尾任务问题。
2.参与构建端到端的Agentic RL训练链路,结合过程奖励机制(Process Reward)与Critic Model,优化Agent在真实环境中的行为引导、指令跟随与自我反思能力;
3.负责AI Coding相关高质量RL训练数据的挖掘、合成与评测体系设计,针对模型能力短板构建可验证的训练闭环,持续提升模型在前沿Benchmark及真实业务场景中的表现;
4.与算法、Infra团队紧密协作,参与RL训练系统的性能优化与工程化落地,解决训推分离场景下的大规模训练稳定性、吞吐瓶颈及长尾任务问题。
岗位要求
1.计算机、人工智能、软件工程等相关专业本科及以上学历,具备2年以上大模型强化学习或AI Agent相关研发经验。
2.具备扎实的强化学习基础,深入理解PPO、GRPO等算法原理,有实际跑通并优化过RL训练Pipeline的完整经验。
3.在AI Coding、代码基座模型或Agentic RL方向有实际项目落地经验,熟悉代码生成、自动修复、测试框架等场景的RL训练方法。
4.具备出色的代码能力与工程素养,熟练掌握Python,熟悉C++/Go/Rust中至少一种系统级语言,具备良好的代码规范与问题定位能力。
5.对模型行为有较强洞察力,能够结合实际问题独立分析失败案例,设计Reward信号并持续迭代训练方案。
加分项
具备强化学习Infra或分布式训练系统背景,熟悉Ray、DeepSpeed、Megatron-LM、vLLM等框架,有大规模RL训练平台的开发或优化经验者优先。
有开源项目贡献经历,或在ACM/ICPC、Kaggle等知名竞赛中取得优异成绩。
熟悉Code Harness、Runtime环境构建,或有过Long Horizon Task相关的训练与评测经验。
具备顶会论文发表或知名开源项目贡献经历,能够沉淀并分享具有行业影响力的技术成果。
2.具备扎实的强化学习基础,深入理解PPO、GRPO等算法原理,有实际跑通并优化过RL训练Pipeline的完整经验。
3.在AI Coding、代码基座模型或Agentic RL方向有实际项目落地经验,熟悉代码生成、自动修复、测试框架等场景的RL训练方法。
4.具备出色的代码能力与工程素养,熟练掌握Python,熟悉C++/Go/Rust中至少一种系统级语言,具备良好的代码规范与问题定位能力。
5.对模型行为有较强洞察力,能够结合实际问题独立分析失败案例,设计Reward信号并持续迭代训练方案。
加分项
具备强化学习Infra或分布式训练系统背景,熟悉Ray、DeepSpeed、Megatron-LM、vLLM等框架,有大规模RL训练平台的开发或优化经验者优先。
有开源项目贡献经历,或在ACM/ICPC、Kaggle等知名竞赛中取得优异成绩。
熟悉Code Harness、Runtime环境构建,或有过Long Horizon Task相关的训练与评测经验。
具备顶会论文发表或知名开源项目贡献经历,能够沉淀并分享具有行业影响力的技术成果。


