【校招】Agent后训练算法青年研究员-智能体系统中心
智能体系统中心|正式|算法类|上海
2026-09-23
岗位职责
1. 负责大模型智能体的强化学习训练,提升任务规划、工具调用、多轮交互与长程任务执行能力。
2. 负责Agentic RL在超级长程Agent场景的训练,参与Agentic RL Infra建设及优化、Agentic RL 算法优化,持续提升Agentic RL训练的效率和稳定性。
3. 设计和优化奖励机制与策略更新方法,解决稀疏奖励、长程信用分配、奖励投机等训练问题。
4. 建设高质量交互轨迹与训练数据,优化采样、筛选和任务难度分布,提升样本效率与泛化能力。
5. 完善训练流程,协同基础设施团队优化分布式训练与推理采样,提升训练稳定性和资源利用率。
2. 负责Agentic RL在超级长程Agent场景的训练,参与Agentic RL Infra建设及优化、Agentic RL 算法优化,持续提升Agentic RL训练的效率和稳定性。
3. 设计和优化奖励机制与策略更新方法,解决稀疏奖励、长程信用分配、奖励投机等训练问题。
4. 建设高质量交互轨迹与训练数据,优化采样、筛选和任务难度分布,提升样本效率与泛化能力。
5. 完善训练流程,协同基础设施团队优化分布式训练与推理采样,提升训练稳定性和资源利用率。
岗位要求
1. 硕士以上学历,计算机、人工智能、数学等相关专业。
2. 具备扎实的深度学习与强化学习基础,熟悉 PyTorch 和大模型训练流程,了解 PPO、GRPO 等策略优化算法。
3. 具有扎实的深度学习算法基础,熟悉深度学习框架和分布式训练推理加速,有实操经验者优先;
4. 在多模态/CV/NLP等领域顶级会议(期刊)发表过论文、主导/参与业界知名的开源项目者优先;
5. 具备极强的学习能力和技术追求,良好的团队合作和沟通能力。
2. 具备扎实的深度学习与强化学习基础,熟悉 PyTorch 和大模型训练流程,了解 PPO、GRPO 等策略优化算法。
3. 具有扎实的深度学习算法基础,熟悉深度学习框架和分布式训练推理加速,有实操经验者优先;
4. 在多模态/CV/NLP等领域顶级会议(期刊)发表过论文、主导/参与业界知名的开源项目者优先;
5. 具备极强的学习能力和技术追求,良好的团队合作和沟通能力。


