【校招】前沿强化学习青年研究员-安全基模中心
安全基模中心|正式|算法类|上海
2026-09-24
岗位职责
1. 安全训练与自主进化机制,包括大模型后训练核心算法,包括 SFT、PPO、GRPO、DAPO 、OPD、SAO等主流强化学习方法;
2. 研究面向下一代大模型的内生安全架构,探索将安全能力原生融入模型参数、记忆、注意力、MoE 等核心结构,并支持大模型(含 MoE 架构)的基于算子开发的高效训练与调优,训练基础设施与最佳实践;
3. 结合团队具体任务场景,将模型架构与 RL 技术落地为可交付的模型能力,持续提升模型的安全性、推理与泛化能力;
4. 结合当前智能体上的安全场景,将harness与模型架构进行更深结合,形成具备自调整,自组织能力的内生安全人工智能系统
2. 研究面向下一代大模型的内生安全架构,探索将安全能力原生融入模型参数、记忆、注意力、MoE 等核心结构,并支持大模型(含 MoE 架构)的基于算子开发的高效训练与调优,训练基础设施与最佳实践;
3. 结合团队具体任务场景,将模型架构与 RL 技术落地为可交付的模型能力,持续提升模型的安全性、推理与泛化能力;
4. 结合当前智能体上的安全场景,将harness与模型架构进行更深结合,形成具备自调整,自组织能力的内生安全人工智能系统
岗位要求
1. 人工智能、计算机、数学、统计等相关专业应届博士学历,具备扎实的大语言模型与智能体基础;
2. 熟练掌握 PPO、GRPO、DPO、SAO 等主流 RL 算法,有大模型后训练 / RL 训练调优的实操经验;熟悉至少一种主流 RL 训练框架(如 veRL、OpenRLHF、TRL、slime 等),具备框架深度定制与二次开发能力者优先;
3. 具备扎实的工程实现能力,熟练掌握 Python,熟悉 PyTorch 分布式训练;有开发新型架构并展开一定规模的预训练工作经验者优先;有 Megatron-LM、vLLM、SGLang 等训练/推理 Infra 经验者优先;
4. 具备 一线大厂后训练团队相关经验者优先;在模型/训练技术报告中有署名成果者优先;在 NeurIPS、ICML、ICLR、ACL 等顶级会议发表过相关方向论文者优先(论文非硬性要求);
5. 具备良好的前沿趋势洞察力、创新能力与独立解决问题的能力,科研与工程能力兼备。
2. 熟练掌握 PPO、GRPO、DPO、SAO 等主流 RL 算法,有大模型后训练 / RL 训练调优的实操经验;熟悉至少一种主流 RL 训练框架(如 veRL、OpenRLHF、TRL、slime 等),具备框架深度定制与二次开发能力者优先;
3. 具备扎实的工程实现能力,熟练掌握 Python,熟悉 PyTorch 分布式训练;有开发新型架构并展开一定规模的预训练工作经验者优先;有 Megatron-LM、vLLM、SGLang 等训练/推理 Infra 经验者优先;
4. 具备 一线大厂后训练团队相关经验者优先;在模型/训练技术报告中有署名成果者优先;在 NeurIPS、ICML、ICLR、ACL 等顶级会议发表过相关方向论文者优先(论文非硬性要求);
5. 具备良好的前沿趋势洞察力、创新能力与独立解决问题的能力,科研与工程能力兼备。


