【校招】科学智能体工程师/青年研究员-智能体系统中心
智能体系统中心|正式|算法类|上海
2026-09-23
岗位职责
1. 硕士及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先。
2. 编程基础扎实,熟练使用 Python,熟悉 PyTorch / Transformers 等大模型训练框架。
3. 熟悉大模型基本原理,对 SFT、RLHF、DPO、PPO、GRPO 等后训练方法有较好的理解;有实际训练经验者优先。
4. 对大模型后训练、Agent RL、Reasoning、Coding Agent、Self-Improvement 等方向有较强兴趣。
5. 具备较强的实验能力,能够独立完成实验设计、训练调参、结果分析和问题定位。
2. 编程基础扎实,熟练使用 Python,熟悉 PyTorch / Transformers 等大模型训练框架。
3. 熟悉大模型基本原理,对 SFT、RLHF、DPO、PPO、GRPO 等后训练方法有较好的理解;有实际训练经验者优先。
4. 对大模型后训练、Agent RL、Reasoning、Coding Agent、Self-Improvement 等方向有较强兴趣。
5. 具备较强的实验能力,能够独立完成实验设计、训练调参、结果分析和问题定位。
岗位要求
1. 参与智能体harness及智能体模型的后训练研究与能力提升,围绕 SFT、强化学习、偏好优化、自我改进(Recursive Self-Improvement)等方向开展算法研究与工程实现。
2. 参与 Agent RL 训练与优化,重点提升模型在科学发现,代码生成、复杂任务规划、长时程推理、多轮交互、错误恢复等真实任务中的能力。
3. 构建面向后训练的高质量数据与训练 pipeline,包括高质量轨迹数据、偏好数据、错误修复数据、任务规划数据、多轮交互数据等,并研究数据筛选、难度控制与自动化生成方法。
4. 参与大模型强化学习算法研究与实验,包括 reward 设计、rollout、credit assignment、on-policy / off-policy learning、训练稳定性与效率优化等。
5. 参与harness和模型的联合进化研究,探索数据生成—训练—评测—再生成的闭环训练机制,提升模型持续学习和复杂任务解决能力。
6. 构建和优化面向 Coding Agent、Auto-Research 等任务的评测体系,并参与模型能力分析、实验设计、训练调参和问题定位。
2. 参与 Agent RL 训练与优化,重点提升模型在科学发现,代码生成、复杂任务规划、长时程推理、多轮交互、错误恢复等真实任务中的能力。
3. 构建面向后训练的高质量数据与训练 pipeline,包括高质量轨迹数据、偏好数据、错误修复数据、任务规划数据、多轮交互数据等,并研究数据筛选、难度控制与自动化生成方法。
4. 参与大模型强化学习算法研究与实验,包括 reward 设计、rollout、credit assignment、on-policy / off-policy learning、训练稳定性与效率优化等。
5. 参与harness和模型的联合进化研究,探索数据生成—训练—评测—再生成的闭环训练机制,提升模型持续学习和复杂任务解决能力。
6. 构建和优化面向 Coding Agent、Auto-Research 等任务的评测体系,并参与模型能力分析、实验设计、训练调参和问题定位。


