【校招】内生安全算法青年研究员(Safety from Within)-安全基模中心

安全基模中心|正式|算法类|上海

2026-09-23

岗位职责
工作方向:大模型安全 / 基础模型 / 自主进化 / 因果推理 / 强化学习

我们正在探索下一代人工智能安全范式——内生安全(Safety from Within)。
不同于依赖外挂护栏、规则过滤和事后检测的传统安全方案,我们希望从模型架构、训练机制、推理过程和自主进化机制出发,让安全能力真正成为模型自身能力的一部分,使模型在能力持续增强的同时,具备风险识别、安全推理、自我修复和安全演化能力。
我们希望寻找对大模型基础研究和 AI Safety 有强烈兴趣的优秀应届生,一起探索“如何让模型越强,也越安全”。

你将参与:
1.研究面向下一代大模型的内生安全架构,探索将安全能力原生融入模型参数、记忆、注意力、MoE 等核心结构;
2.研究大模型的安全训练与自主进化机制,包括 SFT、RL、Self-Play、持续学习、自我改进与安全对齐;
3.研究模型的危险知识表示、定位、隔离与遗忘机制,实现更加精准和可验证的安全控制;
4.研究可信安全推理,结合因果推理、神经符号方法、形式化验证等技术,使模型安全决策可解释、可验证、可审计;
5.研究模型面对未知风险时的自主风险发现与自我修复能力,推动 AI 安全从“被动防御”走向“主动免疫”;
6.参与 Safin 等内生安全基模研发,在真实大规模模型上验证原创算法,并推动成果形成顶级论文、开源模型及实际应用。
岗位要求
1.计算机、人工智能、数学、自动化、网络安全等相关专业,硕士及以上学历;
2.对大模型、AI Safety、强化学习、模型架构或基础理论研究有浓厚兴趣;
3.具备扎实的机器学习 / 深度学习基础,熟悉 Transformer、LLM 训练与推理基本原理;
4.熟悉 PyTorch 等深度学习框架,具备较强的算法实现和实验能力;
5.具有良好的研究能力,能够快速阅读论文、提出问题并设计实验验证;
6.不满足于简单调参,希望研究真正能够改变模型内部机制的技术问题。

加分项
1.具备以下任一方向研究经历者优先:
大语言模型预训练、后训练、强化学习或推理;
AI Safety、Alignment、Red Teaming、Unlearning;
新型神经网络架构、Attention、Memory、MoE;
强化学习、Self-Play、Agent、自主进化;
因果推理、神经符号推理、形式化方法;
模型可解释性、Mechanistic Interpretability;
网络安全大模型或科学智能体安全。
2.在 NeurIPS、ICML、ICLR、ACL、CCS、USENIX Security、IEEE S&P 等高水平会议发表过相关论文者优先,但我们更看重研究潜力、原创思考和解决困难问题的能力。

你将获得
1.参与下一代 AI 安全基础模型从 0 到 1 的研发机会,而不仅是外围安全工具开发;
2.在几十亿至数千亿参数模型上验证原创研究想法的机会;
3.覆盖基础理论—模型架构—训练算法—安全评测—真实应用的完整研究链条;
4.与国内外顶尖高校、基础模型团队及安全团队开展合作;
5.鼓励发表高水平论文、开源模型和算法,并支持具有长期价值的原创研究方向。

我们关注的问题
当 AI 能力不断突破人类预设边界时,安全是否仍然只能依靠人类不断增加新的规则?
我们相信,真正面向未来的 AI 安全,需要让模型形成类似“免疫系统”的内在机制——能够理解风险、发现风险、抵抗风险,并随着自身能力一起演化。
如果你也希望参与定义这样的下一代 AI,我们期待与你一起探索 Safety from Within。"

上海市徐汇区龙文路129号
国际传媒港L1楼

联系我们
comm@pjlab.org.cn