【校招】大模型语料数据青年研究员-数据平台中心

数据平台中心|正式|算法类|上海

2026-09-23

岗位职责
面向新一代大模型的预训练与持续预训练,负责高质量语料的研究与建设,覆盖网页、代码、论文、书籍及专业领域文档等多源数据。围绕模型的知识、代码、数学推理与科学理解等能力,带领团队建立从数据源发现、质量治理到训练验证的完整闭环,以可验证的模型能力提升驱动数据迭代。

岗位职责:
1. 高价值数据源识别与挖掘。 从模型能力需求和数据缺口出发,系统发现互联网、开源社区、学术资源及专业领域数据源;评估其内容价值、独特性、覆盖度、时效性、获取成本与授权条件,制定数据引入优先级和持续拓展策略。
2. 数据质量体系建设。 建立通用与领域专项相结合的质量分类、分级和验收标准,覆盖信息密度、准确性、完整性、多样性、重复度及安全性等维度;结合人工评审、规则、分类器与模型评估,研发质量打分、筛选、去重和污染检测方法,验证质量指标与训练收益的关系。
3. 以数据迭代模型能力。 与模型训练及评测团队协作,从能力短板和失败案例出发,研究数据选择、领域配比、难度分布、分阶段混入及数据增强策略;通过代理模型实验、消融实验和持续预训练验证效果,推动有效策略进入主线训练,持续评估收益与成本。
4. 规模化数据生产与交付。 将研究方法转化为可复用的数据处理流程,协同推进网页、代码仓库及PDF等文档的解析、结构化、清洗与组织;建立数据版本、来源追溯、质量报告和验收机制,兼顾有效数据规模、生产效率与训练可用性。
5. 团队带领与技术规划。 负责方向规划、目标拆解、人员分工、技术评审和人才培养,亲自推进关键研究与难点攻关;协调采集、解析、平台、训练和评测团队,管理实验节奏、资源投入与交付风险,对数据质量及模型效果负责。
岗位要求
1. 计算机、人工智能、数学或相关专业硕士及以上学历,具备扎实的机器学习、自然语言处理与实验分析基础。
2. 具有大模型预训练或持续预训练数据研究实战经验,深入参与过数据建设、训练验证与评测迭代,能够说明具体数据策略对模型能力的影响及验证依据。
3. 具备主动发现和判断数据价值的能力,熟悉网页、代码、学术文献、书籍等至少一类数据的生态与特征,能够独立制定数据源挖掘、评估和引入方案。
4. 具备数据质量体系建设经验,掌握数据分析、分类、质量评估、清洗与去重方法,能够构建可靠的标注与评测基准,识别评测污染、数据偏差及质量指标失真等问题。
5. 理解大模型训练机制及数据配比、课程学习、数据与模型规模关系等问题;具备严谨的对照实验和归因分析能力,能在有限算力下设计有效实验,判断结论的适用范围。
6. 熟练使用Python及PyTorch等工具,具备大规模数据处理与分布式计算经验,能够将研究原型推进为稳定、可复现的生产流程。
7. 具备带领研发团队或研究小组的实际经验,能够独立制定技术路线、拆解目标、培养成员并推动跨团队协作,同时保持一线研究与工程攻关能力。

加分项:
1. 主导过万亿Token级语料建设,或在主线模型训练中取得有明确实验依据的数据效果提升。
2. 在代码、数学、科学、多语言或长上下文方向具有深入的数据研究与模型验证经验。
3. 具有复杂文档解析、仓库级代码组织、模型辅助数据治理或高质量合成数据研究经验。
3. 发表过相关高水平论文,或主导过有影响力的开源数据集、数据工具及评测项目。

上海市徐汇区龙文路129号
国际传媒港L1楼

联系我们
comm@pjlab.org.cn