大模型预训练数据研发工程师
数据平台中心|全职|工程通道|上海
2026-09-16
岗位职责
负责大模型预训练数据的处理、评估、筛选和实验验证,推动数据从原始来源转化为可用于模型训练的数据集,并持续提升数据的有效性和稳定性。
岗位职责
- 负责文本、代码及领域数据的清洗、去重、采样和数据集构建;
- 设计数据特征、分类模型、排序模型和筛选策略;
- 综合规则、统计特征、embedding、代码模型和大模型评分信号进行数据评估;
- 参与代码可解析性、结构、可执行性、重复性和安全风险分析;
- 参与多语种、代码、数学及其他领域数据的处理和评估;
- 参与合成数据的生成、验证和筛选;
- 设计数据标注、抽检、难例分析和误差分析流程;
- 通过小模型训练、消融实验和下游评测验证数据价值;
- 负责相关模型和流程的部署、监控及持续迭代。
岗位职责
- 负责文本、代码及领域数据的清洗、去重、采样和数据集构建;
- 设计数据特征、分类模型、排序模型和筛选策略;
- 综合规则、统计特征、embedding、代码模型和大模型评分信号进行数据评估;
- 参与代码可解析性、结构、可执行性、重复性和安全风险分析;
- 参与多语种、代码、数学及其他领域数据的处理和评估;
- 参与合成数据的生成、验证和筛选;
- 设计数据标注、抽检、难例分析和误差分析流程;
- 通过小模型训练、消融实验和下游评测验证数据价值;
- 负责相关模型和流程的部署、监控及持续迭代。
岗位要求
- 计算机、机器学习、自然语言处理、数据挖掘或相关专业硕士及以上学历;
- 具备机器学习、数据挖掘或大模型数据研发经验;
- 熟练掌握 Python,熟悉 PyTorch、Transformers 或类似工具;
- 熟悉分类、排序、回归、特征工程、样本采样和模型评估;
- 熟悉 XGBoost、LightGBM 或其他结构化数据建模工具;
- 具备大规模文本、代码或多语种数据处理经验;
- 能够独立完成从数据分析、特征设计、模型训练到效果验证的完整工作;
- 具备良好的实验设计、问题分析和工程落地能力;
- 能够阅读英文论文和开源项目,并将方法实现为可靠工具或流程。
优先考虑
- 有大模型预训练数据、数据筛选或数据配比经验;
- 有代码模型、代码解析、静态分析、编译测试或代码安全分析经验;
- 有多语种 NLP、低资源语言或跨语言评估经验;
- 有合成数据、LLM-as-a-Judge、reward model 或数据排序经验;
- 有数据去重、污染检测、隐私保护或许可证风险识别经验;
- 有相关论文、开源项目或实际落地成果。
- 具备机器学习、数据挖掘或大模型数据研发经验;
- 熟练掌握 Python,熟悉 PyTorch、Transformers 或类似工具;
- 熟悉分类、排序、回归、特征工程、样本采样和模型评估;
- 熟悉 XGBoost、LightGBM 或其他结构化数据建模工具;
- 具备大规模文本、代码或多语种数据处理经验;
- 能够独立完成从数据分析、特征设计、模型训练到效果验证的完整工作;
- 具备良好的实验设计、问题分析和工程落地能力;
- 能够阅读英文论文和开源项目,并将方法实现为可靠工具或流程。
优先考虑
- 有大模型预训练数据、数据筛选或数据配比经验;
- 有代码模型、代码解析、静态分析、编译测试或代码安全分析经验;
- 有多语种 NLP、低资源语言或跨语言评估经验;
- 有合成数据、LLM-as-a-Judge、reward model 或数据排序经验;
- 有数据去重、污染检测、隐私保护或许可证风险识别经验;
- 有相关论文、开源项目或实际落地成果。


