【校招】大模型系统工程师-系统平台中心
系统平台中心|正式|系统/工程类|上海
2026-09-22
岗位职责
1.负责大模型训练或推理系统中具体功能模块的研发、性能优化与日常维护,方向涵盖并行与通信、显存管理、计算调度、算子优化等,确保模块在大规模 GPU 集群与高并发低延迟场景下稳定高效。
2.深入理解所负责方向的核心优化技术,训练方向聚焦并行策略、混合精度、计算与通信协同,推理方向聚焦请求调度、显存复用、算子与 Kernel 优化,在资深工程师指导下将技术方案落地为高质量代码。
3.承担所负责模块的性能分析与问题定位工作,针对算力利用率、显存、通信、延迟等瓶颈进行系统性调优。
4.参与模块的技术方案设计、代码评审与文档撰写,保证代码的可维护性与可扩展性。
5.理解并遵循系统的整体架构设计,参与架构相关的技术讨论与评审,建立从底层算子到上层调度的完整链路认知。
与算法团队、平台团队紧密协作,理解业务需求,完成系统与周边组件的对接与集成。
6.关注大规模长周期训练的效率与稳定性、Agent 类应用的推理体验等真实业务需求,确保系统高效支撑业务演进。
7.持续跟踪主流开源框架与 GPU 计算生态的最新进展,参与团队技术分享和讨论,在带教下沿训练或推理方向成长为独立担当的模块 Owner。
2.深入理解所负责方向的核心优化技术,训练方向聚焦并行策略、混合精度、计算与通信协同,推理方向聚焦请求调度、显存复用、算子与 Kernel 优化,在资深工程师指导下将技术方案落地为高质量代码。
3.承担所负责模块的性能分析与问题定位工作,针对算力利用率、显存、通信、延迟等瓶颈进行系统性调优。
4.参与模块的技术方案设计、代码评审与文档撰写,保证代码的可维护性与可扩展性。
5.理解并遵循系统的整体架构设计,参与架构相关的技术讨论与评审,建立从底层算子到上层调度的完整链路认知。
与算法团队、平台团队紧密协作,理解业务需求,完成系统与周边组件的对接与集成。
6.关注大规模长周期训练的效率与稳定性、Agent 类应用的推理体验等真实业务需求,确保系统高效支撑业务演进。
7.持续跟踪主流开源框架与 GPU 计算生态的最新进展,参与团队技术分享和讨论,在带教下沿训练或推理方向成长为独立担当的模块 Owner。
岗位要求
1.计算机科学、软件工程、数学或相关领域本科及以上学历
2.具备扎实的数据结构与算法、操作系统、计算机网络、计算机体系结构基础。
3.熟练掌握 Python,具备良好的工程编码习惯与调试能力,熟悉 C++ 或 Rust 者优先。
4.了解深度学习基本原理,有 PyTorch 使用经验,熟悉 CUDA 编程模型或有 GPU 编程、性能分析实践者优先。
5.对分布式训练或高性能推理至少一个方向的底层机制有基本认知或浓厚兴趣,阅读过相关系统源码者优先。
6.有系统软件、高性能计算、算法竞赛、开源社区贡献或相关实习经历者优先。
7.具备良好的问题分析与解决能力,能够在指导下独立完成模块级别的研发任务。
8.对大模型技术充满热情,对系统底层有好奇心与钻研精神。
9.有良好的团队沟通与协作意识,乐于分享与学习。
2.具备扎实的数据结构与算法、操作系统、计算机网络、计算机体系结构基础。
3.熟练掌握 Python,具备良好的工程编码习惯与调试能力,熟悉 C++ 或 Rust 者优先。
4.了解深度学习基本原理,有 PyTorch 使用经验,熟悉 CUDA 编程模型或有 GPU 编程、性能分析实践者优先。
5.对分布式训练或高性能推理至少一个方向的底层机制有基本认知或浓厚兴趣,阅读过相关系统源码者优先。
6.有系统软件、高性能计算、算法竞赛、开源社区贡献或相关实习经历者优先。
7.具备良好的问题分析与解决能力,能够在指导下独立完成模块级别的研发任务。
8.对大模型技术充满热情,对系统底层有好奇心与钻研精神。
9.有良好的团队沟通与协作意识,乐于分享与学习。


