【校招】GPU 平台研发工程师-系统平台中心
系统平台中心|正式|系统/工程类|上海
2026-09-22
岗位职责
1.参与 AI 算力云原生平台整体架构设计与核心模块研发,负责训练调度、资源管理、任务运行时等关键子系统的设计与实现,支撑万卡级 GPU/NPU 集群稳定运行与资源利用效率持续优化;
2.深度参与 Kubernetes 调度器及资源管理体系的定制化开发,建设面向 AI 训练与推理场景的优先级调度、资源抢占、Gang 调度、拓扑感知、弹性伸缩等能力,满足大规模分布式训练及在线推理需求;
3.参与 Agent 沙盒平台架构设计与核心能力建设,面向 AI Agent、代码执行及科研计算等场景,建设高并发、强隔离、弹性化的 Sandbox Runtime,负责沙盒生命周期管理、资源调度、镜像与环境管理、网络与存储隔离、运行时安全及弹性扩缩容等核心能力;
4.深度参与 AI 训练任务运行稳定性与可观测性能力建设,设计并实现基于硬件、通信及调度事件的监控、告警与故障诊断机制,提升任务异常发现效率与根因定位能力;
5.持续跟进云原生 AI 领域前沿技术方向(如异构算力编排、Serverless 训练等),推动技术方案的工程化验证与落地,并参与 CNCF 等开源社区的技术交流与贡献。
2.深度参与 Kubernetes 调度器及资源管理体系的定制化开发,建设面向 AI 训练与推理场景的优先级调度、资源抢占、Gang 调度、拓扑感知、弹性伸缩等能力,满足大规模分布式训练及在线推理需求;
3.参与 Agent 沙盒平台架构设计与核心能力建设,面向 AI Agent、代码执行及科研计算等场景,建设高并发、强隔离、弹性化的 Sandbox Runtime,负责沙盒生命周期管理、资源调度、镜像与环境管理、网络与存储隔离、运行时安全及弹性扩缩容等核心能力;
4.深度参与 AI 训练任务运行稳定性与可观测性能力建设,设计并实现基于硬件、通信及调度事件的监控、告警与故障诊断机制,提升任务异常发现效率与根因定位能力;
5.持续跟进云原生 AI 领域前沿技术方向(如异构算力编排、Serverless 训练等),推动技术方案的工程化验证与落地,并参与 CNCF 等开源社区的技术交流与贡献。
岗位要求
1.本科及以上学历,计算机、软件工程、人工智能等相关专业,应届毕业生或有相关实习、科研、项目经历者优先;
2.具备扎实的数据结构、操作系统、计算机网络和分布式系统基础;
3.熟悉 Golang / C++ / Python 中至少一种编程语言,具备良好的工程实践能力;
4.了解 Linux、Docker、Kubernetes 等云原生技术,有相关课程、项目、实习或开源经历者优先;
5.对 AI 基础设施、GPU 集群、分布式训练、Agent 系统等方向有兴趣,具备较强的问题分析和学习能力。
2.具备扎实的数据结构、操作系统、计算机网络和分布式系统基础;
3.熟悉 Golang / C++ / Python 中至少一种编程语言,具备良好的工程实践能力;
4.了解 Linux、Docker、Kubernetes 等云原生技术,有相关课程、项目、实习或开源经历者优先;
5.对 AI 基础设施、GPU 集群、分布式训练、Agent 系统等方向有兴趣,具备较强的问题分析和学习能力。


