【校招】推理服务研发工程师-系统平台中心

系统平台中心|正式|系统/工程类|上海

2026-09-22

岗位职责
1.推理服务后端架构研发:负责AI推理服务的后端架构设计与开发,实现模型加载、请求调度、批处理推理、动态路由、流量管控、超时重试等核心能力,搭建标准化、可复用的推理服务底座。
2.推理性能专项优化:针对大模型推理的吞吐、延时、显存占用、推理速度等核心指标分析推理链路瓶颈(Gateway/Scheduler/Runtime/GPU)进行专项优化,结合业务场景优化KV缓存、动态批处理、模型量化、推理并行策略,提升单机及集群推理并发能力,降低推理部署成本。
3.云原生推理服务化落地:将优化后的推理引擎封装为标准化云原生服务,对接K8s集群,实现推理服务的容器化部署、弹性扩缩容、灰度发布、资源管控,保障线上服务高可用。
4.推理服务监控与问题迭代:基于可观测体系(Metrics/Profiling/Tracing)搭建推理服务全链路监控体系,跟踪线上推理异常、性能瓶颈、报错问题,持续迭代优化引擎与服务架构,提升推理服务稳定性与用户体验。
5.技术调研与方案落地:持续跟进业界开源推理技术、大模型部署新技术、新方案,开展技术调研与POC验证,输出适配业务的推理部署最优方案,推动团队技术架构升级。
岗位要求
1.本科及以上学历,计算机、软件工程、人工智能等相关专业,应届毕业生或有相关实习、科研、项目经历者优先;
2.具备扎实的编程基础,熟悉 Go / C++ / Python 中至少一种语言,掌握数据结构与算法,了解网络编程、并发编程及常见后端开发模式;
3.了解至少一种主流大模型推理引擎或框架,如 vLLM、SGLang、TensorRT-LLM、Dynamo 等,有相关课程、项目、实习或源码阅读经历者优先;
4.了解大模型推理基本原理,包括 Batch、KV Cache、量化、张量并行、流水线并行、PD 分离等技术,对推理性能优化方向有一定理解;
5.熟悉 Linux、Docker 等基础环境,了解 Kubernetes 及云原生基本概念,有模型部署、容器化服务或 GPU 环境实践经验者优先;
6.具备较强的学习能力、问题分析能力和工程实践意识,对大模型推理、AI 基础设施及高性能系统方向有浓厚兴趣,具备良好的团队协作和沟通能力。

上海市徐汇区龙文路129号
国际传媒港L1楼

联系我们
comm@pjlab.org.cn