
Job description
我们是京东云,作为京东集团面向企业、政府等机构的技术服务品牌,是更懂产业的数智化解决方案提供商,致力于为企业、金融机构、政府等各类客户提供以供应链为基础的数智化解决方案。依托公、专、混的全栈式云产品矩阵,我们融合了人工智能、大数据、物联网等前沿科技,在零售、物流、健康、智能城市、金融科技等行业领域为客户提供了丰富的产品与数字化解决方案,帮助客户降低成本、提升效率,是值得信赖的产业数字合作伙伴。 京东云裸金属团队致力于为客户提供AI时代算力基础设置。本岗位负责构建高性能、高可用的AI训练与推理服务平台。深度参与从底层算力调度到上层AI应用的全链路技术体系构建。
- 平台研发与迭代:负责AI训推平台核心功能的系统设计、研发、优化与维护,提升平台的稳定性、性能与易用性。
- 性能与体验优化:持续优化训练与推理服务的性能,包括资源调度效率、任务执行速度等,提升平台整体效能。
- 技术前瞻与落地:跟踪并研究AI训练与推理领域的前沿技术,推动其在平台中的落地应用。
任职要求 / Qualifications:
- 本科及以上学历,计算机相关专业,精通Golang,深入理解其运行机制、并发模型及性能优化;熟练掌握Python。
- 云原生与容器化:深入掌握Kubernetes原理,包括但不限于集群调度机制、Controller模式、Service、CNI、CSI等,具备大规模K8s集群运维或开发经验者优先。
- AI框架与生态:熟悉主流AI训练与推理框架(如PyTorch、TensorFlow等),了解Megatron-LM、veRL、Ray、vLLM、SGLang等至少一种分布式训练或高性能推理框架的原理与应用。
- 硬件与系统:了解CPU/GPU等计算硬件特性,熟悉网络、分布式存储等相关技术。
- 综合能力:具备良好的系统设计能力、问题排查能力和团队协作精神,对技术有热情,能承受一定压力。
- 加分项:有大规模AI模型(LLM、多模态等)训练或推理平台开发、部署经验;有GPU集群训推一体平台解决方案交付经验; 在开源社区有相关项目贡献或技术博客。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。