Meituan

机器学习资源调度系统工程师

Meituan

北京市, 上海市Posted Apr 27, 2026

Job description

亮点 / Highlights:

  1. 参与高复杂度、高并发、超大规模算力的AI基础设施平台建设。
  2. 从内核驱动、容器运行时到调度层,深入系统各层,打磨全栈基础设施能力。
  3. 与算法与工程团队紧密合作,技术成长空间大。

岗位职责 / Duties:

  1. 负责机器学习平台的资源调度系统设计与优化,提升集群资源利用率。
  2. 构建和维护大规模算力集群,支撑大规模分布式训练、推理等多样化 AI 工作负载,保障高可用与高性能运行。
  3. 与算法和工程团队协作,优化训练任务调度策略,针对 GPU 计算、显存、互联带宽等关键路径进行性能调优,降低训练成本与时间。
  4. 建设覆盖硬件、驱动、调度链路的全栈可观测体系,基于监控数据驱动资源优化与容量预测决策。
  5. 开发自动化运维工具,实现任务调度、监控告警与故障自愈能力。
  6. 跟踪业界前沿技术,持续改进集群管理与调度架构。

任职要求 / Requirements:

  1. 计算机基础扎实,熟练掌握Go、Python或Java至少一种编程语言。
  2. 3年以上软件开发或系统架构经验,有大规模集群管理经验者优先。
  3. 熟悉Kubernetes、Containerd、Docker等云原生核心技术栈和云原生开发模式。
  4. 具备良好的系统设计与问题排查能力,有机器学习平台开发经验者优先。