Job description
亮点 / Highlights:
- 参与高复杂度、高并发、超大规模算力的AI基础设施平台建设。
- 从内核驱动、容器运行时到调度层,深入系统各层,打磨全栈基础设施能力。
- 与算法与工程团队紧密合作,技术成长空间大。
岗位职责 / Duties:
- 负责机器学习平台的资源调度系统设计与优化,提升集群资源利用率。
- 构建和维护大规模算力集群,支撑大规模分布式训练、推理等多样化 AI 工作负载,保障高可用与高性能运行。
- 与算法和工程团队协作,优化训练任务调度策略,针对 GPU 计算、显存、互联带宽等关键路径进行性能调优,降低训练成本与时间。
- 建设覆盖硬件、驱动、调度链路的全栈可观测体系,基于监控数据驱动资源优化与容量预测决策。
- 开发自动化运维工具,实现任务调度、监控告警与故障自愈能力。
- 跟踪业界前沿技术,持续改进集群管理与调度架构。
任职要求 / Requirements:
- 计算机基础扎实,熟练掌握Go、Python或Java至少一种编程语言。
- 3年以上软件开发或系统架构经验,有大规模集群管理经验者优先。
- 熟悉Kubernetes、Containerd、Docker等云原生核心技术栈和云原生开发模式。
- 具备良好的系统设计与问题排查能力,有机器学习平台开发经验者优先。