Job description
亮点 / Highlights: 业界前列的多种算力规模,协同算法,AI框架,网络,计算,芯片等多个团队共同建设大模型软、硬件技术底座,接触最前沿的AI Infra基础设施,结合最前沿的AI平台软件栈,支撑最前沿的大模型不同领域的算法探索,从算法到算子,从芯片架构到互联集群,从POC到大规模场景,充满机遇与挑战,兼顾学习和成长,在垂直,水平等多个领域和维度,全面感受大模型带来的技术变革!
岗位职责 / Duties:
- 围绕大模型异构算力集群,尤其是国产算力集群,面向大模型训练和推理场景支持算力评估、适配和落地维护,具体包括分布式优化框架,AI框架,网络集合通信,算子等方面内容
- 负责大模型分布式优化框架的系统分析,性能调优,特性开发,问题定位等工作,支持常见的大模型分布式优化框架
- 负责PyTorch在异构算力下系统分析,性能调优,问题定位等工作
- 负责常见的大模型场景下高性能Kernel算子的关键指标分析和统计,融合开发,性能优化等工作
- 负责大模型超万卡规模的集合通信/NCCL关键指标分析和统计,系统定位/调优等工作
- 负责多种算力的Benchmark评测,对比验证,性能分析等工作
任职要求 / Requirements:
- 有扎实的计算机理论基础,熟练掌握C++或Python语言
- 具备良好的问题分析和一定的解决能力,具有较好的学习能力和好奇心驱动
- 对LLM和多模态模型有基本的算法理解
- 有实际的训练或推理场景实践,熟悉相关框架和算子细节