Job description
亮点 / Highlights: 团队资源丰富,技术审美优秀,在MoE、原生多模、scaling law、self-play等技术方向都有较为前沿的探索经验。
岗位职责 / Duties: 简介:探索下一代大模型训练范式,从模型结构、训练策略、数据策略、算力利用率等角度切入,打造具有更强能力和更高潜力的基座模型。 1、设计更高效的模型结构,提高给定数据量、计算量、硬件资源、序列长度等约束下的模型能力和潜力,如长序列能力、记忆能力、推理能力等。 2、探索更科学的训练策略,对影响training dynamic的关键变量(如学习率、batchsize、初始化等)形成更科学的认知。探索更前沿的训练范式(如diffusion LLM,test-time scaling等具有潜力的技术),发现更高效和稳定的scaling路径。 3、研究模型结构和数据的耦合关系,优化分阶段训练范式。研究模型早期表现和能力上限之间的关系。 4、结合MLsys解决大规模训练和推理中遇到的卡点问题,实现算法和工程联合设计。
任职要求 / Requirements: 1、熟悉NLP、LLM、MLsys、Optimization、OR、Control、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验。 2、熟悉主流大模型技术 3、熟悉PyTorch、 Megatron、DeepSpeed 、vLLM、SGLang等主流开源训练和推理框架。