
Job description
参与或主导以下一个或多个关键领域的工作:
- 大语言模型/多模态大模型SFT微调、指令跟随、后训练RLHF精调与偏好对齐;
- 大语言模型/多模态大模型强化学习Reasoning模型算法、Reward模型、Verifier等算法研发;
- 大语言模型/多模态强化Reasoning大模型长CoTs效率效果优化与RL Scaling-law研究;
- 大语言/多模态大模型Agent算法研发;
- 大语言/多模态大模型强化学习Test-time Compute在线推理算法研发。
任职要求 / Qualifications:
- 硕士及以上学历,计算机、数学、人工智能及STEM等相关专业;
- 拥有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
- 熟悉语言或多模态模型的基本算法、模型结构及基础技术,相信AGI和对相关工作抱有热情;
- 工作认真务实,科学规划,具有极致的探究精神且知行合一,具备较强的责任感; 加分项:
- 有大模型相关的顶会论文的工作者优先;有STEM竞赛经历者优先;
- 熟悉强化学习算法和框架相关技术和细节,曾深度参与后训练/强化推理大模型/Agent等项目;
- 具有扎实的工程能力,熟悉开源大模型相关工具使用,有积极提升效果效率的意识。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。