Job description
亮点 / Highlights: 大模型领域前沿研究问题和挑战;丰富的计算资源;追求极致的团队氛围
岗位职责 / Duties:
- 提升模型general reasoning的能力:提升模型在创作、人类偏好、指令遵循等各专项上的能力;减少reasoning model的幻觉情况和reward hacking情况
- 提升模型frontier reasoning的能力:研发面向下一代reasoning model的架构设计,研究test-time scaling的训练范式,从ENV/reward/action三个视角进行RL scaling,提升模型的复杂任务处理能力和智能水平。
- 构建model as agents:研究模型解决数字世界所有任务所需原生掌握的最小工具集合和meta skill,探索统一模态的reasoning