Job description
亮点 / Highlights:
-
有充足的数据和 GPU 资源用于实验探索
-
拥有独特的垂直领域高质量数据(本地生活场景),获得在业内最前沿的大模型认知和技术积累,既能做前沿 Research,也有直接的落地场景
-
工作环境优越,团队扁平,讨论、合作氛围好
-
提供实习津贴和转正机会
-
工作地点:北京、上海
岗位职责 / Duties:
-
探索模型通过 RL Scaling 等方式使用成套工具解决复杂问题的行动和规划能力,包括 Human in the Loop 多轮交互下 Agent 基础建模的新方案、以及与复杂环境的交互学习能力
-
探索模型在 Non-Rule Based Outcome 场景下利用复杂信息进行有效 Reasoning 推理的范式,包括 Proactive Agent 的建模方案
-
探索研究更多内在奖励的机制,从而激发模型主动学习和自我更新的能力
-
探索构建长期记忆机制,为下一代高效的推理模型、长序列推理及建模提供基础