Meituan

Agent Researcher(大模型智能体学习方向)

Meituan

北京市, 上海市Posted Apr 1, 2026

Job description

亮点 / Highlights:

  • 直接参与 Agent 学习范式的核心研究与建设,研究主题覆盖后训练、在线学习、过程监督、记忆机制、环境与可验证性等高价值方向。
  • 岗位聚焦的不是传统静态 benchmark 优化,而是更贴近真实智能体能力演进的问题,包括交互、探索、信用分配、长期任务与动态环境中的学习。
  • 有机会从研究问题定义开始,持续推进到方法设计、实验系统、评测体系与能力落地,形成完整且有影响力的研究闭环。
  • 优秀候选人将有机会主导关键研究课题,推动成果转化为论文、技术资产、核心能力模块或系统原型。
  • 团队强调研究深度与工程落地并重,适合希望长期深耕 LLM Agent / RL / Memory / Process Supervision 的候选人。

岗位职责 / Duties:

  • 负责面向 Agent 的大模型后训练新范式研究与落地,围绕智能体在复杂环境中的规划、决策、工具使用与长时程任务执行能力,探索具备实际效果的新方法。
  • 负责 On-policy learning、Online learning 在 Agent 场景中的方法设计、实验验证与系统化推进,研究如何让模型在交互环境中实现持续试错、自我改进与稳定提升。
  • 负责智能体记忆机制相关研究,包括长期记忆、工作记忆、情景记忆、可检索记忆、记忆治理与记忆利用策略,提升模型在复杂任务、多轮交互与跨轮目标一致性上的表现。
  • 负责过程奖励模型(PRM)、过程监督、轨迹级反馈建模及相关可验证学习信号的研究,提升模型在中间推理步骤、行为序列与决策过程上的可优化性与可控性。
  • 推动 Agent 研究所需的数据、环境、评测与训练基础设施建设,包括但不限于交互环境设计、自动化数据构造、可验证评估、实验分析工具链与训练范式迭代。
  • 跟踪学界与业界前沿进展,围绕 Agent learning、RL for LLM、过程监督、记忆、环境可验证性等方向开展系统调研,形成高质量研究方案,并推动论文、技术报告、原型系统或核心能力建设。
  • 与模型、数据、系统、应用等相关团队协作,将研究成果沉淀为可复用的方法论与能力模块,支持更大规模的 Agent 能力演进。