Meituan

LongCat大模型 - Agent 评测产品经理(欢迎算法/工程转型)

Meituan

北京市, 上海市Posted Jul 22, 2026

Job description

亮点 / Highlights:

  1. 定义行业评测标准:主导构建覆盖"认知-决策-执行"全链路的Agent评测体系,推动 Agent 从 Demo 走向生产。
  2. 前沿方向:AI Agent 正从"能对话"走向"能交付",处于范式变革的关键节点。
  3. 转型友好:明确欢迎算法/工程背景转型,从"实现能力"走向"定义效果",从"写代码/训模型"走向"搭体系/做闭环"。

岗位职责 / Duties:

  1. Agent能力评测体系设计:围绕 OpenClaw、Claude Code 等主流 Agent 框架,设计并落地适配长程任务场景的评测体系,确保 Agent 在真实约束下的交付稳定性与可度量性。
  2. 评测流程与资源建设:设计 Coding、数据分析等核心生产力场景的端到端评测流程,搭建自动化评测数据生产与自动化 Rubrics 生成的标准化 pipeline;同时建设具备强技术背景的专家标注资源池,确保 Case 评审、效果判定等关键环节的专业度与一致性。 3.数据闭环与模型策略驱动:将评测数据转化为模型迭代的策略输入,建立"评测→归因→策略建议→效果验证"的数据驱动闭环,推动 Agent 能力持续提升形成飞轮。 4.前沿框架跟踪与评测策略适配:持续跟踪 OpenClaw、Claude Code 及行业前沿 Agent 框架的能力演进与架构变化,及时调整评测策略与度量标准,确保评测体系与 Agent 技术范式同步迭代。

任职要求 / Requirements:

  1. 本科及以上学历,1年以上大模型评测或智能体应用落地相关经验。
  2. 追求评测方案的科学性与细节完备性,并对新范式保持高敏感,关注 Claude Code / OpenClaw 等 Agent 工具链演进,并能转化为相应评测策略。
  3. 对评测、观测、数据闭环有直觉,具备基于数据的归因分析能力。
  4. 具有良好的沟通能力、评测资源搭建与管理能力、跨团队合作精神以及较强的问题解决能力。