Job description
亮点 / Highlights:
- 场景多:服务C/B/D多端,业务种类多样,站在更高的视角思考和探索评测对推进各类Agent落地的方法论,与团队与业务共同探索评测本身的标准范式。
- 成长快:STL组织,完善的新人培养和融入机制,团队同学多来自业内大厂,在算法工程、大模型应用方面有深厚的技术积累,能够在团队中快速成长。与团队成员共同解决挑战性技术问题,享受多元化的技术交流和学习机会;在多样的业务场景中深入洞察Agent效果提升的关键法门 可通过以下博客了解我们团队 https://km.sankuai.com/collabpage/2769549772 https://tech.meituan.com/2026/05/07/Agent-AI-Coding.html
岗位职责 / Duties: 1.负责AI Agent评测体系的产品化建设,面向Agent设计科学、可扩展的评测方法与产品流程;
2.数据闭环与模型策略驱动:将评测数据转化为模型迭代的策略输入,建立"评测→归因→策略建议→效果验证"的数据驱动闭环,推动 Agent 能力持续提升形成飞轮。
3.平台型评测产品建设:面向不同业务方的 Agent 评测诉求,设计可配置、可复用、可运营的平台功能,包括评测任务管理、Case/数据集管理、Rubric/标签体系、Evaluator 配置、人评/机评协同、结果分析、回归对比,推动评测方法沉淀为标准化产品能力。
4.持续跟进并解决业务接入过程中的问题,以客户为中心,结合平台视角,从用户痛点和需求中识别出有价值的功能点沉淀在平台,持续提升用户使用体验。
任职要求 / Requirements: 1.本科及以上学历,3年以上大模型评测 或 Agent 产品 或 B 端平台产品相关经验。
-
AI实战经验:高频使用 AI/Agent 工具完成真实工作任务,能将 AI 用于需求分析、外部调研、数据分析、原型设计、文档产出等 PM 工作流,并能判断 AI 产出质量与适用边界。
-
PM素养:具备扎实的产品基本功,能够从复杂业务问题中抽象平台能力,完成需求定义、方案拆解、优先级判断、产品设计、数据分析和效果复盘。
-
团队协作:具备良好的跨团队沟通和项目推进能力,能与算法、工程、运营、标注资源及业务方协同拉齐目标、推动落地,并持续处理反馈和冲突。
-
追求评测方案的科学性与细节完备性,并对新范式保持高敏感,关注 Claude Code / OpenClaw 等 Agent 工具链演进,并能转化为相应评测策略。