JD.com

测试开发岗

JD.com

北京Posted Apr 23, 2026

Job description

部门介绍:我们是京东云,作为京东集团面向企业、政府等机构的技术服务品牌,是更懂产业的数智化解决方案提供商,致力于为企业、金融机构、政府等各类客户提供以供应链为基础的数智化解决方案。依托公、专、混的全栈式云产品矩阵,我们融合了人工智能、大数据、物联网等前沿科技,在零售、物流、健康、智能城市、金融科技等行业领域为客户提供了丰富的产品与数字化解决方案,帮助客户降低成本、提升效率,是值得信赖的产业数字合作伙伴。 岗位职责:

  1. AI产品评测体系构建:独立负责AI产品(NLP/CV/多模态等)的评测方案设计、指标制定与实施,覆盖准确性、鲁棒性、公平性、用户体验等维度,开发自动化评测工具链,构建可复用的评测框架与基线数据集;
  2. 全生命周期质量保障:主导从模型研发到上线的全流程评测,包括但不限于:数据质量评估、模型版本对比、A/B测试、线上效果监控,针对大语言模型(LLM等)、生成式AI等前沿方向设计专项评测方案;
  3. 技术赋能与团队成长:主导技术难点攻关(如幻觉检测、提示词对抗测试等),沉淀方法论并培训团队成员,搭建团队知识库,定期组织技术分享,提升整体AI评测能力;
  4. 跨团队协同:与算法、产品、研发团队深度协作,推动评测结果驱动产品迭代。

任职要求 / Qualifications: 1.具有AI/算法测试或评测经验,计算机/人工智能相关专业背景; 2 精通AI评测技术栈:熟悉主流评测框架(如HELM、OpenCompass等)及工具(如PromptBench、FMEval),掌握Python/Java,具备评测脚本开发及自动化平台搭建能力; 3.有完整主导2个以上AI产品评测项目的经验(需在面试中详细阐述); 4.具备评测体系设计视角,能根据产品阶段灵活调整评测策略,优秀的逻辑分析能力,能针对模型失效场景提出可解释的归因分析,有团队指导经验,擅长知识传递与流程规范化建设,熟悉大模型微调、RAG技术原理及对应评测方法。

符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。