
Job description
1.参与建设覆盖文本、音视频及具身模型的统一评测体系,设计并落地模型评测方法与指标体系; 2.面向基座模型,构建通用能力评测(理解、推理、事实性、安全性、鲁棒性等),支撑模型版本对比与演进决策; 3.面向业务侧(客服、导购、搜索、推荐等),抽象业务目标,设计专项评测指标、用例集与评测方案; 4.负责自动化评测与判分策略(规则 / 模型判分 / 多模型互评),并协同人工标注体系提升评测可信度; 5.参与评测数据集建设,包括数据采样、难例挖掘、数据版本管理与评测结果分析; 6.与工程团队协作,打通模型数据 – 实验 – 评测全链路闭环。
任职要求 / Qualifications: 1.本科及以上学历,计算机、人工智能、自动化、机器人等相关专业; 2.熟悉至少一个方向:LLM/多模态/语音/具身智能数据、训练或评测; 3.有模型评测、Benchmark、自动化评测或数据标注相关经验优先; 4.具备将“业务问题”转化为“可量化评测指标”的能力; 5.对评测结果的稳定性、可复现性、统计显著性有基本认知。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。