Job description
亮点 / Highlights: 紧跟人工智能行业进展,接触到前沿技术和行业趋势,磨练出对人工智能的独到见解; 参与大模型评测的全流程体系,了解从理论到工程实践的全面技能; 与一流的人工智能团队合作,快速成长,提升自身能力; 有机会参与部门的重点项目,跨足不同领域,拓宽人工智能技术的应用范围;
岗位职责 / Duties: 评测体系建设:面向用户交互场景,设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现,并主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效; 搭建自动化评测工程:通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见,持续提升自动评测与人工标注的一致性,推动评测提效 数据生产与质量管控:主导评测/训练数据合成方案设计,建立标注规范与质检体系,同时与数据团队协作,保障大规模数据生产的稳定性与准确性 模型迭代支撑:输出结构化评测报告,将评测结论转化为可落地的优化建议,与模型训练团队深度协作,建立"评测→优化→再评测"闭环 沉淀团队评测方法论,输出可复用框架与工具
任职要求 / Requirements: 计算机、人工智能、统计学、数学或相关专业,本科及以上学历,3年大模型评测工作经验以上优先 熟悉业界主流评测工具集和评测集,有独立设计评测框架和评测标准经验 了解Python语言,有实际开发、测试开发或评测工具开发经验优先 具备模型和AI产品分析能力,根据评测结论提出优化建议,驱动优化落地 关注业界前沿AI模型和产品发展,关注AI前沿评测方法发展,并转化为内部评测实践,并且能够熟练借助AI工具进行快速验证,具备Vibe coding或自动化流程搭建能力,支持方案快速验证与落地迭代 积极主动,对AI和大模型领域有激情,喜欢找办法解决问题,具备较强的团队协作能力、组织协调能力、复杂问题解决能力