Job description
亮点 / Highlights:
- 深度参与AI Agent前沿技术的评测与优化,了解大模型在真实业务场景下的应用逻辑;
- 近距离接触行业主流大模型体系与评测标准,积累AI产品与评测的系统化经验;
- 学习如何将模型能力拆解为可度量指标,提升逻辑分析与问题抽象能力;
- 有机会参与新功能、新场景的评估设计,获得从0到1构建评测体系的实战经验。
岗位职责 / Duties:
- 参与AI Agent的评测,帮助团队识别AI Agent在不同业务场景中的表现;
- 协助制定评测标准、设计和执行评测方案、收集和分析评测数据,并撰写评测报告提供有价值的反馈和建议;
- 协助评测团队完成日常工作流程的优化和工具的使用,提升评测效率;
- 跟踪和研究行业内大语言模型技术和评测方法,为团队提供前沿的知识和见解。