Job description
- Agent 评测体系建设:设计并落地 Agent 能力评测框架,定义评测维度(任务完成率、推理能力、工具调用准确性、鲁棒性等),构建自动化评测流水线,支撑模型与 Agent 系统的持续迭代。
- Agent 自动化测试平台建设:搭建面向 Agent 产品的自动化测试平台,覆盖端到端场景回归、Prompt 回归、对抗性测试等能力,保障 Agent 线上质量与稳定性。
- Agent 任务识别与治理:对 Agent 执行链路进行任务识别、意图拆解与行为分析,建立任务分类体系与异常治理机制,推动 Agent 在真实业务场景中的可控落地。
- 多模态大模型落地应用:参与多模态大模型(视觉-语言、语音-语言等)在 Agent 场景中的工程化落地,包括能力评估、场景适配、效果优化与性能调优。