
Job description
我们在做什么?我们在通过探索 scaling 语音预训练和后训练,来让模型涌现出真正的语音超级智能。
- Data
- 海量语音数据处理:建设超大规模真实语音数据发掘、采集、预处理与清洗的流水线
- 高质量语音数据处理:搭建在海量真实语音中对高质量数据进行定义、召回、标注的流水线
- Backbone & Infra
- 语音原生架构:探索随着语音数据 scaling 收益上限最高的建模架构,不限于离散或者连续建模
- 高效训推框架:适配最契合语音模型架构的训练和推理框架,兼顾性能和效率
- Pretrain & Post-train
- 定义语音生成式预训练:围绕可泛化的语音预训练模型展开前沿探索性研究,坚定 scaling 路线
- 强化学习后训练:为语音预训练模型的强大能力提供语音对话的交互方式,激发预训练潜力
- Evaluation & Product
- 全面评估框架:定义和构建从预训练到后训练的评估方式
- 创新产品:搭建最适配模型能力的创新型产品