Job description
亮点 / Highlights: 团队资源丰富,能够完整经历大模型训练的全流程,包括数据,模型架构设计,训练策略等
原生多模是Google(Gemini)与Openai(GPT-4o)在多模态上的共同选型,统一理解与生成,统一各个模态,探索空间巨大,能力天花板高
岗位职责 / Duties: 数据构建与处理: 深入参与大模型训练数据的设计与构建,亲手处理包括但不限于文本数据,平行语料、图文交错、图生图、图像序列等多样化数据。负责数据的采集、清洗、标注和预处理工作,为模型训练提供高质量的数据基础
模型训练与调优:参与或主导SFT / RL等后训练探索,提升模型在各类下游任务中的实际应用能力
探索如何通过数据和训练策略,激发模型采样多模态token的能力,并将其应用于解决真实物理世界的问题,参与数据驱动模型能力提升的全过程
任职要求 / Requirements: 在NLP/ CV / 语音方向有深入的理解以及研究经历,有实际处理过图、文、音等至少一类数据的项目或实习经验者优先
能保证至少3个月的全职实习,6个月及以上者优先