Job description
亮点 / Highlights:
-
团队具备良好的技术氛围,充足的计算资源,与志同道合的技术牛人一起工作;
-
能够深度参与到大模型核心研发工作中,并有机会在业界分享技术成果。
岗位职责 / Duties:
-
构建端到端的网页文本内容提取系统,针对网络数据的复杂性,从系统效率和模型效果角度持续优化内容提取算法,迭代生产标准;
-
设计预训练数据的全局质量优化和治理方案,优化全局采样策略、隐私保护和安全合规,提升基座模型训练效率和最终效果;
-
建设多模态交错数据处理链路,通过数据分析和配比实验等手段优化多模态数据质量和多样性,支撑多模态大模型数据需求;
-
跟进大模型数据领域前沿技术(如Data Selection、Data Influence、Curriculum Learning和合成数据等),推动数据驱动的模型性能突破;
-
负责千亿级网页的大规模处理和万亿级token数据生产,通过分布式计算、模型量化及显存优化的方式提升数据处理和生产效率。