
Job description
图像与多模态实验室致力于构建涵盖语言、视觉、语音等多种模态的基础模型,支持多模态感知、理解、推理、生成与编辑等核心任务。我们的目标是为模型应用提供世界一流的基础模型保障,推动从纯语言任务到多模态任务的拓展,并实现从数字世界到物理世界的深度融合。 岗位职责
- 参与全模态交互世界模型的研发和落地工作(实习生以发论文为主,正式员工技术研究落地为主),包括但不限于t2v/i2v/ti2va等基础模型模态研发(如videovae/audiovae/dit/vsr/pe/caption)、全模态交互视频生成和世界模型等;
- 参与探索多模态大语言模型mllm如deepseek/qwen与世界模型相结合,如理解生成一体化,包括但不限于:全模态理解推理、多轮交互、rl后训练等。
- 参与探索实时可交互全模态视频生成技术,包括但不限于moe/sparse attention模型架构设计,蒸馏加速,模型压缩,长视频生成,工程量化等。
- 参与优化全模态数据管线,包括数据清洗/构建/scale up/线上数据回流分析等数据飞轮。
- 参与制定全模态视频生成质量标准和评测体系,指导模型研发迭代,摸清跟竞品的水位。
- 在顶会顶刊上发表研究成果和开源代码,提升团队在实时全模态交互世界模型领域的学术声望;
任职要求 / Qualifications: 1.硕士及以上学历,熟悉视频生成基础模型如Sora、Veo、moviegen、hunyunvideo,wan等; 2.熟悉语音驱动视频生成、音画同步视频生成优先; 3.熟悉多模态大语言模型(deepseek/qwen等)、多模态理解生成、世界模型优先; 4.熟悉实时视频生成,推理加速优化优先;熟悉deepspeed/megatron框架和算子优化优先; 5.有多模态大语言模型、图像/视频生成、3D生成大规模训练和数据清洗构建经验者优先; 6.学习能力强、自驱、代码能力强、善于解决问题者优先; 7.有一作顶会或顶刊论文发表经历或相关知名大模型开源项目者优先。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。