Job description
-
负责大语言模型(LLM)、多模态大模型(如 LLaMA、Qwen、DeepSeek、GPT、CLIP 等)的领域适配与参数高效微调(PEFT);
-
深入理解并运用模型后训练三阶段流程(SFT 监督微调、Preference Optimization偏好对齐、RL 强化学习),确保模型从指令遵循、人类偏好对齐到复杂推理能力的全链路能力提升;
-
构建高质量领域语料库,设计数据清洗、准注、增强与采样方案,开发自动化数据处理工具,搭建“数据-训练-评测”的闭环体系,提升训练数据质量;
-
探索并实践前沿强化学习对齐技术(如 GRPO、DAPO、RLVR),提升模型在复杂推理任务中的表现与用户需求对齐能力;
-
设计并实施高效微调方案,包括低秩适应技术(LoRA/QLoRA)及其与混合专家架构(MoE)的融合变体(如 MoE-LoRA),探索动态路由机制以实现多任务自适应学习;
-
优化分布式训练策略,基于 DeepSpeed 等框架实现 ZeRO 优化、)列并行、自动张量并行(AutoTP)及内存卸载等能力,平衡模型训练效果与 GPU 资源利用率;
-
构建多维度的模型评估体系,通过系统性 Prompt Engineering 与数据增强提升模型泛化能力,建立 Bad Case 分析与迭代优化机制;
-
探索模型压缩与轻量化部署技术,包括量化感知训练(QAT)、知识蒸馏及边缘端推理优化,支持端侧与边缘设备的高效部署需求;
-
跟进推理模型前沿架构(如思维链推理、Engram 条件记忆等),探索推理效率优化策略(如投机解码、KV Cache 优化等),提升模型实际部署性能。
-
硕士及以上学历,计算机科学、人工智能、数学等相关专业,具备扎实的机器学习与深度学习理论基础,拥有跨领域知识融合能力者优先;
-
3 年以上 NLP/大模型训练或微调经验,精通 Transformer、MoE (混合专家)等主流大模型架构,熟悉 LLaMA、Qwen、DeepSeek 等开源模型生态;
-
深入理解大模型微调技术,包括全量微调及参数高效微调方法(LoRA、QLoRA、MoE-LoRA 等),具备多任务场景下模型适配与调优的实战经验;
-
精通 Python,熟练使用 PyTorch 等深度学习框架,掌握大模型训练与推理工具链(DeepSpeed、Hugging Face Accelerate、vLLM、LangChain 等);
-
熟悉后训练阶段的强化学习对齐算法(GRPO、DAPO 等),理解其与传统 RLHF 的优势差异与适用场景,有推理模型微调实践经验者优先;
-
熟悉分布式训练策略,掌握数据并行、模型并行、)列并行及混合精度训练等优化方法,具备千亿参数级模型训练或微调经验者优先;
-
具备扎实的算法工程实现能力,能够独立复现前沿论文方案,拥有开源项目贡献经验(如 Hugging Face、LangChain)或在顶会发表相关论文者优先;
-
了解多模态模型微调方法(如视觉-语言模型对齐),具备跨模态任务调优经验者优先;
-
在以下至少一个领域有深入实战经验:对话系统、知识问答、检索增强生成(RAG)、内容生成、AI Agent、行业知识图谱构建与落地。