JD.com

软件开发岗

JD.com

北京市Posted Mar 25, 2026

Job description

大数据工程部定位于为基座模型及业务提供高质量数据与 AI 化解决方案。我们以数据为核心,通过数据工程与模型算法相结合的方式,加速大模型在数据、实验与评测环节的迭代效率,持续沉淀高价值数据资产,支撑模型与应用的演进。在具体实践中,我们面向多语言、多模态大模型训练,开展数据清洗、去重、打标等关键算法与方法建设,并系统性构建预训练与后训练数据管道,从质量、覆盖度与多样性等维度提升数据整体水平,持续助力模型效果提升。同时,我们积极探索合成数据、数据规模扩展规律、多模态数据对齐等前沿数据方向,将数据侧的创新转化为可验证、可复用的模型收益。

岗位职责 1.设计分布式爬虫与调度策略,支撑万亿级 Token 数据供给,开发高可用采集工具,突破反爬,对接多源数据,保障日均 TB 级采集能力; 2.参与搭建自动化清洗 / 去重 / 脱敏流水线,保障数据质量与合规性。维护采集 - 存储 - 处理全链路,监控 SLA,支持云原生与私有化部署; 3.优化数据策略,提升数据性价比与模型对齐度;

任职要求 / Qualifications: 任职要求 1.本科及以上,计算机相关专业,海量数据采集 / 爬虫 / 数据工程经验,有 LLM 数据交付经验优先; 2.精通 Python/Go/Java 任一,熟悉分布式爬虫、反爬与数据治理; 3. 掌握 Spark/Kafka/Airflow 等技术,具备云原生部署与监控能力; 4. 熟悉数据合规与隐私保护,能独立解决高并发、高可用、高风险采集问题; 5.符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。 加分项 1.有万亿级预训练数据管线建设经验; 2.掌握多模态采集与质量评估体系; 3.具备数据安全与隐私计算实践经验。