JD.com

数据开发岗

JD.com

北京市Posted Mar 16, 2026

Job description

  1. 认知型供应链数仓底座建设: 全域数据建模:与数据BP协同,进行采购、履约、仓储、物流等全链路数据的建模与治理,解决多源异构数据的口径冲突,建设离线与实时融合的高质量数仓。 决策指标标准化:针对算法和大模型所需的关键特征,建立标准的指标计算体系,确保业务系统、BI 报表与算法模型使用的是同一套数据资产。
  2. 面向 LLM 的非结构化数据工程: 多模态语料流水线:开发自动化链路,对非结构化数据进行清洗与提取,为大模型微调提供高质量语料。 RAG基建:负责搭建高性能的向量数据库集群,开发文本切片与向量化的高效写入流程。
  3. 实时特征与决策上下文服务: 特征平台建设:基于 Flink/Spark Streaming 构建实时计算任务,为决策提供秒级的状态感知能力。 数据服务化:将复杂的底层数据封装为标准化 API 服务,确保Agent 与求解器能便捷、稳定地获取决策所需的上下文信息。
  4. 数据闭环与反馈机制: 反馈链路工程:设计并开发数据回流机制,自动收集业务人员对模型建议的采纳/修改记录,构建 RLHF所需的数据集,助力模型持续进化。

任职要求 / Qualifications:

  1. 专业技能: 专业背景:计算机相关专业本科及以上学历,3年以上大数据开发经验。 大数据栈:精通 SQL,深入理解分布式计算原理,熟练掌握 Hadoop / Spark / Flink / Kafka 等主流组件,有 PB 级数据处理经验。 编程能力:至少精通一门编程语言(Python/ Java / Scala),其中 Python 熟练者优先。 OLAP 引擎:熟悉 ClickHouse / Doris / StarRocks 等 MPP 数据库的原理与调优,有实时数仓落地经验。
  2. AI Infra / 大模型工程经验: 向量库实战:熟悉 Milvus / Pinecone / ElasticSearch 等向量存储与检索技术。 非结构化处理:有过使用 LangChain、LlamaIndex 或自定义脚本处理 PDF/HTML/Text 数据的经验。 特征工程:了解 Feature Store(特征存储)概念,有相关平台建设经验者优先。
  3. 业务理解与协作: 领域知识:了解供应链基本业务流程者优先,能理解“库存准确性”对自动化决策的致命影响。 团队协作:与算法、数据科学家紧密配合,准确理解模型对数据时效与分布特征的需求。

符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。