Job description
岗位职责:
- 负责多平台(Web/H5/APP/小程序)大规模数据采集系统的架构设计与开发,构建稳定高效的分布式爬虫体系
- 深入研究和对抗各类反爬机制,包括但不限于请求校验、签名算法、风控策略、设备指纹、人机识别、验证码等,持续提升数据获取能力
- 负责批量爬虫的框架建设,实现爬虫任务的高效调度、监控告警、数据质量保障,支撑TB级数据采集需求
- 对接灰黑产情报体系,了解各类代理IP池、账号资源池、指纹伪造等资源的获取途径与使用策略,构建资源管理与风控对抗能力
- 参与工业领域数据的采集规划,针对不同数据源制定最优抓取策略并持续迭代优化
- 与数据工程团队协作,打通采集→清洗→结构化→入库的全链路,确保数据及时、准确、完整的落地
任职要求 / Qualifications: 任职要求:
- 本科及以上学历,计算机相关专业,3年以上爬虫/反爬相关工作经验
- 精通至少一种编程语言(Python/Go/Java/JS),具备扎实的编码能力和工程素养
- 深刻理解反爬对抗技术,能独立解决各类反爬限制。
- 精通批量爬虫构建,熟练使用Scrapy等框架开发分布式爬虫系统,具备大规模数据采集的架构设计与性能优化经验
- 熟悉灰黑产资源生态,了解常见代理IP池、指纹浏览器、接码平台等资源获取和管理策略
- 熟悉抓包分析(Fiddler/Charles/Wireshark)、Hook技术(Frida/Xposed)、APP反编译等逆向工程手段者优先
- 熟悉MySQL、Redis、Kafka、Elasticsearch等中间件的使用和调优
- 具备较强的自驱力和攻坚能力,能独立解决复杂技术问题
加分项: • 有爬虫框架或采集平台自研经验 • 有风控安全、黑灰产对抗相关背景 4. 基本素质: 团队协作:具备良好的沟通能力和团队合作精神,能够与业务、算法、产品等多方高效协同; 问题解决:具备独立分析和解决问题的能力,能应对复杂数据场景,提出有效技术方案; 责任心:工作认真负责,对数据质量与项目进度有高度责任心; 学习能力:具备较强的学习能力和创新意识,能持续跟踪数据技术发展,推动技术落地与优化。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。