
前言
单机 Scrapy 爬虫受限于队列、内存无法实现多机器协同抓取,Scrapy-Redis 依托 Redis 实现全局任务队列、分布式去重、断点续爬,多台服务器共享待爬 URL 池与已爬指纹库,是中大型爬虫项目集群标配。本章实现 Redis 键结构配置、爬虫改造、布隆过滤器去重、增量抓取、对接前文代理池 / UA 池 / Cookie 池,落地可直接上线的分布式爬虫工程。
本文所需依赖官方文档超链接:

单机 Scrapy 爬虫受限于队列、内存无法实现多机器协同抓取,Scrapy-Redis 依托 Redis 实现全局任务队列、分布式去重、断点续爬,多台服务器共享待爬 URL 池与已爬指纹库,是中大型爬虫项目集群标配。本章实现 Redis 键结构配置、爬虫改造、布隆过滤器去重、增量抓取、对接前文代理池 / UA 池 / Cookie 池,落地可直接上线的分布式爬虫工程。
本文所需依赖官方文档超链接: