16 Scrapy之分布式爬虫

news/2024/7/19 9:25:20 标签: 爬虫, python, 数据库

redis分布式部署

    1.scrapy框架是否可以自己实现分布式?

    - 不可以。原因有二。

      其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器)

      其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)

    2.基于scrapy-redis组件的分布式爬虫

        - scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。

        - 实现方式:

            1.基于该组件的RedisSpider类

            2.基于该组件的RedisCrawlSpider类

    3.分布式实现流程:上述两种不同方式的分布式实现流程是统一的

        - 3.1 下载scrapy-redis组件:pip install scrapy-redis

        - 3.2 redis配置文件的配置:

1 - 注释该行:bind 127.0.0.1,表示可以让其他ip访问redis
2 
3 - 将yes该为no:protected-mode no,表示可以让其他ip操作redis

  - 3.3 修改爬虫文件中的相关代码:

            - 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。注意:如果原始爬虫文件是基于Spider的,则应该将父类修改成RedisSpider,如果原始爬虫文件是基于CrawlSpider的,则应该将其父类修改成RedisCrawlSpider。

            - 注释或者删除start_urls列表,切加入redis_key属性,属性值为scrpy-redis组件中调度器队列的名称

        - 3.4 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道

1 ITEM_PIPELINES = {
2     'scrapy_redis.pipelines.RedisPipeline': 400
3 }

  - 3.5 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器

1 # 使用scrapy-redis组件的去重队列
2 DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
3 # 使用scrapy-redis组件自己的调度器
4 SCHEDULER = "scrapy_redis.scheduler.Scheduler"
5 # 是否允许暂停
6 SCHEDULER_PERSIST = True

  - 3.6 在配置文件中进行爬虫程序链接redis的配置:

1 REDIS_HOST = 'redis服务的ip地址'
2 REDIS_PORT = 6379
3 REDIS_ENCODING = ‘utf-84 REDIS_PARAMS = {‘password’:’123456’}

  

  - 3.7 开启redis服务器:redis-server 配置文件

        - 3.8 开启redis客户端:redis-cli

        - 3.9 运行爬虫文件:scrapy runspider SpiderFile

        - 3.10 向调度器队列中扔入一个起始url(在redis客户端中操作):lpush redis_key属性值 起始url

转载于:https://www.cnblogs.com/a2534786642/p/10998689.html


http://www.niftyadmin.cn/n/1647637.html

相关文章

Pytorch中gpu的并行运算

Pytorch中gpu的并行运算 常用的最多的就是,多块GPU训练同一个网络模型。Pytorch中的并行运算。 1. 多GPU输入数据并行运算 一般使用torch.nn.DataParallel,例如: device_ids [0, 1] net torch.nn.DataParallel(net, device_idsdevice_i…

ubuntu16.04挂载三星T5移动硬盘报错

ubuntu16.04挂载三星T5移动硬盘报错 首先查看硬盘信息sudo fdisk -l | grep NTFS例如输出如下信息:/dev/sdd1 2048 97677021 97676806 7 HPFS/NTFS/exFAT创建挂载目录(在media或者mnt目录下)sudo mkdir /media/samsung_T5 sudo chmod 777 …

按装Visual Studio Code方法

1英文改成中文安装(Ctrl Shift X)中寻找(Chinese (Simplified) Language Pack for Visual Studio Code)安装 a2在(Ctrl Shift X)中寻找(open in browser)安装 3Ctrl S快捷键网址…

Ubuntu离线安装Pytorch和torchvision

Ubuntu离线安装Pytorch和torchvision 首先明确torch和torchvision的对应依赖版本 torchtorchvisionpythoncuda1.510.61>3.610.1&#xff0c;10.21.500.6.0>3.610.1&#xff0c;10.21.4.00,5.0>3.5&#xff0c;<3.89.2&#xff0c;10.01.3.10.4.2>3.5&#xff…

spring controller中默认转发、forward转发、redirect转发之间的区别

默认转发RequestMapping("/123")public String test(HttpSession session) {System.out.println("123");return "456"; } 服务器在得到/123的请求后调用test方法&#xff0c;输出123然后寻找456.jsp(这里已经配置了视图&#xff0c;全路径为/WEB…

Image/Video Deep Anomaly Detection: A Survey阅读笔记

Image/Video Deep Anomaly Detection: A Survey阅读笔记 文章目录Image/Video Deep Anomaly Detection: A Survey阅读笔记Abstract1、Introduction2、Problem Formulation2.1、pNp_NpN​&#xff1a;Modeling Normal Data2.2、DDD&#xff1a;Detection Measure3、SupervisionS…

Deep Learning For Anomaly Detection:A Survey阅读笔记

Deep Learning For Anomaly Detection&#xff1a;A Survey阅读笔记 文章目录Deep Learning For Anomaly Detection&#xff1a;A Survey阅读笔记Abstract1、Introduction2、What are anomalies?3、What are novelties?4、Motivation and Challenges: Deep anomaly detection…

End-to-End Video Instacne Segmentation with Transformers(VisTR)阅读笔记

End-to-End Video Instacne Segmentation with Transformers&#xff08;VisTR&#xff09;阅读笔记 https://arxiv.org/abs/2011.14503 Abstract VisTR任务是一个直接的端到端并行序列解码、预测问题。 输入是一个由多个图像帧组成的视频 VisTR直接按照顺序输出视频中每个实…