1.简单分布式爬虫结构

本次分布式爬虫采用主从模式。主从模式是指由一台主机作为控制节点负责所有运行网络爬虫的主机进行管理,爬虫只需要从控制节点那里接收任务,并把新生成任务提交给控制节点就可以了,在这个过程中不必与其他爬虫通信,这种方式实现简单利于管理。而控制节点则需要与所有爬虫进行通信,因此可以看到主从模式是有缺陷的,控制节点会成为整个系统的瓶颈,容易导致整个分布式网络爬虫系统性能下降。 此次使用三台主机进行分布式爬取,一台主机作为控制节点,另外两台主机作为爬虫节点

2.控制节点ControlNode

  控制节点主要分为URL管理器、数据存储器和控制调度器。控制调度器通过三个进程来协调URL管理器和数据存储器的工作:
  1. 一个是URL管理进程,负责URL的管理和将URL传递给爬虫节点;
  2. 一个是数据提取进程,负责读取爬虫节点返回的数据,将返回数据中的URL交给URL管理进程,将标题和摘要等数据交给数据存储进程;
  3. 最后一个是数据存储进程,负责将数据提取进程中提交的数据进行本地存储;
20180425 控制节点执行流程