2-2srcapy的介绍、组件、数据流

程序员成长之旅 · 程序员成长之旅/Python学习/爬虫学习 · 653 字

2-2srcapy的介绍、组件、数据流

  1. 框架图

  2. 1557835565486

  3. 翻译、作用

  4. Scrapy Engine 引擎

1. 负责Scheduler、Downloader、Spiders、Item Pipeline 之间的中间的通讯信号的传递和数据传送,相当于一个通讯站。
  1. Scheduler 调度器
1. 简单来说就是一个队列。负责接收爬虫发过来的Requests请求,并将其排队,当引擎需要数据的时候就将请求队列的数据交给引擎。
  1. Downloader 下载器
1. 负责发送请求并下载数据,下载所有引擎发送过来的Requests请求,并将Responses交还给引擎,最后再由请求交还给Spiders。
  1. Spiders 爬虫
1. 爬虫策略。
  1. Item Pipeline 管道
1. 封装去重类、存储类的地方,处理Spiders获取到的数据,进行后期处理。
  1. Downloader Middlewares 下载中间件
1. 自定义扩展组件,可以放代理或者其他手段隐藏自己等。
  1. Spider Middlewares 爬虫中间件
1. 可以自定义扩展Spider到引擎之间的数据。
  1. 工作方式

  2. 传递入口URL

NoData

Requests

OK

Fail

More

ltems

开始爬虫

Scrapy Engine

Scheduler

结束爬虫

Downloader

Spiders

ltem Pipeline 2.

附件