2-2srcapy的介绍、组件、数据流
程序员成长之旅 · 程序员成长之旅/Python学习/爬虫学习 · 653 字
2-2srcapy的介绍、组件、数据流
框架图

翻译、作用
Scrapy Engine 引擎
1. 负责Scheduler、Downloader、Spiders、Item Pipeline 之间的中间的通讯信号的传递和数据传送,相当于一个通讯站。
- Scheduler 调度器
1. 简单来说就是一个队列。负责接收爬虫发过来的Requests请求,并将其排队,当引擎需要数据的时候就将请求队列的数据交给引擎。
- Downloader 下载器
1. 负责发送请求并下载数据,下载所有引擎发送过来的Requests请求,并将Responses交还给引擎,最后再由请求交还给Spiders。
- Spiders 爬虫
1. 爬虫策略。
- Item Pipeline 管道
1. 封装去重类、存储类的地方,处理Spiders获取到的数据,进行后期处理。
- Downloader Middlewares 下载中间件
1. 自定义扩展组件,可以放代理或者其他手段隐藏自己等。
- Spider Middlewares 爬虫中间件
1. 可以自定义扩展Spider到引擎之间的数据。
工作方式
传递入口URL
NoData
Requests
OK
Fail
More
ltems
开始爬虫
Scrapy Engine
Scheduler
结束爬虫
Downloader
Spiders
ltem Pipeline 2.