scrapy如何在python分布式爬虫中构建?-中华考试网

导航

优质课程直播间官网直达

网络开发

首页> python> python爬虫> 文章内容

scrapy如何在python分布式爬虫中构建?

来源 :中华考试网 2020-11-27

中

　　Scrapy

　　在Ubuntu安装Scrapy的步骤为：打开终端 >> 在终端输入命令：pip install scrapy >> 在终端输入命令：scrapy version >> 成功输出 Scrapy版本号则证明成功安装。

　　各模块作用

　　1. items

　　爬虫抓取数据的工作实际上是从非结构化数据(网页)中提取出结构化数据。虽然Scrapy框架爬虫可以将提取到的数据以Python字典的形式返回，但是由于Python字典缺少结构，所以很容易发生返回数据不一致亦或者名称拼写的错误，若是Scrapy爬虫项目中包含复数以上的爬虫则发生错误的机率将更大。因此，Scrapy框架提供了一个items模块来定义公共的输出格式，其中的Item对象是一个用于收集Scrapy爬取的数据的简单容器。

　　2. Downloader Middleware

　　Downloader Middleware是一个Scrapy能全局处理Response和Request的、微型的系统。Downloader Middleware中定义的Downloader Middleware设有优先级顺序，优先级数字越低，则优先级越高，越先执行。在本次分布式爬虫中，我们定义了两个Downloader Middleware，一个用于随机选择爬虫程序执行时的User-Agent，一个用于随机选择爬虫程序执行时的IP地址。

　　3. settings

　　settings模块用于用户自定义Scrapy框架中Pipeline、Middleware、Spider等所有组件的所有动作，且可自定义变量或者日志动作。

分享到

网络开发

scrapy如何在python分布式爬虫中构建?

您可能感兴趣的文章

scrapy如何在python分布式爬虫中构建?

python分布式爬虫中spider_Worker节点是什么？

scrapy可以独立在python分布式爬虫内使用吗?

python分布式爬虫中的消息队列是什么？

rpop方法如何在python分布式爬虫中使用？

python爬虫节点是什么?怎么用?

资讯

我的