scrapy爬虫部署服务器的方法步骤

2023-04-27 原文

一、scrapy爬虫部署服务器

scrapy通过命令行运行一般只用于测试环境，而用于运用在生产环境则一般都部署在服务器中进行远程操作。

scrapy部署服务器有一套完整的开源项目：scrapy scrapyd(服务端) scrapy-client(客户端) scrapydweb

1、scrapyd

1.介绍

Scrapyd是用于部署和运行Scrapy爬虫的应用程序。它使您可以使用JSON API部署（上传）项目并控制其爬虫。

是目前分布式爬虫的最好解决方法之一

官方文档 https://scrapyd.readthedocs.io/

2.安装

pip install scrapyd

安装过程中可能会遇到大量的错误，大部分都是所依赖的包没有安装，安装过程中要确保scrapy已经安装成功，只要耐心的将所有缺少的依赖包安装上就可以了

打开命令行，输入scrapyd，如下图：

浏览器访问：http://127.0.0.1:6800/

2、scrapy-client

1.介绍：

scrapy-client它允许我们将本地的scrapy项目打包发送到scrapyd 这个服务端（前提是服务器scrapyd正常运行）

官方文档https://pypi.org/project/scrapyd-client/

2.安装

pip install scrapy-client

和上面的scrapyd一样，可能会遇到各种错误，耐心一点，大部分都是安装依赖

3、scrapydweb（可选）

1.介绍

ScrapydWeb：用于Scrapyd集群管理的Web应用程序，支持Scrapy日志分析和可视化。

官方文档：https://pypi.org/project/scrapydweb/

2.安装

pip install scrapyd

在保持scrapyd挂起的情况下运行命令scrapydweb，也就是需要打开两个doc窗口

运行命令scrapydweb，首次启动将会在当前目录下生成配置文件“scrapydweb_settings_v*.py”

更改配置文件
编辑配置文件，将ENABLE_LOGPARSER更改为False

添加访问权限

SCRAPYD_SERVERS = [
    '127.0.0.1:6800',
    # 'username:password@localhost:6801#group',
    ('username', 'password', 'localhost', '6801', 'group'),
]

HTTP基本认证

ENABLE_AUTH = True
USERNAME = 'username'
PASSWORD = 'password'

浏览器访问：http://127.0.0.1:5000/1/servers/

二、实际操作（一切的操作都在scrapyd启动的情况下）

1.上传爬虫

编辑scrapy.cfg,url是scrapyd服务器的位置，由于scrapyd在本地，所以是localhost。

注意：我们要切换到和scrapy.cfg同级目录下，继续以下操作

scrapyd-deploy

上图表示运行成功！

以上的文件夹是成功后自动创建的（为什么之前的截图有，我之前已经测试过）

然后输入以下命令上传服务器

scrapyd-deploy demo -p qcjob

结构：scrapyd-deploy -p （scrapyd-deploy <目标> -p <项目>）

运行成功的图片

2.启动爬虫

cmd输入（爬取一天内关于java的职业需求）

curl http://localhost:6800/schedule.json -d project=qcjob -d spider=job -d key = java time=0

我编写的爬虫可以根据用户输入的参数来爬取数据

key=表示关键字（默认是全部）

time=表示时间（0=24小时，1=3天内，2=一周内，3=一个月内，默认为0）

当然scrapyd强大之处在于可以用http方式控制爬虫

http://localhost:6800/schedule.json?project=qcjob&spider=job&key=java&time=0 #POST

以下是用postmain进行模拟post请求。

然后进入http://127.0.0.1:6800/

点击job，就可以查看爬虫是否运行，和运行时间

从图可以看出，这个爬虫运行了9分31秒。

当然我们也可以从scrapydweb中查看和管理爬虫浏览器访问：http://127.0.0.1:5000/1/servers/

我们可以通过可视化界面来控制爬虫运行，scrapyd可以启动多个不同的爬虫，一个爬虫的多个版本启动。是目前分布式爬虫的最好解决方法！！！

三、数据展示

本次爬取花费9分31秒，共爬去25,000余条数据，爬虫速度开至每秒8次访问，以他该服务器的最大访问量

其中部分数据存在有误，为了保证速度，没有进行过多的筛取和排查，错误率保持较低水平

四、问题与思考

通过爬去可以看得出，如果采用单一的爬虫的话，爬取速度还是比较慢的，如果采用多个爬虫，分布式爬取的话，就存在数据是否重复以及数据的共用问题。
如果采用分布式爬虫的话，就涉及到ip代理，因为一台机器如果大量访问的话经过测试会导致浏览器访问，该网页都无法打开，如果设置IP代理，就需要大量的代理IP
虽然爬虫已经部署在服务器上，但是还是无法做到，通过用户输入关键字时间等地址等多个参数进行爬取数据，无法做到实时展示，只能先运行爬虫，爬取大量数据储存与数据库，然后才能进行分析，做出图表。
关于数据的统计与展示，单一的sql语句，很难满足其对大量数据的分析，可能需要用Python的数据分析库，对数据进行处理，然后才能展示。

五、收获

已经可以通过http请求的方式来控制爬虫的启动停止，以及传递参数，就等于scrapy爬虫是可以集成于web应用里面的。

到此这篇关于scrapy爬虫部署服务器的方法步骤的文章就介绍到这了,更多相关scrapy爬虫部署服务器内容请搜索Devmax以前的文章或继续浏览下面的相关文章希望大家以后多多支持Devmax！

scrapy爬虫部署服务器的方法步骤的更多相关文章

Node.js编写爬虫的基本思路及抓取百度图片的实例分享

这篇文章主要介绍了Node.js编写爬虫的基本思路及抓取百度图片的实例分享,其中作者提到了需要特别注意GBK转码的转码问题,需要的朋友可以参考下
Python爬取奶茶店数据分析哪家最好喝以及性价比

这篇文章主要介绍了用Python告诉你奶茶哪家最好喝性价比最高，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习吧
node.js爬虫框架node-crawler初体验

这篇文章主要介绍了node.js爬虫框架node-crawler的相关资料，帮助大家利用node.js进行爬虫，感兴趣的朋友可以了解下
Vue项目打包并部署nginx服务器的详细步骤

vue项目开发好之后需要部署到服务器上进行外网访问,下面这篇文章主要给大家介绍了关于Vue项目打包并部署nginx服务器的相关资料,文中通过实例代码介绍的非常详细,需要的朋友可以参考下
nodeJs爬虫的技术点总结

本篇文章给大家总结了关于nodeJs爬虫的技术点的相关知识，对爬虫有兴趣的朋友可以跟着学习参考下。
python 基于aiohttp的异步爬虫实战详解

这篇文章主要为大家介绍了python 基于aiohttp的异步爬虫实战详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
Python爬虫采集Tripadvisor数据案例实现

这篇文章主要为大家介绍了Python爬虫采集Tripadvisor数据案例实现，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
node.js实现博客小爬虫的实例代码

这篇文章通过实例代码来给大家介绍如何利用node.js实现博客小爬虫，有需要的朋友们可以直接运用文中给出的实例代码来进行实践学习，感兴趣的朋友们下面来一起看看吧。
一篇文章教会你部署vue项目到docker

在前端开发中,部署项目是我们经常发生的事情,下面这篇文章主要给大家介绍了关于部署vue项目到docker的相关资料,文中通过示例代码介绍的非常详细,需要的朋友可以参考下
anaconda 部署Jupyter Notebook服务器过程详解

这篇文章主要为大家介绍了anaconda 部署Jupyter Notebook服务器过程详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪

随机推荐

10 个Python中Pip的使用技巧分享

众所周知，pip 可以安装、更新、卸载 Python 的第三方库，非常方便。本文小编为大家总结了Python中Pip的使用技巧，需要的可以参考一下
python数学建模之三大模型与十大常用算法详情

这篇文章主要介绍了python数学建模之三大模型与十大常用算法详情，文章围绕主题展开详细的内容介绍，具有一定的参考价值，感想取得小伙伴可以参考一下
Python爬取奶茶店数据分析哪家最好喝以及性价比

这篇文章主要介绍了用Python告诉你奶茶哪家最好喝性价比最高，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习吧
使用pyinstaller打包.exe文件的详细教程

PyInstaller是一个跨平台的Python应用打包工具，能够把 Python 脚本及其所在的 Python 解释器打包成可执行文件,下面这篇文章主要给大家介绍了关于使用pyinstaller打包.exe文件的相关资料,需要的朋友可以参考下
基于Python实现射击小游戏的制作

这篇文章主要介绍了如何利用Python制作一个自己专属的第一人称射击小游戏，文中的示例代码讲解详细，感兴趣的小伙伴可以跟随小编一起动手试一试
Python list append方法之给列表追加元素

这篇文章主要介绍了Python list append方法如何给列表追加元素，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教
Pytest+Request+Allure+Jenkins实现接口自动化

这篇文章介绍了Pytest+Request+Allure+Jenkins实现接口自动化的方法，文中通过示例代码介绍的非常详细。对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
利用python实现简单的情感分析实例教程

商品评论挖掘、电影推荐、股市预测……情感分析大有用武之地,下面这篇文章主要给大家介绍了关于利用python实现简单的情感分析的相关资料,文中通过示例代码介绍的非常详细,需要的朋友可以参考下
利用Python上传日志并监控告警的方法详解

这篇文章将详细为大家介绍如何通过阿里云日志服务搭建一套通过Python上传日志、配置日志告警的监控服务，感兴趣的小伙伴可以了解一下
Pycharm中运行程序在Python console中执行,不是直接Run问题

这篇文章主要介绍了Pycharm中运行程序在Python console中执行,不是直接Run问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教