分布式爬虫部署[通俗易懂]

大家好,又见面了,我是你们的朋友全栈君。

【服务器端】

1.下载redis ,Redis Desktop Managerredis。

2.修改配置文件(找到redis下的redis.windows.conf 双击打开,找到bind 并修改为0.0.0.0,然后 protected-mode “no”

3.打开cmd命令行 进入redis的安装目录,输入redis-server.exe redis.windows.conf 回车,保持程序一直开着。

分布式爬虫部署[通俗易懂]

如果不是这个界面,证明redis服务已经开启了,需要

redis-cli shutdown

重新输入一次redis-server.exe redis.windows.conf

4.主机开启redis服务之后,不要断开,切记!!! 进入redis安装目录,输入:redis-cli.exe -h 主机(或者别人的)ip地址(-p 端口号6379(可以不用写)),也可以直接redis-cli -h 主机ip 地址用来测试是否可以远程连接redis(如果回车之后没有出现如图效果,检查自己的bind是否修改以及redis服务是否被自己关闭)出现如下表示可以远程连接redis

分布式爬虫部署[通俗易懂]

如果想要操作数据库连接中指定数据库(默认的是数据库0),比如操作数据库5可以在命令行输入:redis-cli -h 192.168.0.1 -n 5

详情参考:Redis在命令行中操作指定数据库下的key – 简书

5在Redis Desktop Managerredis中创建连接,一定要HOST设置成本机的ip,不要是127.0.0.1,要不然分机程序一运行就会一直停顿。

6,向redis输入链接,lpush bole:start_urls 网址

模板:lpush redis_keys 网址

网易天音 网易天音

网易出品!一站式音乐创作工具!零基础写歌!

网易天音 76 查看详情 网易天音

分布式爬虫部署[通俗易懂]

爬虫端部署】

爬虫分两种流派,一种是有规则的,一种是无规则的。运行方式各有不通。

共同点:setting.py

代码语言:javascript代码运行次数:0运行复制

LOG_LEVEL='DEBUG'USER_AGENT = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.132 Safari/537.36'# Crawl responsibly by identifying yourself (and your website) on the user-agent#USER_AGENT = 'dushu_redis (+http://www.yourdomain.com)'#配置去重DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"#配置调度器SCHEDULER = "scrapy_redis.scheduler.Scheduler"SCHEDULER_PERSIST = True#setting.py ROBOTSTXT_OBEY=FalseDOWNLOAD_DELAY = 1REDIS_URL = 'redis://root:@192.168.0.105:6379/0'ITEM_PIPELINES = {    #'dushu_redis.pipelines.DushuRedisPipeline': 300,    'scrapy_redis.pipelines.RedisPipeline': 400,}

(1)【有规则的爬虫】这里一定要开启爬虫过滤 ,否则在有些版本,无法过滤

def make_requests_from_url(self, url): return scrapy.Request(url, dont_filter=False)

代码语言:javascript代码运行次数:0运行复制

import scrapyfrom scrapy.spiders import Rule#from scrapy_redis.spiders import RedisSpiderfrom scrapy.linkextractors import LinkExtractorfrom scrapy_redis.spiders import RedisCrawlSpiderclass GuoxueSpider(RedisCrawlSpider):    name = 'bole'    # start_urls = ['http://blog.jobbole.com/all-posts/']      # 添加键    redis_key = 'bole:start_urls'    rules = (        # follow all links        Rule(LinkExtractor(), callback='parse_page', follow=True),    )    def __init__(self, *args, **kwargs):        # Dynamically define the allowed domains list.        domain = kwargs.pop('domain', '')        self.allowed_domains = filter(None, domain.split(','))        super(GuoxueSpider, self).__init__(*args, **kwargs)    def make_requests_from_url(self, url):        return scrapy.Request(url, dont_filter=False)    def parse_page(self, response):        aa=response.css('title::text').extract_first()        print(aa)        return {            'name': response.css('title::text').extract_first(),            'url': response.url,        }

运行方式 在爬虫的根目录运行scrapy crawl 爬虫名

(2)【无规则的爬虫】

代码语言:javascript代码运行次数:0运行复制

from scrapy_redis.spiders import RedisSpiderclass GuoxuespiderSpider(RedisSpider):    """Spider that reads urls from redis queue (myspider:start_urls)."""    name = 'myspider'    redis_key = 'bole:start_urls'    def __init__(self, *args, **kwargs):        # Dynamically define the allowed domains list.        domain = kwargs.pop('domain', '')        self.allowed_domains = filter(None, domain.split(','))        super(GuoxuespiderSpider, self).__init__(*args, **kwargs)    def make_requests_from_url(self, url):        return scrapy.Request(url, dont_filter=False)    def parse(self, response):        aa=response.css('title::text').extract_first()        print(aa)        return {            'name': response.css('title::text').extract_first(),            'url': response.url,        }

运行方式:

分布式爬虫部署[通俗易懂]

Redis DeskTop Manager 使用教程 – King-DA – 博客园

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 举报,一经查实,本站将立刻删除。

发布者:全栈程序员-用户IM,转载请注明出处:https://javaforall.cn/213742.html原文链接:https://javaforall.cn

以上就是分布式爬虫部署[通俗易懂]的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/380720.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
centos7如何安装gcc?
上一篇 2025年11月6日 11:15:25
哔哩哔哩的视频怎么制作成GIF动图_哔哩哔哩视频转GIF教程
下一篇 2025年11月6日 11:15:36

相关推荐

  • IOS,安卓,Windows和塞班,你最喜欢哪个?为什么?

    IOS,安卓,Windows和塞班,你最喜欢哪个?为什么?IOS,安卓,Windows和塞班,你最喜欢哪个?为什么?IOS,安卓,Windows和塞班,你最喜欢哪个?为什么?IOS,安卓,Windows和塞班,你最喜欢哪个?为什么?

    从事软件开发多年,我主要使用c++/c++和java进行开发,涉及ios、android、windows和塞班四个系统的开发。除了ios系统外,其余三个系统我都有深入的开发经验。其中,我在android系统上花费的时间最长,研究过其中间层的framework框架,并从事过两年的应用级开发。从技术角度…

    2026年8月31日 用户投稿
    000
  • 如何设置双显示器_电脑多屏幕扩展显示教程

    双显示器设置方法为:1. 确保电脑有足够视频输出接口,将两台显示器正确连接,若接口不足需使用扩展坞;2. 系统自动识别显示器,若未识别则在windows中右键桌面进入“显示设置”点击“检测”,并选择“扩展这些显示器”或“复制这些显示器”,macos中通过“系统偏好设置-显示器-排列”调整显示器位置;…

    2026年8月31日
    000
  • 如何解决PHPHTTP请求和响应处理的复杂性?sabre/http库可以帮你!

    可以通过以下地址学习composer:学习地址 在开发一个需要处理大量http请求和响应的项目时,我遇到了一个棘手的问题:php的原生http处理方式过于繁琐和不一致,导致代码难以维护和扩展。例如,获取请求信息需要从$_get、$_post、$_server等超全局变量中提取,输出响应则需要使用he…

    用户投稿 2026年8月31日
    300
  • win10摄像头无法打开?

    win10摄像头无法打开?win10摄像头无法打开?win10摄像头无法打开?win10摄像头无法打开?

    摄像头在我们的日常交流中扮演着重要的角色,但有些用户在将操作系统升级至win10后,发现摄像头无法正常使用。那么,导致这一问题的原因是什么呢?经过研究发现,这是因为用户无意间关闭了摄像头的隐私权限所致。因此,若要让摄像头恢复正常工作,就需要重新开启相关的设置。接下来,我们将详细介绍具体的操作步骤。 …

    2026年8月31日 用户投稿
    100
  • 从碎片灵感到专业成稿:闪迪创作者系列赋能“双栖”插画师实现创作自由

    从碎片灵感到专业成稿:闪迪创作者系列赋能“双栖”插画师实现创作自由从碎片灵感到专业成稿:闪迪创作者系列赋能“双栖”插画师实现创作自由从碎片灵感到专业成稿:闪迪创作者系列赋能“双栖”插画师实现创作自由从碎片灵感到专业成稿:闪迪创作者系列赋能“双栖”插画师实现创作自由

    “硬边圆即是宇宙的终点”——这句极具代表性的口头语,搭配插画绘制全过程视频与真诚的经验交流,构成了@忙波画画鲜明的视频特色。打开他的作品,观众常常被其大胆运用“色块起稿”的方式所震撼,弹幕中也频现惊叹之声。浏览他的视频内容,从色彩的整体把控到绘画软件的具体设置,覆盖范围广泛多样。尤为可贵的是,作为平…

    2026年8月31日 用户投稿
    000
  • JavaScript异步函数中如何避免`response.rows[0] is undefined`错误?

    在javascript异步函数中如何避免undefined错误? 在使用异步函数处理数据时,经常会遇到由于数据未返回或返回的数据结构不符合预期而导致的错误。本文将针对一个实际案例,分析如何避免response.rows[0] is undefined这类错误。 问题代码片段如下: getplat({…

    用户投稿 2026年8月31日
    000
  • 百度小说账户密码忘记怎么办_百度小说密码找回重置流程

    首先通过绑定手机号或邮箱重置密码,若无法使用原凭证则提交人工申诉,按步骤验证身份后找回百度小说账户。 如果您尝试登录百度小说账户,但因密码遗忘导致无法访问个人书架或续读记录,可能是由于未正确输入登录凭证。以下是解决此问题的步骤: 本文运行环境:小米14,Android 14 一、通过绑定手机号重置密…

    2026年8月31日
    100
  • 晋江app怎么设置翻页方式_晋江app阅读翻页模式调整方法

    1、可在晋江App中通过阅读界面、书架页面或个人中心设置翻页方式;2、阅读界面点击屏幕调出菜单进入设置,选择滑动、仿真等模式;3、书架长按书籍可设全局默认翻页效果;4、个人中心的阅读偏好支持批量修改,统一应用新翻页方式。 如果您在使用晋江App阅读小说时觉得当前的翻页方式不够顺手,可以通过设置调整翻…

    2026年8月31日
    100
  • 安装perplexity教程-如何安装perplexity的详细指引

    首先确认Python版本并安装transformers、torch等依赖库,接着可通过pip或GitHub源码安装Perplexity工具,配置CUDA与预训练模型后,运行测试脚本验证是否成功输出perplexity值。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 Deep…

    2026年8月31日
    100
  • VSCode怎么写JS代码_VSCode编写和调试JavaScript代码的完整教程

    答案是掌握配置环境、善用编辑器功能与调试技巧。首先安装Node.js并配置VSCode的launch.json文件以支持调试,安装ESLint和Prettier等插件提升代码质量;利用代码片段、智能提示和快捷键提高编写效率;通过设置断点、使用条件断点和调用堆栈等功能进行高效调试,遇到问题可检查配置、…

    2026年8月31日
    000
  • 微软发布首款自主开发图像生成模型 MAI-Image-1

    微软近日正式发布了首款完全自主设计的图像生成模型 MAI-Image-1,该模型在上线知名AI评测平台LMArena后,迅速跻身文本到图像类别排行榜Top 10(https://www.php.cn/link/28906041af66e9058de9fde01d54540d)。 据官方介绍,MAI-…

    2026年8月31日
    200
  • MySQL的InnoDB和MyISAM引擎区别是什么_该如何选择?

    MySQL的InnoDB和MyISAM引擎区别是什么_该如何选择?MySQL的InnoDB和MyISAM引擎区别是什么_该如何选择?MySQL的InnoDB和MyISAM引擎区别是什么_该如何选择?MySQL的InnoDB和MyISAM引擎区别是什么_该如何选择?

    innodb与myisam的核心差异在于事务支持、并发控制和数据完整性。1.innodb支持事务(acid特性)、行级锁定、外键约束和崩溃恢复,适合高并发、数据一致性要求高的场景;2.myisam采用表级锁定、无事务支持、无外键约束,仅在极少数读多写少、数据一致性要求低的场景下可能被考虑;3.inn…

    2026年8月31日 用户投稿
    000
  • Android开发中,如何正确解析嵌套JSON数据中的responseData.data数组,尤其当其值为null时该如何处理?

    Android开发中解析嵌套JSON数据,尤其处理responseData.data数组为null的情况 在Android应用开发中,经常需要处理服务器返回的JSON数据,特别是包含嵌套结构的JSON。本文将探讨如何从responseData对象中提取data属性下的数组数据,并解决data属性为n…

    2026年8月31日
    100
  • ai智能写作一键生成软件排行榜 ai智能写作一键生成软件前十名盘点

    本文介绍了九种不同的 AI 写作工具,为用户提供生成高质量内容的宝贵选择。这些工具基于先进语言模型,例如 GPT-3 和 GPT-3.5,具有生成流畅、语法准确、内容丰富的文章的能力。每个工具都有自己的优点和缺点,例如 Jasper 专注于高级功能,而 CopyAI 则侧重于快速高效的文案生成。此外…

    2026年8月31日
    000
  • PHP中高效处理多URL请求:避免循环嵌套陷阱

    本文旨在解决PHP中处理多个URL请求时常见的循环逻辑错误,特别是当URL数据来源于数据库查询时。通过分析错误的嵌套循环模式,提供一种简洁高效的解决方案,即在单个循环中直接处理每条数据库记录并发送HTTP请求。此外,文章还将探讨 file_get_contents 的使用细节、潜在的性能问题以及替代…

    2026年8月31日
    000
  • usb无线网卡的使用方法

    usb无线网卡的使用方法usb无线网卡的使用方法usb无线网卡的使用方法usb无线网卡的使用方法

    小伙伴们,你们了解usb无线网卡吗?它该如何使用呢?对于那些台式机或某些上网本来说,由于它们本身并未配备无线网卡,因此这类用户通常会选择usb无线网卡,以便让台式机以及部分没有内置无线网卡的上网本能够实现无线联网功能。尽管不少用户知道可以通过购买usb无线网卡来实现无线上网需求。 方法一:Win7系…

    2026年8月31日 用户投稿
    100
  • Piti插件怎么调整图片插入位置_Piti插件调整图片插入位置方法

    首先确保光标准确定位,再插入图片;其次可用占位符标记位置并启用替换功能;接着通过设置将默认插入改为光标处;最后可利用API编程控制插入坐标。 如果您在使用Piti插件插入图片时发现图片未出现在预期位置,可能是由于编辑器光标定位或插件默认设置导致的插入偏移。以下是调整Piti插件图片插入位置的具体方法…

    2026年8月31日
    000
  • Win10X的Win32容器性能不佳 微软需要解决性能问题

    最新推出的win10x系统中,其win32容器在虚拟化方面的兼容性存在不足,微软方面表示正积极寻求解决办法,这可能会影响到系统的更新与发布时间。接下来让我们一起深入了解具体情况。 Win10X的Win32容器表现欠佳 Windows 10X是一种经过精简且不可修改的操作系统,但并不局限于仅支持Mic…

    2026年8月31日
    000
  • 作业帮怎么联系客服寻求帮助_作业帮客服联系方式大全

    遇到问题可联系作业帮客服,优先拨打400-618-8000或通过APP内「帮助与反馈」提交工单,支持账号、支付等问题咨询,人工服务时间为工作日9:00-18:00。 如果在使用作业帮过程中遇到问题,可以直接通过官方渠道联系客服获取帮助。最有效的方式是拨打作业帮的全国统一客服热线 400-618-80…

    2026年8月31日
    000
  • win10怎么映射网络驱动器到本地_win10映射网络驱动器操作步骤

    可通过文件资源管理器、运行命令或命令提示符将远程共享文件夹映射为本地驱动器。首先在文件资源管理器中选择“映射网络驱动器”,设置驱动器号并输入网络路径如192.168.1.100shared,勾选“登录时重新连接”以实现开机自动连接,必要时使用其他凭据登录;其次通过Win+R输入目标IP地址浏览共享文…

    2026年8月31日
    000

发表回复

登录后才能评论
关注微信