
Scapy爬虫管道:持久化存储文件为空的排查与解决
本文分析了使用Scapy爬虫时,管道持久化存储文件为空的常见问题,并提供详细的排查和解决方法。问题核心在于Pipeline中文件指针未正确初始化,导致写入操作失败。
以下是一个示例代码片段,展示了问题所在以及解决方案:
爬虫代码 (biedou_spider.py):
import scrapyimport syssys.path.append(r'd:project_testpydemodemo1xunlianmyspiderqiubai')from ..items import qiubaiitemclass biedouspider(scrapy.Spider): name = "biedou" start_urls = ["https://www.biedoul.com/wenzi/"] def parse(self, response): dl_list = response.xpath('/html/body/div[4]/div[1]/div[1]/dl') for dl in dl_list: title = dl.xpath('./span/dd/a/strong/text()')[0].extract() content = dl.xpath('./dd//text()').extract() content = ''.join(content) item = qiubaiitem() item['title'] = title item['content'] = content yield item break #此处break语句仅用于测试,实际应用中应移除
Item定义 (items.py):
import scrapyclass qiubaiitem(scrapy.Item): title = scrapy.Field() content = scrapy.Field()
Pipeline代码 (pipelines.py): (错误代码)
class qiubaipipeline(object): def __init__(self): self.fp = None def open_spdier(self, spider): #拼写错误:open_spdier print("开始爬虫") self.fp = open('./biedou.txt', 'w', encoding='utf-8') def close_spider(self, spider): print("结束爬虫") self.fp.close() def process_item(self, item, spider): title = str(item['title']) content = str(item['content']) self.fp.write(title + ':' + content + 'n') return item
运行爬虫时,错误信息显示AttributeError: 'NoneType' object has no attribute 'close',这正是由于open_spdier方法名拼写错误导致的。 open_spider 方法未被调用,self.fp 始终为 None。
Pipeline代码 (pipelines.py): (修正代码)
class QiubaiPipeline(object): #建议类名首字母大写 def __init__(self): self.fp = None def open_spider(self, spider): #修正拼写错误 print("开始爬虫") self.fp = open('./biedou.txt', 'w', encoding='utf-8') def close_spider(self, spider): print("结束爬虫") try: self.fp.close() except AttributeError: print("文件未打开") #增加异常处理 def process_item(self, item, spider): title = str(item['title']) content = str(item['content']) try: self.fp.write(title + ':' + content + 'n') except AttributeError: print("文件未打开,写入失败") #增加异常处理 return item
通过更正open_spider方法名,并添加异常处理,确保即使出现错误也能优雅地处理,避免程序崩溃。 此外,建议类名使用首字母大写规范。 移除parse方法中的break语句,才能完整地处理所有数据。 确保biedou.txt 文件有写入权限。
这个修正后的Pipeline就能正确地将爬取的数据写入biedou.txt 文件。 记住仔细检查代码中的拼写错误,并添加适当的错误处理,这对于调试和维护代码至关重要。
以上就是使用Scapy爬虫时,为什么管道持久化存储文件为空?的详细内容,更多请关注创想鸟其它相关文章!
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1359465.html
微信扫一扫
支付宝扫一扫