Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
如何从网页中提取网址,避免括号和单引号的干扰?_创想鸟

如何从网页中提取网址,避免括号和单引号的干扰?

如何从网页中提取网址,避免括号和单引号的干扰?

如何摆脱爬取网址中出现的括号和单引号

当你使用beautifulsoup等html解析器爬取网页时,你可能会遇到一些情况下,所抓取的网址中会带有括号和单引号。这会给后续数据处理带来不便。以下是如何解决这个问题的方法:

使用正则表达式

正则表达式(regex)是一种强大的工具,可以用于匹配和提取文本中的特定模式。在你的例子里,你可以使用正则表达式来匹配网址,并提取它们而不包括括号和单引号。

例如:

import repattern = r'href="(.*?)"'urls = re.findall(pattern, html)

这将从html中匹配所有href属性,并将值存储在urls列表中,而不会包含引号。

使用lxml

lxml是一个python库,它提供了另一种解析xml和html的方法。它使用xpath语法来查找和提取元素。

例如:

import requestsfrom lxml import etreeheaders = {    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.66 Safari/537.36'}res = requests.get(url, headers=headers)res_dom = etree.HTML(res.text)urls = res_dom.xpath('//h3/a/@href')

这将抓取所有h3标记中a元素的href属性,并且不会包含括号和单引号。

以上就是如何从网页中提取网址,避免括号和单引号的干扰?的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1351881.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
如何将 Python 图表中的 x 轴刻度显示为明确的日期?
上一篇 2025年12月13日 16:20:46
使用 Selenium 爬取淘宝时遇到 invalid cookie domain 异常,如何解决?
下一篇 2025年12月13日 16:21:07

相关推荐

发表回复

登录后才能评论
关注微信