Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用 Python 获取 Wiki 词汇表页面下所有子页面的浏览量_创想鸟

使用 Python 获取 Wiki 词汇表页面下所有子页面的浏览量

使用 python 获取 wiki 词汇表页面下所有子页面的浏览量

本文介绍如何使用 Python 从 Wiki 词汇表页面提取所有子页面的浏览量。由于词汇表页面的内容是非结构化的,因此需要手动解析页面内容,提取子页面标题,然后使用 Pageviews API 获取每个子页面的浏览量。本文将提供详细的步骤和示例代码,帮助你完成这个任务。

1. 确定目标页面和工具

首先,你需要确定要提取浏览量的 Wiki 词汇表页面。例如,https://en.wikipedia.org/wiki/Glossary_of_areas_of_mathematics。

其次,我们将使用 Python 及其相关的库来实现这个目标:

requests: 用于发送 HTTP 请求,获取页面内容。Beautiful Soup 4: 用于解析 HTML 内容,提取子页面标题。

你可以使用 pip 安装这些库:

立即学习“Python免费学习笔记(深入)”;

pip install requests beautifulsoup4

2. 获取页面内容

使用 requests 库获取目标页面的 HTML 内容。

import requestsfrom bs4 import BeautifulSoupurl = "https://en.wikipedia.org/wiki/Glossary_of_areas_of_mathematics"response = requests.get(url)response.raise_for_status()  # 检查请求是否成功html_content = response.text

3. 解析 HTML 内容,提取子页面标题

使用 Beautiful Soup 4 解析 HTML 内容,并提取所有子页面的标题。 因为词汇表页面通常使用列表或链接来组织子页面,你需要根据页面的具体结构来编写解析代码。以下是一个示例,假设子页面链接都包含在

标签内的 标签中:

soup = BeautifulSoup(html_content, 'html.parser')page_titles = []# 查找所有包含链接的 
  • 标签for li in soup.find_all('li'): a_tag = li.find('a') if a_tag and a_tag.has_attr('href') and a_tag['href'].startswith('/wiki/'): title = a_tag['title'] page_titles.append(title)print(page_titles)
  • 注意:

    你需要根据实际页面的 HTML 结构调整解析代码。a_tag.has_attr(‘href’) and a_tag[‘href’].startswith(‘/wiki/’) 确保只提取指向 Wiki 页面的链接。a_tag[‘title’] 提取链接的 title 属性,这通常是页面的标题。

    4. 使用 Pageviews API 获取浏览量

    使用 Pageviews API 获取每个子页面的浏览量。 Pageviews API 的文档地址是:https://www.php.cn/link/e5e07cc9b49607a00a6d5c9be9b2c364

    你可以通过构造 URL 并发送 HTTP 请求来获取浏览量。 Pageviews API 允许一次查询多个页面,页面标题之间用 | 分隔。 但是,一次查询的页面数量有限制,因此你需要分批查询。

    import requestsimport jsondef get_pageviews(titles):    base_url = "https://pageviews.toolforge.org/api/views/per-article/"    params = {        'articles': '|'.join(titles),        'project': 'en.wikipedia.org',        'access': 'all-access', # all-access, desktop, mobile        'agent': 'user', # all-agents, user, spider        'granularity': 'monthly', # daily, monthly        'start': '2020010100', #YYYYMMDDHH        'end': '2024010100' #YYYYMMDDHH    }    response = requests.get(base_url, params=params)    response.raise_for_status()    data = response.json()    return data['items']# 分批处理页面标题batch_size = 50  # 一次查询的页面数量限制all_pageviews = {}for i in range(0, len(page_titles), batch_size):    batch = page_titles[i:i + batch_size]    pageviews = get_pageviews(batch)    for item in pageviews:        all_pageviews[item['article']] = item['views']# 打印结果for title, views in all_pageviews.items():    print(f"{title}: {views}")

    注意:

    你需要根据 API 文档调整请求参数,例如 project、start、end 等。batch_size 的大小需要根据 API 的限制进行调整。get_pageviews 函数返回的是 JSON 数据,你需要解析它以获取浏览量。Pageviews API返回的是一段时间内的浏览量,你可以根据 granularity 参数选择每日或每月的浏览量。

    5. 完整示例代码

    将以上步骤整合起来,得到完整的示例代码:

    import requestsfrom bs4 import BeautifulSoupimport jsondef get_pageviews(titles):    base_url = "https://pageviews.toolforge.org/api/views/per-article/"    params = {        'articles': '|'.join(titles),        'project': 'en.wikipedia.org',        'access': 'all-access', # all-access, desktop, mobile        'agent': 'user', # all-agents, user, spider        'granularity': 'monthly', # daily, monthly        'start': '2020010100', #YYYYMMDDHH        'end': '2024010100' #YYYYMMDDHH    }    response = requests.get(base_url, params=params)    response.raise_for_status()    data = response.json()    return data['items']url = "https://en.wikipedia.org/wiki/Glossary_of_areas_of_mathematics"response = requests.get(url)response.raise_for_status()html_content = response.textsoup = BeautifulSoup(html_content, 'html.parser')page_titles = []# 查找所有包含链接的 
  • 标签for li in soup.find_all('li'): a_tag = li.find('a') if a_tag and a_tag.has_attr('href') and a_tag['href'].startswith('/wiki/'): title = a_tag['title'] page_titles.append(title)# 分批处理页面标题batch_size = 50 # 一次查询的页面数量限制all_pageviews = {}for i in range(0, len(page_titles), batch_size): batch = page_titles[i:i + batch_size] pageviews = get_pageviews(batch) for item in pageviews: all_pageviews[item['article']] = item['views']# 打印结果for title, views in all_pageviews.items(): print(f"{title}: {views}")
  • 注意事项和总结

    请务必根据实际页面的 HTML 结构调整解析代码。Pageviews API 有请求频率限制,你需要合理控制请求频率,避免被封禁。你可以根据需要修改请求参数,例如 start、end、granularity 等。本教程提供了一个通用的方法,你可以将其应用于其他 Wiki 页面,只需要修改页面 URL 和解析代码即可。可以考虑使用缓存机制,将已经获取过的浏览量缓存起来,避免重复请求 API。

    通过本教程,你已经学会了如何使用 Python 从 Wiki 词汇表页面提取所有子页面的浏览量。 希望这些知识对你有所帮助!

    以上就是使用 Python 获取 Wiki 词汇表页面下所有子页面的浏览量的详细内容,更多请关注创想鸟其它相关文章!

    版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
    如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
    发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1291216.html

    赞 (0)
    打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
    根据URL参数动态切换Laravel 8数据库连接
    上一篇 2025年12月11日 07:17:14
    PHP函数如何使用内置函数处理字符串 PHP函数字符串处理内置函数的技巧
    下一篇 2025年12月11日 07:17:26

    相关推荐

    • rm -rf 误删文件?别急,或许有救!

      rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!

      立即采取行动! 在生产环境中,我们应尽量避免进行风险操作。但如果不慎犯错,如何挽救呢?让我分享一个故事:上周我为了打包一个应用,需要整理Ubuntu 16.04上的线上数据,不小心删除了一个数据文件,幸而最终有惊无险,现记录如下。 extundelete 我的恢复计划主要依赖于一个工具——extun…

      2026年9月22日 • 用户投稿
      000
    • MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

      MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

      mysql跨数据库查询的核心方法是在sql语句中通过“数据库名.表名”方式指定不同数据库的表,实现数据联动。1.在同一个mysql实例内,直接使用数据库名加表名进行关联查询,如db_user.users和db_order.orders,前提是用户需具备相应权限且建议对关联字段建立索引以提升性能;2.…

      2026年9月22日 • 用户投稿
      400
    • Procreate的AI混合工具怎么用?提升数字绘画效率的实用教程

      Procreate虽无直接名为“AI混合工具”的功能,但其图层混合模式、涂抹工具、Alpha锁定与剪裁蒙版等设计,共同构成了智能化的色彩混合体系。通过正片叠底、滤色等模式可实现自然光影叠加,涂抹工具结合纹理笔刷能模拟真实颜料融合,Alpha锁定和剪裁蒙版则确保混合精准可控。分层渐变、低不透明度叠加及…

      2026年9月22日
      700
    • 不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法

      不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法

      蝴蝶号是通过无声视频形式吸引观众实现流量变现的一种创作策略。它适合零基础小白,因不露脸、无需口才或专业设备,仅需手机、剪辑软件和创意即可操作。制作关键在于视觉冲击力与情感共鸣,包括优质素材、节奏感剪辑、契合音乐、点睛文字。实用工具如剪映、capcut、达芬奇或adobe premiere pro。其…

      2026年9月22日 • 用户投稿
      100
    • VSCode高效配置Node.js:npm集成、中文报错、断点调试

      答案:高效配置VSCode与Node.js需确保Node.js和npm为最新版,利用集成终端运行命令,通过jsconfig.json或tsconfig.json优化项目配置,解决中文乱码需设置终端编码为UTF-8并选择支持中文的字体,调试核心是正确配置launch.json文件,使用pwa-node…

      2026年9月22日
      400
    • MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑

      MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑

      提升mysql多表查询性能与可读性的方法包括:1. 优化索引,确保join和where字段有合适索引,理解复合索引左前缀原则;2. 使用cte分解逻辑,使结构清晰易维护;3. 利用sublime text插件如sqltools、sublimelinter提升编写效率;4. 拆解复杂逻辑,逐步构建查询…

      2026年9月22日 • 用户投稿
      100
    • 如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

      如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

      答案是优化数据管道、采用分布式训练、应用内存优化技术、精细调参。具体包括:使用RecordIO格式和DataLoader多进程预取提升数据加载效率;通过KVStore选择device或dist_sync/dist_async实现单机或多机分布式训练;利用混合精度训练、梯度累积和模型符号化降低显存占用…

      2026年9月22日 • 用户投稿
      000
    • itextpdf freemarker渲染

      关于打印pdf操作的需求,经过研究,发现以下两种方法: 在现有的模板上进行编辑,这种方法操作难度较大。而通过FreeMarker生成静态页面,然后转换为HTML,操作更为顺畅。动态生成PDF的方法在网上参考较多,经过对比,我认为使用FreeMarker结合IText生成PDF最为简单。参考链接为ht…

      2026年9月22日
      300
    • Java多线程并发控制:告别线程优先级,拥抱锁机制

      本文深入探讨了在Java多线程环境中如何有效解决并发操作中断问题,特别是当多个线程尝试同时执行非原子性操作(如打印)时。文章指出,单纯依赖线程优先级并不可靠,并详细介绍了使用synchronized关键字配合共享锁对象实现互斥访问的关键技术,确保关键代码块的原子性执行,从而避免数据混乱和逻辑错误。 …

      2026年9月22日
      700
    • 使用空值合并运算符为数组元素设置默认值

      本文将介绍如何使用 PHP 的空值合并运算符 (??) 为数组元素设置默认值,尤其是在处理用户输入时。 通过该运算符,可以在变量值为 null 或不存在时,提供一个备选值,从而简化代码并提高可读性。我们将通过一个实际的 Laravel 邮件发送示例,演示如何在请求参数中缺失主题时,设置默认主题。 空…

      2026年9月22日
      600
    • VSCode精简配置Git:中文提交记录、分支可视化、冲突解决

      首先解决中文乱码需配置Git和VSCode编码为UTF-8,其次通过GitLens或Git Graph实现分支可视化,最后利用VSCode内置的冲突解决工具高效处理合并冲突,全面提升Git使用体验。 在VSCode里用Git,我总觉得能再顺手点。特别是处理中文提交信息、想直观看看分支图,或者面对恼人…

      2026年9月22日
      500
    • 如何用AdobePremierePro制作AI视频?快速上手AI视频剪辑的完整教程

      如何用AdobePremierePro制作AI视频?快速上手AI视频剪辑的完整教程如何用AdobePremierePro制作AI视频?快速上手AI视频剪辑的完整教程如何用AdobePremierePro制作AI视频?快速上手AI视频剪辑的完整教程如何用AdobePremierePro制作AI视频?快速上手AI视频剪辑的完整教程

      答案:在Premiere Pro中制作AI视频需整合第三方AI工具生成的素材并进行精细化剪辑。首先明确主题,利用Midjourney、RunwayML、ElevenLabs等工具生成图像、视频和音频;随后导入PR并分类组织,通过粗剪与同步构建叙事框架;接着运用Lumetri Color统一色调,基本…

      2026年9月22日 • 用户投稿
      1200
    • 不懂技术也能做!蝴蝶号入口搭建与数据增长实战指南

      是的,不懂技术也能搭建“蝴蝶号入口”并实现数据增长。其核心在于明确目标与受众、选择合适的无代码工具、打造有价值的内容、积极推广、关注数据分析并持续优化。具体步骤为:1. 明确用户行为路径和转化目标;2. 选用linktree、notion、wix等无代码工具搭建入口;3. 输出简洁有吸引力的内容;4…

      2026年9月22日
      400
    • Reinstalling Alpine Linux on a Lighthouse Instance

      Start by creating an instance with Debian or your preferred operating system. Log into the instance. Download the Arch Linux ISO for booting. Although…

      2026年9月22日
      000
    • MySQL数据类型详解_如何选择合适字段类型提升存储效率

      MySQL数据类型详解_如何选择合适字段类型提升存储效率MySQL数据类型详解_如何选择合适字段类型提升存储效率MySQL数据类型详解_如何选择合适字段类型提升存储效率MySQL数据类型详解_如何选择合适字段类型提升存储效率

      mysql选择合适数据类型的核心原则是根据数据特性选择占用空间最小且能准确表达数据的类型。1. 选择整数类型时,应依据数据范围选择tinyint、smallint、mediumint、int或bigint,优先选更小类型以节省空间;2. 字符串类型中,char适用于固定长度数据,varchar适用于…

      2026年9月22日 • 用户投稿
      000
    • VSCode调试FPGA工程的技巧(结合Vivado,快速定位问题)

      vscode在fpga开发中并非替代vivado,而是作为高效辅助工具提升开发效率。1. 在代码编写方面,vscode提供 superior 的语法高亮、自动补全和代码管理功能,显著优化verilog、systemverilog和tcl脚本的编写体验,并通过git实现无缝版本控制;2. 在仿真与自动…

      2026年9月22日
      1200
    • 小米双11正式开启!覆盖全品类 单品最高可省4000元

      10月13日,小米官方宣布“小米双11”大促活动全面启动。此次活动涵盖小米全品类产品,优惠力度空前,部分单品最高直降4000元。 在手机产品线中,小米最新旗舰大折叠屏MIX Fold 4迎来大幅让利,最高降价1000元,最终到手价为7999元。搭载顶级影像系统的旗舰机型小米15 Ultra也下调50…

      2026年9月22日
      400
    • 谷歌浏览器PDF文件注释功能无法使用怎么办

      谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办

      首先检查PDF权限,若文件设有限制需用专业工具解除;2. 确认非PDF/A格式,必要时转换为普通PDF;3. 推荐使用UPDF等专业软件实现完整注释功能;4. 清除浏览器缓存或重置Chrome设置以排除临时故障。 谷歌浏览器自带的PDF阅读器功能虽然方便,但有时会遇到无法使用注释功能的问题。这通常与…

      2026年9月22日 • 用户投稿
      300
    • Apache Pulsar 主题分区创建与管理指南

      本文深入探讨Apache Pulsar主题分区的创建与管理。Pulsar主题分区是实现高吞吐量和可伸缩性的关键,但必须在主题创建时进行配置。文章详细介绍了两种主要的分区主题创建方法:通过Broker配置实现自动分区,以及利用Pulsar Admin API进行显式创建,并强调了分区主题一旦创建后不可…

      2026年9月22日
      100
    • win10激活失败怎么办_win10系统激活错误原因及解决方案

      首先验证产品密钥正确性并重新输入,随后通过设置中的激活疑难解答工具自动修复问题,接着使用管理员命令提示符执行slmgr命令重置激活状态,同时运行sfc /scannow检查系统文件完整性,对于预装系统可查询OA 3.0出厂密钥进行激活。 如果您在尝试激活Windows 10系统时遇到失败提示,可能是…

      2026年9月22日
      300

    发表回复

    登录后才能评论
    关注微信