Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
利用Python进行网页表格数据抓取与Pandas DataFrame转换_创想鸟

利用Python进行网页表格数据抓取与Pandas DataFrame转换

利用Python进行网页表格数据抓取与Pandas DataFrame转换

本教程详细介绍了如何使用Python的requests、BeautifulSoup和pandas库,从动态网页中抓取结构化的表格数据,特别是雪深信息,并将其高效地转换为Pandas DataFrame。内容涵盖了HTTP请求、HTML解析、元素定位以及数据清洗与整合,旨在提供一套完整的网页数据抓取与处理解决方案。

网页数据抓取概述

在数据分析和自动化任务中,从网页上获取结构化数据是一个常见的需求。虽然许多网站提供api接口,但仍有大量信息仅以html形式呈现。此时,网页抓取(web scraping)技术便显得尤为重要。本教程将以抓取挪威气象局网站上的雪深数据为例,演示如何利用python有效地提取并组织这些信息。

核心工具介绍

我们将主要使用以下三个Python库:

requests: 用于发送HTTP请求,获取网页的HTML内容。BeautifulSoup: 一个强大的HTML/XML解析库,能够从复杂的HTML文档中提取所需数据。pandas: 一个数据分析库,提供高性能、易于使用的数据结构(如DataFrame),便于数据的存储、处理和分析。

抓取流程详解

整个数据抓取与转换过程可以分为以下几个步骤:

1. 发送HTTP请求获取网页内容

首先,我们需要向目标URL发送一个GET请求,以获取网页的HTML内容。

import requestsfrom bs4 import BeautifulSoupimport pandas as pdfrom typing import Generator, List, TypeAlias# 定义类型别名,提高代码可读性LazyRow: TypeAlias = Generator[str, None, None]LazyRowTable: TypeAlias = Generator[LazyRow, None, None]# 目标URLurl = 'https://www.yr.no/nb/sn%C3%B8dybder/NO-46/Norge/Vestland'# 发送GET请求response = requests.get(url)# 检查请求是否成功response.raise_for_status() # 如果请求失败,会抛出HTTPError异常# 获取网页内容html_content = response.content

response.raise_for_status()是一个良好的实践,它会在HTTP请求返回错误状态码(如4xx或5xx)时抛出异常,帮助我们及时发现网络或服务器问题。

立即学习“Python免费学习笔记(深入)”;

2. 解析HTML内容并定位表格

获取到HTML内容后,BeautifulSoup将帮助我们将其解析成一个可遍历的树形结构,从而方便地定位到目标数据所在的HTML元素。通过观察目标网页(雪深数据页面),我们可以发现雪深数据是以表格形式呈现的。我们需要找到表格的标题行(

)和数据行(

)。

# 使用BeautifulSoup解析HTML内容soup = BeautifulSoup(html_content, 'html.parser')# 定位表格头部(列名)# 查找所有class为'fluid-table__cell--heading'的th标签table_headers = soup.find_all('th', class_='fluid-table__cell--heading')# 定位表格数据行# 查找所有class为'fluid-table__row fluid-table__row--link'的tr标签table_rows = soup.find_all('tr', class_='fluid-table__row fluid-table__row--link')# 提取列名# 注意:在BeautifulSoup的find_all方法中,由于'class'是Python的保留关键字,# 需要使用'class_'来指定HTML元素的class属性。colnames: List[str] = [th.text.strip() for th in table_headers]

在提取列名时,我们使用了一个列表推导式来遍历所有找到的

标签,并获取其文本内容。.strip()方法用于去除文本两端的空白字符。

3. 提取表格数据

表格数据通常位于

标签内部的标签中。我们可以遍历每个数据行,然后遍历该行内的所有子元素(即单元格),提取它们的文本内容。这里使用生成器表达式来高效地处理数据,避免一次性加载所有数据到内存中,尤其适用于大型表格。

# 提取每一行的数据# row.children会返回tr标签下的所有子元素,包括td标签# 这里使用嵌套的生成器表达式来构建行数据row_data: LazyRowTable = ((child.text.strip() for child in row.children) for row in table_rows)

row.children会迭代

标签下的所有直接子元素,这通常包括标签。通过这种方式,我们可以逐个获取每个单元格的文本内容。

4. 构建Pandas DataFrame

最后一步是将提取到的列名和行数据组装成一个Pandas DataFrame。

# 使用提取到的列名和行数据创建Pandas DataFramedf: pd.DataFrame = pd.DataFrame(row_data, columns=colnames)# 尝试将DataFrame中的数据转换为整数类型,如果遇到无法转换的值则忽略(errors='ignore')# 这有助于确保数值型数据以正确的类型存储,便于后续的数值计算df = df.astype(int, errors='ignore')# 打印DataFrame的前几行以验证结果print(df.head())

df.astype(int, errors=’ignore’)尝试将DataFrame中的所有列转换为整数类型。errors=’ignore’参数的作用是,如果某一列包含非数字字符,Pandas将跳过该列的类型转换,而不是抛出错误,这在处理包含混合数据类型的列时非常有用。

完整示例代码

以下是整合了上述所有步骤的完整代码:

import requestsfrom bs4 import BeautifulSoupimport pandas as pdfrom typing import Generator, List, TypeAlias# 定义类型别名,提高代码可读性LazyRow: TypeAlias = Generator[str, None, None]LazyRowTable: TypeAlias = Generator[LazyRow, None, None]def scrape_snow_depth_data(url: str) -> pd.DataFrame:    """    从指定的雪深数据网页抓取表格数据并转换为Pandas DataFrame。    Args:        url (str): 目标网页的URL。    Returns:        pd.DataFrame: 包含雪深数据的DataFrame。    """    try:        # 1. 发送HTTP请求获取网页内容        response = requests.get(url)        response.raise_for_status() # 检查请求是否成功        html_content = response.content        soup = BeautifulSoup(html_content, 'html.parser')        # 2. 解析HTML内容并定位表格元素        # 定位表格头部(列名)        table_headers = soup.find_all('th', class_='fluid-table__cell--heading')        # 定位表格数据行        table_rows = soup.find_all('tr', class_='fluid-table__row fluid-table__row--link')        # 提取列名        colnames: List[str] = [th.text.strip() for th in table_headers]        # 3. 提取每一行的数据        row_data: LazyRowTable = ((child.text.strip() for child in row.children) for row in table_rows)        # 4. 构建Pandas DataFrame        df: pd.DataFrame = pd.DataFrame(row_data, columns=colnames)        # 尝试将DataFrame中的数据转换为整数类型,忽略转换错误        df = df.astype(int, errors='ignore')        return df    except requests.exceptions.RequestException as e:        print(f"请求网页失败: {e}")        return pd.DataFrame() # 返回空DataFrame    except Exception as e:        print(f"处理网页数据时发生错误: {e}")        return pd.DataFrame() # 返回空DataFrameif __name__ == "__main__":    target_url = 'https://www.yr.no/nb/sn%C3%B8dybder/NO-46/Norge/Vestland'    snow_depth_df = scrape_snow_depth_data(target_url)    if not snow_depth_df.empty:        print("成功获取雪深数据:")        print(snow_depth_df.head())        print("nDataFrame信息:")        snow_depth_df.info()    else:        print("未能获取雪深数据。")

注意事项与最佳实践

HTML结构变化: 网页的HTML结构可能会随时间改变,这会导致您的选择器(如class_属性值)失效。定期检查目标网页的HTML结构是必要的。反爬机制: 某些网站可能有反爬虫机制,例如限制请求频率、检测User-Agent、验证码等。在进行大规模抓取时,需要考虑如何规避这些机制,例如设置请求头、使用代理IP、添加延迟等。robots.txt: 在抓取任何网站之前,最好检查其robots.txt文件,了解网站所有者对爬虫的规定。错误处理: 在实际应用中,应加入更完善的错误处理机制,例如网络连接失败、HTML解析错误等,以提高程序的健壮性。数据清洗: 抓取到的原始数据可能包含不必要的空格、特殊字符或不一致的格式。在转换为DataFrame后,通常需要进行进一步的数据清洗和预处理。合法合规: 确保您的抓取行为符合网站的使用条款和相关法律法规,尊重网站的数据所有权。

总结

本教程演示了如何利用Python的requests、BeautifulSoup和pandas库协同工作,实现从复杂网页中抓取结构化表格数据并转换为易于分析的DataFrame。这种方法对于自动化数据收集和构建定制化数据集具有极高的实用价值。通过掌握这些技术,您可以有效地从互联网上获取所需信息,为后续的数据分析和应用奠定基础。

以上就是利用Python进行网页表格数据抓取与Pandas DataFrame转换的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1370714.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用Pandas pivot 和向量化操作优化重复性数据聚合
上一篇 2025年12月14日 10:47:10
Pandas 数据聚合优化:利用 Pivot 提升效率与代码简洁性
下一篇 2025年12月14日 10:47:23

相关推荐

  • mysql如何输入注释 mysql写sql代码的格式规范

    mysql如何输入注释 mysql写sql代码的格式规范mysql如何输入注释 mysql写sql代码的格式规范mysql如何输入注释 mysql写sql代码的格式规范mysql如何输入注释 mysql写sql代码的格式规范

    在mysql中,单行注释使用–(后跟空格)或#,多行注释使用/*…*/。1. 注释应解释“为什么”而非“是什么”,单行注释推荐使用–,#常用于脚本开头;2. 多行注释适用于复杂逻辑说明或版权信息;3. sql格式规范包括关键词大写、统一缩进、合理换行与逗号放置,以…

    2026年9月23日 • 用户投稿
    400
  • 快手跟播助手在哪里?快手跟播助手怎么打开

    随着短视频与直播行业的迅猛发展,快手作为国内知名的短视频社交平台,吸引了大量用户涌入。其中,快手跟播助手成为众多用户提升直播体验的重要工具。本文将全面解析快手跟播助手的功能特点、使用方式,并探讨如何借助它打造个人影响力。 一、快手跟播助手功能介绍 快手跟播助手是一款专为快手用户设计的辅助工具,帮助用…

    2026年9月23日
    400
  • CodeIgniter 4 API:捕获并返回HTTP响应中的错误

    在使用CodeIgniter 4构建API服务时,我们经常需要处理各种异常情况。默认情况下,CodeIgniter 4会将错误信息记录到日志文件中,但不会直接将其返回到HTTP响应中。这导致我们需要频繁地查看日志文件来排查问题,效率较低。为了解决这个问题,我们可以通过修改配置文件,将错误信息直接暴露…

    2026年9月23日
    000
  • safari浏览器如何开启画中画模式播放视频_safari浏览器画中画模式开启方法

    如果您在观看网页视频时希望同时进行其他操作,可以启用 Safari 浏览器的画中画模式,让视频以浮动小窗形式继续播放。此功能支持大多数主流视频网站,如 YouTube、优酷等。 本文运行环境:MacBook Air,macOS Sonoma 一、通过视频右键菜单开启画中画 此方法适用于正在播放的视频…

    2026年9月23日
    000
  • go 语言版本控制器

    管理不同版本的go语言环境是一项繁琐的任务,尤其是当需要为每个go特性单独安装go环境时。为了简化这一过程,我们需要一个版本管理工具来统一管理go环境。以下是关于go版本控制器g的详细介绍。 一、Go版本控制器g简介 g是一个适用于Linux、macOS和Windows的命令行工具,旨在提供一个方便…

    2026年9月23日
    000
  • FlexClip如何用于在线AI视频制作?快速创建云端AI视频的技巧

    FlexClip如何用于在线AI视频制作?快速创建云端AI视频的技巧FlexClip如何用于在线AI视频制作?快速创建云端AI视频的技巧FlexClip如何用于在线AI视频制作?快速创建云端AI视频的技巧FlexClip如何用于在线AI视频制作?快速创建云端AI视频的技巧

    FlexClip通过AI脚本生成、文本转视频、AI配音与图片生成等智能工具,实现从文案到成片的高效制作。其亮点在于一站式云端操作、强大内容生成力、素材库丰富、易用性与专业性兼备。用户可通过个性化修改、原创素材融入、精细剪辑及多轮迭代提升视频独特性,同时应对AI理解偏差、素材同质化、情感表达局限等挑战…

    2026年9月23日 • 用户投稿
    000
  • Windows 下安装和配置 WSL(Windows 10 子系统)

    前言与介绍 作为开发者,经常需要使用 Linux 环境,甚至信息学奥林匹克竞赛(NOI)也采用 Linux 作为编译环境。然而,Linux 系统上缺乏一些必备工具,如 Photoshop 和 Internet Download Manager。因此,Windows 系统同样不可或缺,频繁在两个系统间…

    2026年9月23日
    200
  • 如何压缩D盘以节约空间_D盘空间压缩方法与操作步骤

    首先确认D盘有足够连续空闲空间,通过此电脑右键属性查看可用空间并进行碎片整理以提升压缩效率;接着打开磁盘管理,右键D盘选择压缩卷,系统计算后输入压缩大小完成操作;压缩产生的未分配空间可用于新建分区或扩展相邻卷,建议使用第三方工具实现跨区扩展;整个过程无损且无需重启,但需避免过度压缩以保持磁盘性能。 …

    2026年9月23日
    200
  • mysql怎么添加降序索引 mysql创建排序索引的语法详解

    mysql怎么添加降序索引 mysql创建排序索引的语法详解mysql怎么添加降序索引 mysql创建排序索引的语法详解mysql怎么添加降序索引 mysql创建排序索引的语法详解mysql怎么添加降序索引 mysql创建排序索引的语法详解

    mysql从8.0版本开始支持降序索引,通过在列名后添加desc关键字创建,例如create index idx_order_date_desc on orders (order_date desc);。1. 降序索引优化了order by column desc查询的性能,避免文件排序;2. 升序…

    2026年9月23日 • 用户投稿
    100
  • windows8提示“无法启动此程序,因为计算机中丢失msvcr110.dll”怎么办_windows8 msvcr110.dll缺失修复方法

    windows8提示“无法启动此程序,因为计算机中丢失msvcr110.dll”怎么办_windows8 msvcr110.dll缺失修复方法windows8提示“无法启动此程序,因为计算机中丢失msvcr110.dll”怎么办_windows8 msvcr110.dll缺失修复方法windows8提示“无法启动此程序,因为计算机中丢失msvcr110.dll”怎么办_windows8 msvcr110.dll缺失修复方法windows8提示“无法启动此程序,因为计算机中丢失msvcr110.dll”怎么办_windows8 msvcr110.dll缺失修复方法

    首先使用系统文件检查器修复系统文件,若无效则重新安装Microsoft Visual C++ 2012 Redistributable,或手动注册msvcr110.dll,也可借助可靠DLL修复工具解决该问题。 如果您尝试运行某个程序,但系统弹出“无法启动此程序,因为计算机中丢失msvcr110.d…

    2026年9月23日 • 用户投稿
    300
  • VSCode如何实现代码版本对比 VSCode文件差异查看的高效方法

    在vscode中快速查看当前文件与git历史版本的差异,可通过“时间线”视图点击历史提交,或在“源代码管理”视图右键提交记录选择“比较与工作区文件”实现;2. 对于任意两个本地文件的对比,可在资源管理器中右键第一个文件选择“选择以进行比较”,再右键第二个文件选择“与已选内容进行比较”,即可打开并排差…

    2026年9月23日
    100
  • Java中使用栈验证JSON字符串结构:深入理解与实践

    本文探讨了在Java中利用栈验证JSON字符串结构的核心原理与常见陷阱。我们将分析一种初始实现中处理引号、转义字符及字符串内部结构字符的不足,并提供一个更健壮的栈基方法,以准确判断JSON的括号、方括号和引号是否平衡,同时纠正关于不完整JSON片段有效性的常见误解。 1. JSON结构与验证的重要性…

    2026年9月23日
    100
  • CentOS服务器安装宝塔(图文详解)

    CentOS服务器安装宝塔(图文详解)CentOS服务器安装宝塔(图文详解)CentOS服务器安装宝塔(图文详解)CentOS服务器安装宝塔(图文详解)

    一、概述 宝塔是一款安全且高效的服务器管理面板。 快速创建和管理web项目 提供方便的网站管理功能,例如域名绑定,一键部署SSL证书,调整网站配置等。 >>查看 快速查看服务器资源使用情况 监测CPU、内存、磁盘IO、网络IO数据,并可设置记录保存天数,随时查看特定日期的数据。 >…

    2026年9月23日 • 用户投稿
    100
  • mysql索引类型有哪些 mysql创建不同索引的方法对比

    mysql索引类型有哪些 mysql创建不同索引的方法对比mysql索引类型有哪些 mysql创建不同索引的方法对比mysql索引类型有哪些 mysql创建不同索引的方法对比mysql索引类型有哪些 mysql创建不同索引的方法对比

    mysql支持多种索引类型,选择合适的索引类型可提升数据库性能。1.b-tree索引适用于等值、范围查询和排序,是innodb和myisam的默认索引;2.hash索引仅适合等值查询,不支持范围和排序,memory引擎支持显式创建;3.fulltext索引用于文本搜索,适合关键词查找;4.空间索引(…

    2026年9月23日 • 用户投稿
    000
  • Tableau的AI混合工具如何操作?生成智能数据可视化的实用指南

    Tableau的AI混合工具通过自然语言查询、自动解释和预测模型,降低数据分析门槛,帮助非技术用户快速获取洞察。首先,Ask Data支持用日常语言提问,自动生成可视化图表,显著提升数据探索效率;其次,Explain Data利用机器学习分析异常点,揭示潜在影响因素,将“是什么”转化为“为什么”;再…

    2026年9月23日
    000
  • VSCode配置Java编程环境(手把手教学,环境搭建不求人)

    安装jdk并配置环境变量,推荐使用java 11或java 17等lts版本,通过命令行执行java -version和javac -version验证安装成功;2. 下载并安装vscode本体,按照默认安装流程完成;3. 在vscode中安装“extension pack for java”扩展包…

    2026年9月23日
    100
  • mysql安装完成如何事件 mysql定时任务设置教程

    mysql安装完成如何事件 mysql定时任务设置教程mysql安装完成如何事件 mysql定时任务设置教程mysql安装完成如何事件 mysql定时任务设置教程mysql安装完成如何事件 mysql定时任务设置教程

    要使用mysql的事件调度器设置定时任务,首先需开启事件调度器,其次创建定时事件,再查看管理事件,最后注意权限与时间格式等问题。具体步骤如下:1. 开启事件调度器:通过命令或配置文件启用;2. 创建事件:使用create event定义执行频率与sql操作;3. 管理事件:可查看、修改或删除已有事件…

    2026年9月23日 • 用户投稿
    100
  • OpenAI 与微软达成重磅交易:股权结构再变,投资者面临稀释风险

    据《金融时报》披露,OpenAI 近期完成了一系列关键性交易,使其股权架构日趋复杂,同时也加剧了投资者对未来收益前景的担忧。在这些新协议推动下,OpenAI 的估值已飙升至5000亿美元,跃居全球最具价值的未上市企业之列。这一惊人估值的背后,是公司与英伟达和AMD两家芯片巨头达成的数十亿美元合作协议…

    2026年9月23日
    000
  • windows怎么更改系统默认字体 windows系统默认字体更改教程

    可通过修改注册表、使用第三方工具或更换主题间接更改Windows默认字体。首先备份系统,避免操作失误导致界面异常。 如果您发现Windows系统的默认字体显示效果不理想,或者希望个性化界面外观,可以通过修改系统设置或注册表来更改默认字体。以下是实现这一目标的具体步骤。 本文运行环境:Dell XPS…

    2026年9月23日
    000
  • 企业批量部署Windows安装的解决方案

    使用WDS、ConfigMgr、MDT、GhostCast及OEM工具可实现Windows系统批量部署。首先通过WDS网络推送镜像并结合应答文件自动安装;其次利用ConfigMgr集中管理任务序列与策略,支持大规模远程部署;再者采用MDT轻量框架整合驱动与应用,提升自动化水平;还可借助GhostCa…

    2026年9月23日
    200

发表回复

登录后才能评论
关注微信