PHP中高效提取指定HTML标题及其紧邻段落的教程

PHP中高效提取指定HTML标题及其紧邻段落的教程

本教程详细介绍了如何使用php的domdocument和domxpath库,从复杂的html字符串中准确提取所有h3标题及其紧邻的第一个段落。文章强调了避免使用正则表达式解析html的重要性,并提供了一个结构清晰、包含示例代码和注意事项的专业解决方案,帮助开发者安全、高效地处理html内容。

HTML内容解析:提取指定标题及其紧邻段落

在Web开发中,我们经常需要从HTML内容中提取特定信息。一个常见的需求是获取某个特定级别的标题(例如

)及其紧随其后的第一个段落。虽然正则表达式在某些简单的文本匹配场景下表现出色,但在处理HTML这种具有复杂嵌套结构的标记语言时,使用正则表达式往往会导致代码脆弱、难以维护且容易出错。本文将介绍如何利用PHP内置的DOMDocument和DOMXPath类来安全、高效地实现这一目标。

为什么不推荐使用正则表达式解析HTML?

HTML是一种上下文无关文法,而正则表达式是处理正则文法的工具。尝试用正则表达式解析HTML,就像试图用一把扳手解决所有机械问题一样,虽然在某些简单情况下可能奏效,但面对稍微复杂一点的HTML结构(例如嵌套标签、属性、注释、不同风格的空白符等),正则表达式很快就会变得极其复杂,难以编写、调试和维护。更重要的是,它无法理解HTML的结构和DOM树,无法可靠地处理“下一个兄弟元素”或“父元素”这样的概念。

推荐方案:使用DOMDocument和DOMXPath

PHP提供了强大的DOM扩展,其中的DOMDocument类用于加载和解析HTML/XML文档,而DOMXPath类则允许我们使用XPath查询语言来导航和查找DOM树中的特定节点。这种方法不仅更健壮、更可靠,而且代码可读性也更高。

1. 加载HTML内容

首先,我们需要将HTML字符串加载到一个DOMDocument对象中。

立即学习“PHP免费学习笔记(深入)”;

<?php$html = <<<TAG

This is my title

This is a text right under my h1 title.

This is some more text under my h1 title

This is my level 2 heading

This is text right under my level 2 heading

First h3

First paragraph for the first h3

Second h3

First paragraph for the second h3

Third h3

First paragraph for the third h3

Second paragraph for the third h3

This is my level 2 heading

This is text right under my level 2 heading

TAG;$dom = new DomDocument();// 使用 LIBXML_HTML_NOIMPLIED 和 LIBXML_HTML_NODEFDTD 标志来避免DOMDocument自动添加不必要的, , 等标签// 这对于解析HTML片段非常有用@$dom->loadHTML($html, LIBXML_HTML_NOIMPLIED | LIBXML_HTML_NODEFDTD);// 注意:loadHTML可能会因为HTML不规范而发出警告,使用@符号可以抑制这些警告,但更好的做法是进行错误处理。

在loadHTML方法中,我们使用了LIBXML_HTML_NOIMPLIED和LIBXML_HTML_NODEFDTD两个标志。它们的作用是告诉解析器不要自动添加缺失的、

、“等标签,这对于处理HTML片段而非完整文档时非常有用,可以避免生成不必要的额外结构。

2. 创建DOMXPath对象

DOMXPath对象允许我们对加载的DOM树执行XPath查询。

$xpath = new DOMXPath($dom);

3. 执行XPath查询并遍历结果

我们需要查询所有的

标签。XPath表达式//h3表示在文档的任何位置查找所有

元素。

获取到所有

元素后,我们可以遍历这些元素。对于每一个

元素,我们需要找到它紧邻的下一个兄弟元素,并检查它是否是

标签。

// 查询所有h3标签$results = $xpath->query("//h3");$extracted_data = [];foreach ($results as $h3_node) {    $heading_text = $h3_node->textContent;    $paragraph_text = '';    // 获取h3节点的下一个兄弟元素    // nextElementSibling 属性返回元素的下一个兄弟元素(如果存在),忽略文本节点和注释节点    $next_element = $h3_node->nextElementSibling;    // 检查下一个元素是否存在且其标签名是否为'p'    if ($next_element && 'p' === $next_element->nodeName) {        $paragraph_text = $next_element->textContent;    }    $extracted_data[] = [        'heading' => $heading_text,        'paragraph' => $paragraph_text    ];}// 打印提取的数据foreach ($extracted_data as $item) {    echo "

" . htmlspecialchars($item['heading']) . "

"; echo "

" . htmlspecialchars($item['paragraph']) . "

";}

完整示例代码

<?php$html = <<<TAG

This is my title

This is a text right under my h1 title.

This is some more text under my h1 title

This is my level 2 heading

This is text right under my level 2 heading

First h3

First paragraph for the first h3

Second h3

First paragraph for the second h3

Third h3

First paragraph for the third h3

Second paragraph for the third h3

This is my level 2 heading

This is text right under my level 2 heading

TAG;// 创建DOMDocument对象$dom = new DomDocument();// 加载HTML内容,并使用标志避免自动添加不必要的HTML结构// @ 符号用于抑制loadHTML可能发出的关于HTML格式不规范的警告@$dom->loadHTML($html, LIBXML_HTML_NOIMPLIED | LIBXML_HTML_NODEFDTD);// 创建DOMXPath对象,用于执行XPath查询$xpath = new DOMXPath($dom);// 查询所有h3标签$h3_nodes = $xpath->query("//h3");$extracted_pairs = [];// 遍历所有h3节点foreach ($h3_nodes as $h3_node) { $heading_text = $h3_node->textContent; $paragraph_text = ''; // 获取h3节点的下一个兄弟元素 // nextElementSibling 会跳过文本节点和注释节点,直接找到下一个元素节点 $next_element = $h3_node->nextElementSibling; // 检查下一个元素是否存在且其标签名是否为'p' if ($next_element && 'p' === $next_element->nodeName) { $paragraph_text = $next_element->textContent; } // 将提取到的标题和段落存储起来 $extracted_pairs[] = [ 'heading' => $heading_text, 'paragraph' => $paragraph_text ];}// 按照期望的格式输出结果foreach ($extracted_pairs as $pair) { echo "

" . htmlspecialchars($pair['heading']) . "

"; echo "

" . htmlspecialchars($pair['paragraph']) . "

";}?>

预期输出

First h3

First paragraph for the first h3

Second h3

First paragraph for the second h3

Third h3

First paragraph for the third h3

注意事项与总结

错误处理: loadHTML方法在处理格式不规范的HTML时可能会发出警告。在生产环境中,不建议简单地使用@抑制警告,而应该通过libxml_use_internal_errors(true)和libxml_get_errors()来捕获并处理这些错误,以提高程序的健壮性。nextElementSibling的局限性: nextElementSibling只查找下一个元素兄弟节点。如果HTML结构中在

和

之间存在文本节点(例如空白符或注释),它会被跳过。如果需要考虑所有类型的节点,可以使用nextSibling,但之后需要额外判断nodeType。对于本例的需求,nextElementSibling是合适的选择。

XPath的灵活性: XPath表达式非常强大,可以根据更复杂的条件来选择节点。例如,如果你需要选择具有特定类名的

,可以使用//h3[@class=”my-class”]。

编码问题: 在处理包含非ASCII字符的HTML时,确保HTML内容和PHP脚本的编码一致(通常是UTF-8),以避免乱码。DOMDocument默认使用ISO-8859-1编码,如果HTML是UTF-8,你可能需要在加载前设置$dom->encoding = ‘UTF-8’;或在loadHTML后使用$dom->saveHTML()来获取正确的编码输出。安全性: 在将提取到的文本重新输出到网页时,务必使用htmlspecialchars()或htmlentities()进行编码,以防止跨站脚本攻击(XSS)。

通过采用DOMDocument和DOMXPath,我们能够以一种结构化且安全的方式解析HTML,精确地定位和提取所需的数据,从而避免了正则表达式在处理HTML时的固有缺陷。这种方法是处理HTML内容的标准和推荐实践。

以上就是PHP中高效提取指定HTML标题及其紧邻段落的教程的详细内容,更多请关注php中文网其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1339800.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Laravel 递归模型:实现排除特定祖先及其所有后代记录的查询
上一篇 2025年12月13日 03:16:17
Laravel 文件数组总大小验证:自定义规则实现
下一篇 2025年12月13日 03:16:44

相关推荐

  • 格子达论文查重怎么操作_格子达官方检测系统指南

    格子达论文查重怎么操作_格子达官方检测系统指南格子达论文查重怎么操作_格子达官方检测系统指南格子达论文查重怎么操作_格子达官方检测系统指南格子达论文查重怎么操作_格子达官方检测系统指南

    首先登录格子达官网注册账号并登录,接着在个人中心上传符合格式的论文文件,填写必要信息后提交检测,最后等待系统生成报告并下载查看总相似比、AI占比等数据,结合标注内容进行修改。 格子达论文查重怎么操作?这是不少网友都关注的,接下来由PHP小编为大家带来格子达官方检测系统指南,感兴趣的网友一起随小编来瞧…

    2026年9月28日 • 用户投稿
    000
  • Android 应用中页面(Activity)间导航的实现指南

    Android 应用中页面(Activity)间导航的实现指南Android 应用中页面(Activity)间导航的实现指南Android 应用中页面(Activity)间导航的实现指南Android 应用中页面(Activity)间导航的实现指南

    本文详细介绍了在 Android 应用中如何通过按钮实现不同页面(Activity)之间的切换。核心机制是使用 Intent 对象来指定目标 Activity,并通过 startActivity() 方法启动它。文章提供了 MainActivity.java 中的示例代码,并强调了 AndroidM…

    2026年9月28日 • 用户投稿
    000
  • sublime怎么在替换时使用换行符_Sublime查找替换功能中使用换行符

    sublime怎么在替换时使用换行符_Sublime查找替换功能中使用换行符sublime怎么在替换时使用换行符_Sublime查找替换功能中使用换行符sublime怎么在替换时使用换行符_Sublime查找替换功能中使用换行符sublime怎么在替换时使用换行符_Sublime查找替换功能中使用换行符

    在Sublime Text中替换换行需启用正则模式,用n或R表示换行符。开启”.*”按钮后,查找用n、rn或R匹配不同换行格式,替换时用n插入换行,如将逗号替换为n可实现分行效果。 在Sublime Text中进行查找替换时,如果需要使用换行符,可以通过正则表达式模式来实现。…

    2026年9月28日 • 用户投稿
    100
  • 运维新概念:高效积累之道

    运维新概念:高效积累之道运维新概念:高效积累之道运维新概念:高效积累之道运维新概念:高效积累之道

    当前技术更新日新月异,各类语言、工具和理念层出不穷,令人应接不暇。唯有持续学习、不断吸收新知,方能紧跟发展潮流,不被时代淘汰。 1、 IT部门面临诸多挑战 2、 目前,IT部门整体尚未获得充分认可。尽管信息化在各单位日益重要,仍有部分管理者将其视为单纯的成本支出部门,认为其只消耗资源而无法直接创收,…

    2026年9月28日 • 用户投稿
    100
  • 如何下载豆包AI应用 豆包AI应用下载与安装步骤解析

    如何下载豆包AI应用 豆包AI应用下载与安装步骤解析如何下载豆包AI应用 豆包AI应用下载与安装步骤解析如何下载豆包AI应用 豆包AI应用下载与安装步骤解析如何下载豆包AI应用 豆包AI应用下载与安装步骤解析

    豆包ai应用下载安装方法有三种: 一、手机应用商店搜索“豆包”或“Doubao”,确认开发者为“北京字节跳动科技有限公司”后点击安装; 二、直接使用“豆包AI网页版在线使用入口☜☜☜☜直接进入”; 三、注意常见问题如无法找到应用时检查关键词、安装失败时查看存储和系统版本、iOS用户提示“未受信任的企…

    2026年9月28日 • 用户投稿
    000
  • sublime prettier插件配置_Prettier代码格式化插件配置指南

    sublime prettier插件配置_Prettier代码格式化插件配置指南sublime prettier插件配置_Prettier代码格式化插件配置指南sublime prettier插件配置_Prettier代码格式化插件配置指南sublime prettier插件配置_Prettier代码格式化插件配置指南

    首先安装JsPrettier插件并配置prettier_cli_path和node_path路径,设置format_on_save_enabled为true以实现保存时自动格式化,确保prettier_options与项目规则一致,推荐在项目中本地安装Prettier并通过快捷键Ctrl+Alt+F…

    2026年9月28日 • 用户投稿
    000
  • 格子达论文检测入口在哪里—格子达学位论文查重入口

    格子达论文检测入口在哪里—格子达学位论文查重入口格子达论文检测入口在哪里—格子达学位论文查重入口格子达论文检测入口在哪里—格子达学位论文查重入口格子达论文检测入口在哪里—格子达学位论文查重入口

    格子达论文查重入口在www.gezida.com,用户注册后可上传Word或PDF文件进行检测,系统采用语义分析算法,比对广泛学术资源,支持分段查重,生成带来源标注的PDF报告,界面简洁并提供实时进度与在线客服。 格子达论文检测入口在哪里—格子达学位论文查重入口,这是不少学生在撰写毕业论文时都关注的…

    2026年9月28日 • 用户投稿
    000
  • 将PostgreSQL存储过程转换为Spring Boot原生查询的实践指南

    将PostgreSQL存储过程转换为Spring Boot原生查询的实践指南将PostgreSQL存储过程转换为Spring Boot原生查询的实践指南将PostgreSQL存储过程转换为Spring Boot原生查询的实践指南将PostgreSQL存储过程转换为Spring Boot原生查询的实践指南

    本文旨在指导开发者如何将PostgreSQL存储过程转换为Spring Boot应用中的原生SQL查询。通过分析一个具体的存储过程,我们将详细演示如何构建等效的SQL查询,并介绍Spring Data JPA @Query注解中两种主要的参数映射方式:命名参数和位置参数,以实现存储过程的替代。 存储…

    2026年9月28日 • 用户投稿
    100
  • 微信视频号有浏览足迹吗?视频号会有访客记录吗

    微信视频号有浏览足迹吗?视频号会有访客记录吗微信视频号有浏览足迹吗?视频号会有访客记录吗微信视频号有浏览足迹吗?视频号会有访客记录吗微信视频号有浏览足迹吗?视频号会有访客记录吗

    在移动互联网高速发展的今天,微信早已深度融入我们的日常生活。作为微信生态的重要组成部分,微信视频号吸引了大量用户驻足观看、创作和互动。你是否也曾有过这样的疑问:我在视频号上看过的视频会留下痕迹吗?别人能不能看到我的浏览记录?本文将为你全面解析——微信视频号是否有浏览足迹,以及是否存在访客记录。 一、…

    2026年9月28日 • 用户投稿
    100
  • sublime怎么设置成便携版_Sublime Text创建与使用Portable便携版本

    sublime怎么设置成便携版_Sublime Text创建与使用Portable便携版本sublime怎么设置成便携版_Sublime Text创建与使用Portable便携版本sublime怎么设置成便携版_Sublime Text创建与使用Portable便携版本sublime怎么设置成便携版_Sublime Text创建与使用Portable便携版本

    下载Sublime Text便携版.zip并解压;2. 在解压目录创建Data文件夹;3. 启动sublime_text.exe即进入便携模式,所有配置自动存于Data内;4. 通过复制Data文件夹可实现设置备份与迁移,无需安装或注册表修改,跨设备使用便捷。 Sublime Text 本身不提供官…

    2026年9月28日 • 用户投稿
    000
  • 没有体力限制 没有抽卡的二游!《二重螺旋》10月28日公测

    没有体力限制 没有抽卡的二游!《二重螺旋》10月28日公测没有体力限制 没有抽卡的二游!《二重螺旋》10月28日公测没有体力限制 没有抽卡的二游!《二重螺旋》10月28日公测没有体力限制 没有抽卡的二游!《二重螺旋》10月28日公测

    英雄游戏旗下潘神工作室于8月26日发布消息,其自主研发的免费arpg《二重螺旋》将于10月28日正式上线,登陆pc(epic games商店)、ios及android三大平台。游戏将取消角色与武器的抽卡机制,并彻底移除体力系统。 本作构建在一个魔法与机械交融的世界观中,人类与亚人种共同生活,但拥有双…

    2026年9月28日 • 用户投稿
    000
  • Web无插件RTSP视频流直播系统EasySearcher探测工具无法运行是什么原因?

    Web无插件RTSP视频流直播系统EasySearcher探测工具无法运行是什么原因?Web无插件RTSP视频流直播系统EasySearcher探测工具无法运行是什么原因?Web无插件RTSP视频流直播系统EasySearcher探测工具无法运行是什么原因?Web无插件RTSP视频流直播系统EasySearcher探测工具无法运行是什么原因?

    easynvr分为硬件版本和软件版本,两者的功能基本一致。然而,硬件版本的配置需要额外进行探索和接入步骤才能完成部署。探索功能需要使用tsingsee青犀视频自主研发的easysearcher探测工具,该工具可以在easynvr的官方网站上下载。 在某些情况下,EasySearcher探测工具可能会…

    2026年9月28日 • 用户投稿
    100
  • 牧场物语风之繁华集市自然精灵系统指南 自然精灵功能及位置

    牧场物语风之繁华集市自然精灵系统指南 自然精灵功能及位置牧场物语风之繁华集市自然精灵系统指南 自然精灵功能及位置牧场物语风之繁华集市自然精灵系统指南 自然精灵功能及位置牧场物语风之繁华集市自然精灵系统指南 自然精灵功能及位置

    《牧场物语 风之集市》中的自然精灵系统是维系农场生态平衡与促进作物成长的重要机制。在游戏第一年春季第13日上午,该系统将自动解锁,并同步开启“欢乐能量”玩法。通过“助威小队”功能,自然精灵可在集市日协助提升商品的销售表现和品质,助力玩家获得更高收益。 牧场物语风之繁华集市自然精灵系统详解 1、自然精…

    2026年9月28日 • 用户投稿
    000
  • MySQL怎样使用索引合并优化 复合索引与索引合并策略

    MySQL怎样使用索引合并优化 复合索引与索引合并策略MySQL怎样使用索引合并优化 复合索引与索引合并策略MySQL怎样使用索引合并优化 复合索引与索引合并策略MySQL怎样使用索引合并优化 复合索引与索引合并策略

    索引合并是mysql中一种优化策略,允许在单个查询中使用多个索引来定位数据。其主要类型包括:1. union合并,用于or连接的条件;2. intersection合并,用于and连接的条件;3. sort-union合并,用于需排序后再合并的情况。复合索引与索引合并不同,前者是多列组合索引,后者则…

    2026年9月28日 • 用户投稿
    000
  • 乌鲁木齐银行定向采购 Oracle、IBM、Redhat

    2022年2月18日,乌鲁木齐银行发布《正版oracle软件采购项目》公开询价公告,控制价 283 万元。 采购内容:主要目标为以数量授权模式采购,采购Oracle数据库6C,Oracle weblogic 4C,Oracle集群2C,Oracle ADG 2C。 2022年3月1日发布成交公告,新…

    2026年9月28日
    000
  • 抖音价格保护是什么意思?抖音有价格保护吗

    抖音价格保护是什么意思?抖音有价格保护吗抖音价格保护是什么意思?抖音有价格保护吗抖音价格保护是什么意思?抖音有价格保护吗抖音价格保护是什么意思?抖音有价格保护吗

    随着短视频平台的迅猛发展,抖音早已不只是一个娱乐工具,更成为集内容与电商于一体的综合性平台。越来越多用户选择在抖音购物,但随之而来的问题也引发了关注:刚买完商品会不会马上降价?有没有价格保障机制?今天我们就来深入解析“抖音是否有价格保护”以及“价格保护到底意味着什么”。 一、什么是抖音的价格保护? …

    2026年9月28日 • 用户投稿
    000
  • MBTI测试免费链接入口_ MBTI免费测试网站在线地址

    MBTI测试免费链接入口_ MBTI免费测试网站在线地址MBTI测试免费链接入口_ MBTI免费测试网站在线地址MBTI测试免费链接入口_ MBTI免费测试网站在线地址MBTI测试免费链接入口_ MBTI免费测试网站在线地址

    MBTI测试免费链接入口包括www.16personalities.com和www.16mbti.cn,前者基于荣格理论提供16种人格类型分析,含职业建议;后者支持多次测试、生成多维度报告,具社交分享功能,界面简洁适配多设备,测试约12分钟完成。 MBTI测试免费链接入口在哪里?这是不少网友都关注的…

    2026年9月28日 • 用户投稿
    000
  • 雷军:28年老友!“榜一大哥”陈年没有付给小米一分钱广告费

    雷军:28年老友!“榜一大哥”陈年没有付给小米一分钱广告费雷军:28年老友!“榜一大哥”陈年没有付给小米一分钱广告费雷军:28年老友!“榜一大哥”陈年没有付给小米一分钱广告费雷军:28年老友!“榜一大哥”陈年没有付给小米一分钱广告费

    9月25日晚,在小米年度演讲前夕,雷军与王化提前开启互动模式,和老友凡客创始人陈年展开了一场别开生面的“隔空对话”,并晒出了他们联手设计的T恤。 这件看似普通的T恤,却承载着小米十余年的成长轨迹:从2011年发布会上那件仅售29元的凡客T恤,被网友封为“雷军战袍”,以极致性价比打破市场格局;再到如今…

    2026年9月28日 • 用户投稿
    000
  • 深入理解Java泛型:类型参数与方法重载的实践指南

    深入理解Java泛型:类型参数与方法重载的实践指南深入理解Java泛型:类型参数与方法重载的实践指南深入理解Java泛型:类型参数与方法重载的实践指南深入理解Java泛型:类型参数与方法重载的实践指南

    本文深入探讨了Java泛型中关于类型参数与泛型类实例在方法签名中的区别,以及由此引发的类型不匹配问题。通过一个具体的代码示例,详细解析了为何在泛型方法中,直接传入泛型类实例或其内部类型参数会引发编译错误,并提供了利用方法重载这一核心机制来优雅地解决此类问题的专业指导和示例代码,帮助开发者清晰理解“h…

    2026年9月28日 • 用户投稿
    100
  • 抖音私信怎么屏蔽?抖音私信怎么屏蔽一个人的消息

    抖音私信怎么屏蔽?抖音私信怎么屏蔽一个人的消息抖音私信怎么屏蔽?抖音私信怎么屏蔽一个人的消息抖音私信怎么屏蔽?抖音私信怎么屏蔽一个人的消息抖音私信怎么屏蔽?抖音私信怎么屏蔽一个人的消息

    随着抖音的普及,越来越多用户加入这个短视频社交平台。在日常使用中,不少人会收到陌生或不想要的私信,甚至遭遇骚扰信息。为了更好地保护个人隐私和使用体验,掌握屏蔽私信的方法显得尤为重要。接下来,就为大家详细介绍如何有效屏蔽抖音私信。 一、屏蔽抖音私信的具体操作 1. 屏蔽某个特定用户 当你希望阻止某位用…

    2026年9月28日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信