使用 simple_html_dom 高效提取标题下的所有段落

程序猿 • 2025年12月12日 23:46:47 • 用户投稿 • 阅读 0

本教程详细阐述了如何利用 `voku/simple_html_dom` 库，从复杂的html结构中准确提取并组织特定标题下的所有段落。文章深入分析了 `next_sibling()` 方法的正确用法，解决了仅获取首个段落的常见问题，并提供了遍历同级元素直至遇到下一个标题的完整解决方案，确保数据按标题分组，结构清晰。

在进行网页内容抓取和数据处理时，我们经常需要从非结构化的HTML中提取特定模式的数据。一个常见的场景是，需要将文章内容按照标题进行分组，例如，提取每个

标题下的所有

段落，并将其组织成一个数组。本文将详细介绍如何使用 voku/simple_html_dom 库高效地实现这一目标。

理解问题：next_sibling() 的局限性

假设我们有以下HTML结构：

Title 1

Text 1

Text 2

立即学习“前端免费学习笔记（深入）”；

Title 2

Text 3

Text 4

Text 5

我们期望得到的数据结构是：

[    'Title 1' => ['Text 1', 'Text 2'],    'Title 2' => ['Text 3', 'Text 4', 'Text 5'],]

初学者可能会尝试使用 next_sibling(‘p’) 方法来获取标题后的所有段落，例如：

use vokuhelperHtmlDomParser;$htmlContent = 'Title 1
Text 1
Text 2
立即学习“前端免费学习笔记（深入）”；
Title 2
Text 3
Text 4
Text 5
';$dom = HtmlDomParser::str_get_html($htmlContent);$result = [];foreach ($dom->find('h2') as $h2Element) {    $paragraphs = [];    // 尝试获取下一个p标签    foreach ($h2Element->next_sibling('p') as $pElement) { // 注意：这里可能不会按预期工作        $paragraphs[] = $pElement->text();    }    $result[$h2Element->text()] = $paragraphs;}print_r($result);

然而，这种方法往往只能获取到每个

标签后的第一个

标签。这是因为 next_sibling(‘p’) 查找的是当前元素的紧邻的下一个且符合选择器的同级元素。如果后面还有多个

标签，它们并不是 next_sibling(‘p’) 的直接结果集。要获取所有后续的

标签，我们需要更通用的同级元素遍历方法。

解决方案：迭代遍历同级元素

正确的做法是，从每个

元素开始，持续遍历其所有后续的同级元素，直到遇到下一个

元素为止。在遍历过程中，判断当前同级元素的类型，如果是

标签，则将其内容收集起来。

以下是实现此逻辑的详细代码：

<?phprequire_once 'vendor/autoload.php'; // 确保引入 simple_html_dom 库use vokuhelperHtmlDomParser;// 模拟的HTML内容$htmlContent = '    Title 1
      Text 1
      Text 2
立即学习“前端免费学习笔记（深入）”；
    Title 2
      Text 3
      Text 4
      Text 5
    Title 3
      Not a paragraph
      Text 6
';// 使用 HtmlDomParser 解析HTML字符串$dom = HtmlDomParser::str_get_html($htmlContent);// 初始化结果数组$groupedContent = [];// 遍历所有的 h2 元素foreach ($dom->find('h2') as $h2Element) {    $h2Text = $h2Element->text(); // 获取 h2 的文本作为键    $paragraphs = []; // 用于存储当前 h2 下的段落    // 获取 h2 元素的紧邻下一个同级元素    $currentSibling = $h2Element->next_sibling();    // 循环遍历所有后续同级元素，直到没有同级元素或遇到下一个 h2    while ($currentSibling) {        // 如果遇到下一个 h2 元素，则停止当前 h2 的段落收集        if ($currentSibling->nodeName() === "h2") {            break;        }        // 如果是 p 元素，则将其文本添加到当前 h2 的段落数组中        if ($currentSibling->nodeName() === "p") {            $paragraphs[] = $currentSibling->text();        }        // 移动到下一个同级元素        $currentSibling = $currentSibling->next_sibling();    }    // 将收集到的段落添加到结果数组中    $groupedContent[$h2Text] = $paragraphs;}// 打印最终结果echo "";print_r($groupedContent);echo "

";// 清理 DOM 对象以释放内存$dom->clear();unset($dom);?>

代码解析

HtmlDomParser::str_get_html($htmlContent): 将HTML字符串解析成一个DOM对象，方便后续操作。foreach ($dom->find('h2') as $h2Element): 这是一个外层循环，用于遍历HTML文档中所有的

标签。每次循环，$h2Element 都会指向一个

元素。

$h2Text = $h2Element->text();: 获取当前

元素的纯文本内容，这将作为我们最终结果数组的键。

$currentSibling = $h2Element->next_sibling();: 这是关键一步。我们不再尝试直接匹配 p 标签，而是获取

元素的紧邻的下一个同级元素，无论它是什么标签。

while ($currentSibling): 这是一个内层循环，只要当前还有同级元素存在，就继续遍历。if ($currentSibling->nodeName() === "h2") { break; }: 在内层循环中，我们首先检查当前同级元素的标签名。如果它也是一个

标签，这意味着我们已经到达了下一个标题的边界，应该停止为当前的 h2Text 收集段落，并跳出内层循环。

if ($currentSibling->nodeName() === "p") { $paragraphs[] = $currentSibling->text(); }: 如果当前同级元素是

标签，则将其纯文本内容添加到 $paragraphs 数组中。

$currentSibling = $currentSibling->next_sibling();: 每次循环结束时，我们都会将 $currentSibling 更新为它的下一个同级元素，以便继续遍历。$groupedContent[$h2Text] = $paragraphs;: 当内层循环结束后（即遇到了下一个

或没有更多同级元素），将收集到的所有段落数组赋值给 $groupedContent 中对应的 h2Text 键。

预期输出

运行上述代码，将得到以下结果：

Array(    [Title 1] => Array        (            [0] => Text 1            [1] => Text 2        )    [Title 2] => Array        (            [0] => Text 3            [1] => Text 4            [2] => Text 5        )    [Title 3] => Array        (            [0] => Text 6        ))

注意事项与最佳实践

HTML结构一致性: 这种方法依赖于HTML结构中

和

标签都是同级元素。如果HTML结构更复杂，例如

标签嵌套在

中，并且

是

的同级元素，则需要调整遍历逻辑。

内存管理: 对于非常大的HTML文档，simple_html_dom 可能会消耗较多内存。在处理完DOM对象后，建议使用 $dom->clear(); unset($dom); 来释放内存。错误处理: 在实际应用中，应考虑HTML可能不规范的情况。例如，如果

后面没有

标签，或者有其他非预期的标签，当前的逻辑仍然可以正确处理（跳过非

标签）。

性能: 对于极其庞大的HTML文件，频繁地调用 next_sibling() 可能会有性能开销。在性能敏感的场景下，可以考虑其他更底层的DOM解析器或XPath查询。灵活性: 此方法可以很容易地扩展到处理其他标签类型。例如，如果需要提取

下的所有列表，只需在 if ($currentSibling->nodeName() === "p") 旁边添加一个 if ($currentSibling->nodeName() === "ul") 的判断即可。

总结

通过灵活运用 voku/simple_html_dom 的 next_sibling() 方法并结合循环判断，我们可以有效地从复杂的HTML结构中提取出按标题分组的段落内容。关键在于理解 next_sibling() 的工作原理，并将其用于迭代遍历所有同级元素，直到遇到预设的终止条件（如下一个标题）。这种模式在网页数据抓取和内容重组中具有广泛的应用价值。

以上就是使用 simple_html_dom 高效提取标题下的所有段落的详细内容，更多请关注php中文网其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1338077.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

Symfony框架适合做什么_Symfony框架适用场景与项目类型

上一篇 2025年12月12日 23:46:39

解决CodeIgniter 4中IE浏览器重定向失效问题

下一篇 2025年12月12日 23:46:57

好文分享

揭示绝对定位的缺点并提出解决方案：常见问题的规避策略

绝对定位的弊端揭秘：如何避免常见问题？绝对定位是网页设计中常用的一种布局方式，它可以让元素精确地定位在页面上的指定位置。然而，尽管绝对定位在某些情况下非常有用，但它也存在一些弊端。本文将揭示绝对定位的弊端，并提供一些方法来避免常见问题。首先，绝对定位的一个弊端是元素定位可能受到浏览器窗口大小的影…

程序猿
2025年12月24日
0000
好文分享

常见问题和解决方法：绝对定位运动指令的疑问与解答

绝对定位运动指令的常见问题及解决方法摘要：随着技术的不断进步，绝对定位运动在现代机械设备中得到了广泛应用。然而，在使用绝对定位运动指令的过程中，常常会遇到各种问题。本文将重点讨论常见的绝对定位运动指令问题，并提供相应的解决方法和具体的代码示例。一、绝对定位运动指令简介绝对定位运动指令是指根据目标…

程序猿
2025年12月24日
0000
好文分享

揭秘绝对定位故障：常见问题和解决方法曝光

绝对定位故障大揭秘：常见问题及解决方案引言：绝对定位（Absolute positioning）是CSS中常用的一种定位方式，它允许开发者将元素精确地放置在一个给定的位置上。然而，由于其特殊的性质和较为复杂的用法，绝对定位经常会出现各种问题。本文将揭示绝对定位的常见故障，并提供相应的解决方案，同…

程序猿
2025年12月24日
0000
好文分享

学会从头开始学习CSS，掌握制作基本网页框架的技巧

从零开始学习CSS，掌握网页基本框架制作技巧前言：在现今互联网时代，网页设计和开发是一个非常重要的技能。而学习CSS（层叠样式表）是掌握网页设计的关键之一。CSS不仅可以为网页添加样式和布局，还可以为用户呈现独特且具有吸引力的页面效果。在本文中，我将为您介绍一些基本的CSS知识，以及一些常用的代…

程序猿
2025年12月24日
4000
好文分享

揭秘Web标准涵盖的语言：了解网页开发必备的语言范围

在当今数字时代，互联网成为了人们生活中不可或缺的一部分。作为互联网的基本构成单位，网页承载着我们获取和分享信息的重要任务。而网页开发作为一门独特的技术，离不开一些必备的语言。本文将揭秘Web标准涵盖的语言，让我们一起了解网页开发所需的语言范围。首先，HTML（HyperText Markup La…

程序猿
2025年12月24日
1000
好文分享

揭开Web开发的语言之谜：了解构建网页所需的语言有哪些？

Web标准中的语言大揭秘：掌握网页开发所需的语言有哪些？随着互联网的快速发展，网页开发已经成为人们重要的职业之一。而要成为一名优秀的网页开发者，掌握网页开发所需的语言是必不可少的。本文将为大家揭示Web标准中的语言大揭秘，介绍网页开发所需的主要语言。 HTML（超文本标记语言）HTML是网页开发的…

程序猿
2025年12月24日
5000
好文分享

常用的网页开发语言：了解Web标准的要点

了解Web标准的语言要点：常见的哪些语言应用在网页开发中？随着互联网的不断发展，网页已经成为人们获取信息和交流的重要途径。而要实现一个高质量、易用的网页，离不开一种被广泛接受的Web标准。Web标准的制定和应用，涉及到多种语言和技术，本文将介绍常见的几种语言在网页开发中的应用。首先，HTML（H…

程序猿
2025年12月24日
1000
好文分享

网页开发中常见的Web标准语言有哪些？

探索Web标准语言的世界：网页开发中常用的语言有哪些？在现代社会中，互联网的普及程度越来越高，网页已成为人们获取资讯、娱乐、交流的重要途径。而网页的开发离不开各种编程语言的应用和支持。在这个虚拟世界的网络，有许多被广泛应用的标准化语言，用于为用户提供优质的网页体验。本文将探索网页开发中常用的语言，…

程序猿
2025年12月24日
1000
好文分享

深入探究Web标准语言的范围，涵盖了哪些语言？

Web标准是指互联网上的各个网页所需遵循的一系列规范，确保网页在不同的浏览器和设备上能够正确地显示和运行。这些标准包括HTML、CSS和JavaScript等语言。本文将深入解析Web标准涵盖的语言范围。首先，HTML（HyperText Markup Language）是构建网页的基础语言。它使…

程序猿
2025年12月24日
1000
好文分享

CSS 超链接属性解析：text-decoration 和 color

CSS 超链接属性解析：text-decoration 和 color 超链接是网页中常用的元素之一，它能够在不同页面之间建立连接。为了使超链接在页面中有明显的标识和吸引力，CSS 提供了一些属性来调整超链接的样式。本文将重点介绍 text-decoration 和 color 这两个与超链接相关的…

程序猿
2025年12月24日
1000
好文分享

详解Css Flex 弹性布局中的常见问题及解决方案

详解CSS Flex弹性布局中的常见问题及解决方案引言：CSS Flex弹性布局是一种现代的布局方式，其具有优雅简洁的语法和强大的灵活性，广泛应用于构建响应式的web页面。然而，在实际应用中，经常会遇到一些常见的问题，如元素排列不如预期、尺寸不一致等。本文将详细介绍这些问题，并提供相应的解决方案，…

程序猿
2025年12月24日
2000
看看这些前端面试题，带你搞定高频知识点（一）

每天10道题，100天后，搞定所有前端面试的高频知识点，加油！！！，在看文章的同时，希望不要直接看答案，先思考一下自己会不会，如果会，自己的答案是什么？想过之后再与答案比对，是不是会更好一点，当然如果你有比我更好的答案，欢迎评论区留言，一起探讨技术之美。面试官：给定一个元素，如何实现水平垂直居中？…

程序猿
2025年12月24日 • 好文分享
5000
看看这些前端面试题，带你搞定高频知识点（二）

每天10道题，100天后，搞定所有前端面试的高频知识点，加油！！！，在看文章的同时，希望不要直接看答案，先思考一下自己会不会，如果会，自己的答案是什么？想过之后再与答案比对，是不是会更好一点，当然如果你有比我更好的答案，欢迎评论区留言，一起探讨技术之美。面试官：页面导入样式时，使用 link 和 …

程序猿
2025年12月24日 • 好文分享
3000
看看这些前端面试题，带你搞定高频知识点（三）

每天10道题，100天后，搞定所有前端面试的高频知识点，加油！！！，在看文章的同时，希望不要直接看答案，先思考一下自己会不会，如果会，自己的答案是什么？想过之后再与答案比对，是不是会更好一点，当然如果你有比我更好的答案，欢迎评论区留言，一起探讨技术之美。面试官：清除浮动有哪些方式？我：呃~，浮动…

程序猿
2025年12月24日 • 好文分享
1000
看看这些前端面试题，带你搞定高频知识点（四）

每天10道题，100天后，搞定所有前端面试的高频知识点，加油！！！，在看文章的同时，希望不要直接看答案，先思考一下自己会不会，如果会，自己的答案是什么？想过之后再与答案比对，是不是会更好一点，当然如果你有比我更好的答案，欢迎评论区留言，一起探讨技术之美。面试官：请你谈一下自适应(适配)的方案我：…

程序猿
2025年12月24日 • 好文分享
0000
看看这些前端面试题，带你搞定高频知识点（五）

每天10道题，100天后，搞定所有前端面试的高频知识点，加油！！！，在看文章的同时，希望不要直接看答案，先思考一下自己会不会，如果会，自己的答案是什么？想过之后再与答案比对，是不是会更好一点，当然如果你有比我更好的答案，欢迎评论区留言，一起探讨技术之美。面试官：css 如何实现左侧固定 300px…

程序猿
2025年12月24日 • 好文分享
1000
HTML+CSS+JS实现雪花飘扬（代码分享）

使用html+css+js如何实现下雪特效？下面本篇文章给大家分享一个html+css+js实现雪花飘扬的示例，希望对大家有所帮助。很多南方的小伙伴可能没怎么见过或者从来没见过下雪，今天我给大家带来一个小Demo，模拟了下雪场景，首先让我们看一下运行效果可以点击看看在线运行：http://hai…

程序猿
2025年12月24日 • 好文分享
6000
分享20个首页流行布局样式，总有一款适合你！

本篇文章给大家分享20个首页流行布局样式，总有一款适合你，快来收藏试试吧，希望对大家有所帮助！有时我们会在网站上遇到一些内容布局问题，如文字对齐、图片设计与内容和谐、为文章选择合适的字体……在今天的文章中，介绍一些设计精美的创意布局，let‘s 开始。代号 001 源码…

程序猿
2025年12月24日 • 好文分享
0000
css如何让div悬浮于另一个div上

让div悬浮于另一个div上的方法：1、给两个div元素添加“position:absolute”绝对定位样式；2、给其中一个div元素添加“{top:距离页面顶部距离;left:距离页面左侧距离;}”样式使其浮动在另一个div元素上即可。本教程操作环境：windows7系统、CSS3&&…

程序猿
2025年12月24日 • 好文分享
0000
好文分享

css怎样实现字母不到一行就换行

css字母不到一行就换行的方法：1、给元素添加“word-break:break-word;”样式，使其以单词为单位换行；2、给元素添加“word-break:break-all;”样式，使其以字母为单位换行。本教程操作环境：windows7系统、CSS3&&HTML5版、Dell…

程序猿
2025年12月24日
0000