XPath的contains()方法怎么用?有哪些应用场景?

“淘宝第一个程序员”蔡景现(花名多隆)已从阿里巴巴离职,结束25年任职生涯。作为淘宝初创核心工程师,他构建了淘宝交易系统,以技术实力闻名,曾以26亿身家登上胡润富豪榜,其阿里内外状态已显示为“退隐江湖”。

xpath的contains()方法怎么用?有哪些应用场景?

XPath的

contains()

方法,简单来说,就是用来判断一个字符串是否包含另一个特定的子字符串。它在处理那些内容不完全固定、但部分特征可识别的网页元素时,简直是神器。比如,你想找一个按钮,它的类名总是变,但里面肯定包含“submit”这个词,或者一个文本段落,它总是有“订单号”这几个字,但后面的数字每次都不同,这时候

contains()

就能派上大用场。

解决方案

contains()

方法的语法非常直观:

contains(string, substring)

。第一个参数是你想要检查的字符串(比如元素的文本内容或某个属性的值),第二个参数是你想要查找的子字符串。

举几个实际例子:

查找文本中包含特定内容的元素:假设你想找到所有包含“最新消息”这几个字的

div

元素。

//div[contains(text(), '最新消息')]

这里,

text()

函数获取元素的文本内容,然后

contains()

判断其是否包含“最新消息”。

查找属性值中包含特定内容的元素:如果有一个链接,它的

href

属性值总是包含“product”这个词,但后面可能跟着不同的ID。

//a[contains(@href, 'product')]
@href

表示获取

href

属性的值。

处理动态类名:很多前端框架会生成动态的CSS类名,比如

btn-primary-dsf23k

,但核心部分

btn-primary

是不变的。

//button[contains(@class, 'btn-primary')]

这比用

@class='btn-primary-dsf23k'

这种完全匹配要灵活得多。

结合其他条件使用:你也可以将

contains()

与其他XPath表达式结合起来,进行更精确的定位。

//div[contains(@id, 'item') and contains(text(), '详情')]

这会找到所有

id

包含“item”且文本内容包含“详情”的

div

元素。

XPath

contains()

starts-with()

ends-with()

有什么区别

说实话,XPath这东西,用好了就是利器,但刚上手时,

contains()

starts-with()

ends-with()

这几个哥们儿确实容易让人混淆。它们都是字符串匹配,但侧重点完全不一样。

starts-with(string, substring)

:顾名思义,它只检查一个字符串是否指定的子字符串开头。比如,你有一堆ID是

user_1

user_2

admin_1

的元素,你想找所有用户相关的元素,用

starts-with(@id, 'user')

就非常精准。它不会匹配到

super_user_1

这种ID。

ends-with(string, substring)

:这个方法在XPath 2.0及更高版本中才支持,它检查一个字符串是否指定的子字符串结尾。如果你想找所有以

.png

结尾的图片链接,

//img[ends-with(@src, '.png')]

就很方便。在一些老旧的系统或者XPath 1.0的环境里,你可能得想别的办法,比如用

substring()

string-length()

组合来模拟。

contains(string, substring)

:而

contains()

就宽松多了,它不关心子字符串在原字符串的开头、结尾还是中间,只要有,它就认为匹配。这就像是“模糊匹配”的王者。比如,一个元素的类名可能是

active-item

,也可能是

item-active

,或者

main-item-active-status

,只要里面有

item

,你用

contains(@class, 'item')

都能抓到。

什么时候用哪个?

当你明确知道目标字符串的前缀时,用

starts-with()

。当你明确知道目标字符串的后缀时(且环境支持),用

ends-with()

。当目标子字符串可能出现在任何位置,或者你只想进行一个宽泛的包含匹配时,

contains()

是你的首选。

contains()

方法在处理动态类名或文本时有哪些实战技巧?

很多时候,我们抓取网页或者自动化测试时,会遇到一些让人头疼的动态元素。它们的ID、类名或者文本内容,可能每次加载都变一部分。这时候,

contains()

的灵活就体现出来了。

动态类名处理的“万金油”:设想一下,一个按钮,今天它的类名是

btn-primary-randomhash123

,明天可能变成

btn-primary-anotherhash456

。你不可能每次都去 inspect 元素拿到完整的类名。但核心的

btn-primary

通常是固定的。

//button[contains(@class, 'btn-primary')]

这招屡试不爽,能大幅提升你的XPath表达式的健壮性。甚至有些元素可能有多个类名,比如

,如果你只想找到所有“活跃”的项,而不管它是不是“选中”的,

//div[contains(@class, 'active')]

就能精准命中。

处理部分变化的文本内容:网页上经常有这种文本:“您的订单号是:ABC123456789”,或者“当前库存:150件”。其中“ABC123456789”和“150”是动态变化的。

//p[contains(text(), '您的订单号是:')]
//span[contains(text(), '当前库存:') and contains(text(), '件')]

(这里用两个

contains

来确保匹配的精确性,避免只匹配到“当前库存”或“件”的意外情况)这样,即使订单号或库存量变了,你的XPath依然能准确找到目标元素。

应对大小写不敏感的需求(XPath 1.0 局限):

contains()

是大小写敏感的。这意味着

contains(text(), 'hello')

不会匹配到“Hello”。在XPath 1.0中,要实现大小写不敏感,你需要借助

translate()

函数,将字符串中的大写字母转换为小写,然后再进行

contains()

判断。

//div[contains(translate(text(), 'ABCDEFGHIJKLMNOPQRSTUVWXYZ', 'abcdefghijklmnopqrstuvwxyz'), 'hello')]

这看起来有点长,但确实是XPath 1.0里比较通用的做法。如果你的环境支持XPath 2.0,那就可以用

lower-case()

函数,会简洁很多:

//div[contains(lower-case(text()), 'hello')]

。了解这些,能让你在遇到实际问题时,知道如何变通。

使用

contains()

时可能遇到哪些常见问题和性能考量?

contains()

虽然好用,但用起来也有些小坑和需要注意的地方。

大小写敏感性陷阱:这是最常见的“坑”之一。很多人以为

contains()

会智能地忽略大小写,结果发现怎么也匹配不上。比如

contains(@class, 'active')

不会匹配到

Active

。遇到这种情况,要么老老实实写精确的大小写,要么就得用上面提到的

translate()

或者

lower-case()

来处理。

过度匹配的风险:

contains()

的“模糊”特性,有时也会带来过度匹配的问题。如果你想找一个

class

item-list

的元素,却写了

//div[contains(@class, 'item')]

,那么可能

item-detail

sub-item

等所有包含“item”的元素都会被匹配到,这显然不是你想要的。解决办法是:尽可能结合其他更精确的定位方式来缩小范围,比如先用ID或更具体的父级路径,再使用

contains()

。例如,

//div[@id='main-content']//li[contains(@class, 'product-item')]

就比

//li[contains(@class, 'product-item')]

更精准,因为它限定了只在

id

main-content

div

内部查找。

性能考量(虽然通常不是大问题):对于现代浏览器和XPath引擎来说,

contains()

的性能通常不是瓶颈,但在极端情况下,比如处理非常庞大、复杂的XML文档,或者在循环中大量使用

contains()

,还是值得注意一下。相比于直接的属性匹配(如

@id='someId'

)或

starts-with()

contains()

需要遍历整个字符串来查找子串,理论上会稍微慢一点点。不过,这种差异在大多数网页抓取或自动化场景中几乎可以忽略不计。真正的性能杀手往往是那些过于宽泛的XPath,比如

//*[contains(text(), '某个词')]

。这种表达式会扫描整个文档树,效率会比较低。所以,尽量从一个更具体的父节点开始,缩小搜索范围,总是一个好习惯。

总的来说,

contains()

是一个非常实用的工具,掌握它的用法和特性,能让你在处理动态网页内容时更加游刃有余。

以上就是XPath的contains()方法怎么用?有哪些应用场景?的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1430273.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
XPath的following-sibling轴如何选择同级?
上一篇 2025年12月17日 03:29:22
XPath的union运算符和|有什么区别?
下一篇 2025年12月17日 03:29:34

相关推荐

  • composer require-dev和require有什么不同_Composer Require与Require-Dev区别解析

    require用于声明项目运行必需的依赖,如框架、数据库组件和第三方SDK,这些包会随项目部署到生产环境;2. require-dev用于声明仅在开发和测试阶段需要的工具,如PHPUnit、PHPStan、Faker等,不会默认部署到生产环境;3. 安装时composer install根据环境决定…

    2026年5月10日
    1000
  • 修复Django电商项目中AJAX过滤产品列表图片不显示问题

    在Django电商项目中,当使用AJAX动态加载过滤后的产品列表时,常遇到图片无法正常显示的问题。这通常是由于前端模板中图片加载方式(如data-setbg属性结合JavaScript库)与AJAX动态内容更新机制不兼容所致。解决方案是直接在AJAX返回的HTML中使用标准的标签来渲染图片,确保浏览…

    2026年5月10日
    000
  • Golang JSON序列化:控制敏感字段暴露的最佳实践

    本教程探讨golang中如何高效控制结构体字段在json序列化时的可见性。当需要将包含敏感信息的结构体数组转换为json响应时,通过利用`encoding/json`包提供的结构体标签,特别是`json:”-“`,可以轻松实现对特定字段的忽略,从而避免敏感数据泄露,确保api…

    2026年5月10日
    000
  • 利用海象运算符简化条件赋值:Python教程与最佳实践

    本文旨在探讨Python中海象运算符(:=)在条件赋值场景下的应用。通过对比传统if/else语句与海象运算符,以及条件表达式,分析海象运算符在简化代码、提高可读性方面的优势与局限性。并通过具体示例,展示如何在列表推导式等场景下合理使用海象运算符,同时强调其潜在的复杂性及替代方案,帮助开发者更好地掌…

    2026年5月10日
    100
  • Debian syslog性能优化技巧有哪些

    提升Debian系统syslog (通常基于rsyslog)性能,关键在于精简配置和高效处理日志。以下策略能有效优化日志管理,提升系统整体性能: 精简配置,高效加载: 在rsyslog配置文件中,仅加载必要的输入、输出和解析模块。 使用全局指令设置日志级别和格式,避免不必要的处理。 自定义模板: 创…

    2026年5月10日
    000
  • 比特币新手教程 比特币交易平台有哪些

    比特币是一种去中心化的数字货币,基于区块链技术实现点对点交易,具有匿名性、有限发行和不可篡改等特点;新手可通过交易所购买,P2P交易获得比特币,常用平台包括Binance、OKX和Huobi;交易流程包括注册账户、实名认证、绑定支付方式、充值法币并下单购买,可选择市价单或限价单;比特币存储方式有交易…

    2026年5月10日
    000
  • c++中的SFINAE技术是什么_c++模板编程中的SFINAE原理与应用

    SFINAE 是“替换失败不是错误”的原则,指模板实例化时若参数替换导致错误,只要存在其他合法候选,编译器不报错而是继续重载决议。它用于条件启用模板、类型检测等场景,如通过 decltype 或 enable_if 控制函数重载,实现类型特征判断。尽管 C++20 引入 Concepts 简化了部分…

    2026年5月10日
    000
  • Go语言mgo查询构建:深入理解bson.M与日期范围查询的正确实践

    本文旨在解决go语言mgo库中构建复杂查询时,特别是涉及嵌套`bson.m`和日期范围筛选的常见错误。我们将深入剖析`bson.m`的类型特性,解释为何直接索引`interface{}`会导致“invalid operation”错误,并提供一种推荐的、结构清晰的代码重构方案,以确保查询条件能够正确…

    2026年5月10日
    100
  • vscode上怎么运行html_vscode上运行html步骤【指南】

    首先保存文件为.html格式,再通过浏览器或Live Server插件打开预览;推荐安装Live Server实现本地服务器运行与实时刷新,提升开发体验。 在 VS Code 上运行 HTML 文件并不需要复杂的配置,只需几个简单步骤即可预览页面效果。VS Code 本身是一个代码编辑器,不直接运行…

    2026年5月10日
    100
  • css max-height属性怎么用

    max-height 属性设置元素的最大高度。 说明 该属性值会对元素的高度设置一个最高限制。因此,元素可以比指定值矮,但不能比其高。不允许指定负值。 注意:max-height 属性不包括外边距、边框和内边距。 立即学习“前端免费学习笔记(深入)”; 值描述none 默认。定义对元素被允许的最大高…

    2026年5月10日
    100
  • 修复点击时按钮抖动:CSS垂直对齐实践

    本文探讨了在Web开发中,交互式按钮(如播放/暂停按钮)在点击时发生意外垂直位移的问题。通过分析CSS样式变化对元素布局的影响,我们发现这是由于按钮不同状态下的边框样式和内边距改变,以及默认的垂直对齐行为共同作用所致。核心解决方案是利用CSS的vertical-align属性,将其设置为middle…

    2026年5月10日
    100
  • Golang goroutine与channel调试技巧

    使用go run -race检测数据竞争,结合runtime.NumGoroutine监控协程数量,通过pprof分析阻塞调用栈,利用select超时避免永久阻塞,有效排查goroutine泄漏、死锁和数据竞争问题。 Go语言的goroutine和channel是并发编程的核心,但它们也带来了调试上…

    2026年5月10日
    000
  • 《魔兽世界》将于6月11日开启国服回归技术测试

    《魔兽世界》将于6月11日开启国服回归技术测试《魔兽世界》将于6月11日开启国服回归技术测试《魔兽世界》将于6月11日开启国服回归技术测试《魔兽世界》将于6月11日开启国服回归技术测试

    《%ign%ignore_a_1%re_a_1%》官方宣布,将于6月11日开启国服回归技术测试,时间为7天,并称可以在6月内正式开服,玩家们可以访问官网下载战网客户端并预下载“巫妖王之怒”客户端,技术测试详情见下图。 WordAi WordAI是一个AI驱动的内容重写平台 53 查看详情 以上就是《…

    2026年5月10日 用户投稿
    200
  • 使用 Jupyter Notebook 进行探索性数据分析

    Jupyter Notebook通过单元格实现代码与Markdown结合,支持数据导入(pandas)、清洗(fillna)、探索(matplotlib/seaborn可视化)、统计分析(describe/corr)和特征工程,便于记录与分享分析过程。 Jupyter Notebook 是进行探索性…

    2026年5月10日
    000
  • php常量怎么用_PHP常量(define/const)定义与使用方法

    PHP中可通过define函数和const关键字定义常量,用于存储不可变值。define适用于全局作用域,支持动态名称和条件定义,如define(‘SITE_NAME’, ‘MyWebsite’);const在编译时生效,语法简洁但限制多,只能在类或全…

    2026年5月10日
    000
  • 如何在HTML中插入表单元素_HTML表单控件与输入类型使用指南

    HTML表单通过标签构建,包含action和method属性定义数据提交目标与方式,常用input类型如text、password、email等适配不同输入需求,配合label、required、placeholder提升可用性,结合textarea、select、button等控件实现完整交互,是…

    2026年5月10日
    100
  • 前端缓存策略与JavaScript存储管理

    根据数据特性选择合适的存储方式并制定清晰的读写与清理逻辑,能显著提升前端性能;合理运用Cookie、localStorage、sessionStorage、IndexedDB及Cache API,结合缓存策略与定期清理机制,可在保证用户体验的同时避免安全与性能隐患。 前端缓存和JavaScript存…

    2026年5月10日
    200
  • 网站标题关键词更新后,搜索引擎为何仍显示旧标题?

    网站标题更新后,搜索引擎为何显示旧标题? 网站SEO优化中,站长常修改网站标题关键词,期望搜索结果显示自定义标题。然而,即使更新标签、meta keywords、meta description和结构化数据中的name属性后,搜索结果仍显示旧标题,这令人费解。本文将对此进行解释。 问题:站长修改了网…

    2026年5月10日
    100
  • HTML5网页如何实现手势操作 HTML5网页移动端交互的处理技巧

    首先利用原生touch事件实现滑动判断,再通过preventDefault解决滚动冲突,接着引入Hammer.js处理复杂手势,最后通过优化点击区域、避免事件冲突和增加视觉反馈提升体验。 在移动端浏览器中,HTML5网页可以通过触摸事件实现手势操作,提升用户体验。虽然原生JavaScript提供了基…

    2026年5月10日
    000
  • 创建指定大小并填充特定数据的Golang文件教程

    本文将介绍如何使用Golang创建一个指定大小的文件,并用特定数据填充它。我们将使用 `os` 包提供的函数来创建和截断文件,从而实现快速生成大文件的目的。示例代码展示了如何创建一个10MB的文件,并将其填充为全零数据。掌握这些方法,可以方便地在例如日志系统或磁盘队列等场景中,预先创建测试文件或初始…

    2026年5月10日
    000

发表回复

登录后才能评论
关注微信