Puppeteer中.$eval()与.$$eval()的正确使用指南

puppeteer中.$eval()与.$$eval()的正确使用指南

本文深入探讨Puppeteer中`.$eval()`和`.$$eval()`这两种核心元素评估方法的区别与正确用法。我们将阐明它们在处理单个元素与多个元素时的行为差异,重点讲解`.$$eval()`回调函数接收数组参数时的处理策略,并通过实例代码演示如何有效利用这些方法进行网页数据抓取与自动化交互,包括模拟打字测试,并提供相关的最佳实践和注意事项。

理解.$eval()与.$$eval()的核心区别

在Puppeteer中,.$eval()和.$$eval()是用于在浏览器上下文中执行JavaScript代码的关键方法,它们允许我们对页面上的DOM元素进行评估和操作。尽管名称相似,但它们在处理目标元素数量和回调函数参数方面存在显著差异。

.$eval(selector, pageFunction, …args):这个方法用于选取第一个匹配selector的元素,并将其作为参数传递给pageFunction回调函数。如果找不到匹配的元素,则会抛出错误。它适用于只需要处理单个元素或第一个匹配元素的情况。

.$$eval(selector, pageFunction, …args):与.$eval()不同,.$$eval()会选取所有匹配selector的元素,并将这些元素的数组作为参数传递给pageFunction回调函数。如果找不到任何匹配元素,pageFunction将收到一个空数组。它适用于需要批量处理多个元素的情况。

关键差异点在于回调函数的参数类型:

.$eval()的回调函数接收的是单个DOM元素。.$$eval()的回调函数接收的是一个DOM元素数组

.$eval() 的基本用法

当我们需要从页面中提取特定元素的单个属性或执行单个操作时,.$eval()是理想选择。

示例:获取页面上第一个div元素的innerHTML。

const puppeteer = require("puppeteer");(async () => {  const browser = await puppeteer.launch();  const page = await browser.newPage();  await page.goto("https://example.com");  // 等待 #words 元素出现  const wordsSelector = await page.waitForSelector('#words');  // 使用 .$eval 获取 #words 内部第一个 div 的 innerHTML  const firstDivContent = await wordsSelector.$eval('div', element => element.innerHTML);  console.log("第一个 div 的内容:", firstDivContent);  await browser.close();})();

在这个例子中,wordsSelector.$eval(‘div’, …)会找到#words元素内部的第一个div,并将该div元素作为element参数传递给回调函数。

.$$eval() 的正确用法与常见误区

初学者在使用.$$eval()时常犯的错误是,期望回调函数中的参数可以直接访问innerHTML或textContent,就像处理单个元素一样。然而,由于.$$eval()的回调函数接收的是一个元素数组,直接访问elements.innerHTML会导致undefined,因为数组本身没有innerHTML属性。

正确做法是遍历或映射这个元素数组,对每个元素进行操作。

示例:获取#words内部所有.word元素的innerHTML。

const puppeteer = require("puppeteer");(async () => {  const browser = await puppeteer.launch({ headless: true });  const page = await browser.newPage();  await page.goto("https://monkeytype.com/", { waitUntil: "domcontentloaded" });  // 假设页面上有cookie同意弹窗,先点击拒绝  try {    const rejectAllButton = await page.waitForSelector(".rejectAll", { timeout: 5000 });    if (rejectAllButton) {      await rejectAllButton.click();    }  } catch (error) {    console.log("未找到cookie拒绝按钮或已处理。");  }  // 等待 #words 元素出现  const wordsEl = await page.waitForSelector('#words');  // 使用 .$$eval 获取 #words 内部所有 .word 元素的 innerHTML  // 注意:回调函数接收的是一个元素数组,需要使用 map 进行处理  const allWordsContent = await wordsEl.$$eval('.word', elements =>    elements.map(el => el.innerHTML)  );  console.log("所有单词的 HTML 内容:", allWordsContent);  await browser.close();})();

在这个修正后的例子中,elements是一个DOM元素数组。我们使用map方法遍历这个数组,对每个el(即每个.word元素)提取其innerHTML,最终得到一个包含所有单词HTML内容的数组。

选择innerHTML还是textContent?

在提取网页内容时,innerHTML和textContent是两个常用的属性,但它们的应用场景不同:

innerHTML: 返回元素的完整HTML内容,包括其子元素的标签和文本。如果你需要分析或保留元素的结构信息,innerHTML会很有用。textContent: 返回元素的纯文本内容,不包含任何HTML标签。它会递归地获取所有子节点的文本内容,并连接起来。对于大多数数据抓取任务,尤其是需要获取用户可见文本时,textContent通常是更简洁和合适的选择。

建议: 如果你的目标是获取纯文本数据(例如,单词、段落),优先使用textContent。这可以避免处理不必要的HTML标签,使数据更干净。

进阶应用:模拟用户交互与自动化

.$eval()和.$$eval()结合Puppeteer的其他API,可以实现复杂的网页自动化任务。以下是一个模拟打字测试的完整示例,展示了如何获取当前活动单词并模拟键盘输入。

const puppeteer = require("puppeteer");(async () => {  let browser;  try {    browser = await puppeteer.launch({ headless: true }); // 设置 headless: false 可见浏览器操作    const [page] = await browser.pages();    // 启用请求拦截,提高性能和稳定性,只允许必要的资源加载    await page.setRequestInterception(true);    page.on('request', request => {      const allowedUrls = [        "https://monkeytype.com",        "https://www.monkeytype.com",        "https://api.monkeytype.com",        "https://fonts.google.com", // 允许加载字体      ];      if (allowedUrls.some(url => request.url().startsWith(url))) {        request.continue();      } else {        request.abort(); // 阻止不必要的请求      }    });    await page.goto("https://monkeytype.com/", { waitUntil: "domcontentloaded" });    // 处理Cookie同意弹窗    try {      const rejectAllButton = await page.waitForSelector(".rejectAll", { timeout: 5000 });      if (rejectAllButton) {        await rejectAllButton.click();        console.log("已点击拒绝所有Cookie。");      }    } catch (error) {      console.log("未找到Cookie拒绝按钮或已处理,继续执行。");    }    // 等待第一个活动单词出现    await page.waitForSelector("#words .word.active");    const wordsContainer = await page.$("#words"); // 获取单词容器元素    // 循环模拟打字过程    console.log("开始模拟打字...");    for (let i = 0; i           el.textContent.trim() // 使用 textContent 获取纯文本并去除首尾空格        );        console.log(`正在输入: "${activeWordText}"`);        // 模拟键盘输入单词,并在每个单词后输入一个空格        await wordsContainer.type(activeWordText + " ");      } catch (e) {        // 如果找不到 .word.active 元素,说明打字可能已结束或出现异常        console.log("未找到活动单词,可能已完成打字或发生错误。", e.message);        break; // 退出循环      }      // 可以在此处添加短暂延迟,模拟更真实的用户输入速度      // await page.waitForTimeout(50);    }    // 滚动到结果区域并截图    const resultsElement = await page.$("#result");    if (resultsElement) {      await resultsElement.evaluate(el => el.scrollIntoView()); // 滚动到结果视图      await resultsElement.screenshot({ path: "typing-results.png" });      console.log("打字结果已保存到 typing-results.png");    } else {      console.log("未找到结果区域。");    }  } catch (error) {    console.error("自动化过程中发生错误:", error);  } finally {    if (browser) {      await browser.close();      console.log("浏览器已关闭。");    }  }})();

注意事项与最佳实践

错误处理: 在实际项目中,务必使用try…catch…finally块来捕获可能发生的错误,并确保浏览器在任何情况下都能正确关闭。等待元素: 使用page.waitForSelector()或element.waitForSelector()是至关重要的。这可以确保在尝试操作元素之前,它们已经加载并呈现在DOM中,避免因元素未加载而导致的脚本失败。请求拦截: page.setRequestInterception(true)并结合page.on(‘request’, …)可以有效控制页面加载的资源,提高自动化脚本的执行效率和稳定性,尤其是在处理资源密集型网站时。纯文本提取: 优先使用textContent而不是innerHTML来获取元素的纯文本内容,除非你确实需要保留HTML结构。循环限制: 在进行循环操作(如模拟打字)时,最好设置一个最大循环次数,以防止因页面状态异常而导致无限循环。上下文: .$eval()和.$$eval()的回调函数是在浏览器页面的上下文中执行的,因此它们无法直接访问Node.js环境中的变量或函数。所有需要的数据都必须通过…args参数传递。

总结

.$eval()和.$$eval()是Puppeteer中强大且灵活的DOM元素评估工具。理解它们之间关于目标元素数量和回调函数参数的根本区别,是编写高效、健壮的Puppeteer脚本的关键。通过结合使用这些方法与其他Puppeteer API,开发者可以实现从简单的数据抓取到复杂的网页自动化交互的各种任务。遵循最佳实践,如错误处理、元素等待和请求拦截,将大大提高自动化脚本的稳定性和可靠性。

以上就是Puppeteer中.$eval()与.$$eval()的正确使用指南的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1602098.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
构建支持富文本的输入框:基于Markdown的实时预览实现指南
上一篇 2025年12月23日 16:03:45
studio怎么运行html文件路径_studio运行html文件路径法【教程】
下一篇 2025年12月23日 16:04:02

相关推荐

  • 谷歌浏览器官网直接进入 Chrome浏览器官方登录入口

    谷歌浏览器官网直接进入方式为访问https://www.google.com/chrome/,该网站是Chrome官方登录入口,提供跨平台同步、V8引擎加速、地址栏集成搜索、自动填充表单等核心功能,支持极简界面、深色模式、自定义新标签页及侧边栏服务,具备安全浏览、隐私沙盒、密码检查和无痕模式等安全机…

    2026年9月22日
    100
  • Laravel 8 注册成功但登录失败的解决方案

    本文针对 Laravel 8 中使用 php artisan ui:auth 生成的认证系统,注册功能正常但登录功能失效的问题,提供了一种解决方案。通过重写 LoginController 中的 username() 方法,将认证字段从默认的 email 修改为 username,从而解决登录失败的…

    2026年9月22日
    000
  • rm -rf 误删文件?别急,或许有救!

    rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!

    立即采取行动! 在生产环境中,我们应尽量避免进行风险操作。但如果不慎犯错,如何挽救呢?让我分享一个故事:上周我为了打包一个应用,需要整理Ubuntu 16.04上的线上数据,不小心删除了一个数据文件,幸而最终有惊无险,现记录如下。 extundelete 我的恢复计划主要依赖于一个工具——extun…

    2026年9月22日 用户投稿
    000
  • UC浏览器占用内存太高怎么办_UC浏览器内存占用高优化方案

    UC浏览器内存占用过高可通过清理缓存、关闭多余标签页、禁用插件和开启省电模式解决。首先清除浏览数据释放资源,其次减少同时开启的标签页数量以降低内存压力,接着管理扩展程序避免后台消耗,最后启用性能优化功能减少资源使用,提升整体运行效率。 如果您在使用UC浏览器时发现设备运行缓慢或应用响应迟缓,这很可能…

    2026年9月22日
    100
  • iPhone如何打开url

    轻触链接即刻访问 当您在信息、邮件或其它应用程序中遇到一个网址链接时,只需轻轻点击该链接,iPhone便会自动启动Safari浏览器并加载对应的网页内容。这是最为普遍且高效的访问方式。 借助快捷指令快速进入 若您频繁访问某个特定网址,可使用“快捷指令”功能实现一键直达。先从App Store下载“快…

    2026年9月22日
    000
  • unix怎么安装php_unix系统安装php环境指南

    首先确认系统环境并检查是否已安装相关软件,然后选择包管理器或源码编译方式安装PHP;推荐使用包管理器快速安装,如Debian/Ubuntu用apt,CentOS/RHEL/Fedora用yum或dnf,FreeBSD用pkg;安装后配置Web服务器,Apache需加载mod_php或集成PHP-FP…

    2026年9月22日
    300
  • itextpdf freemarker渲染

    关于打印pdf操作的需求,经过研究,发现以下两种方法: 在现有的模板上进行编辑,这种方法操作难度较大。而通过FreeMarker生成静态页面,然后转换为HTML,操作更为顺畅。动态生成PDF的方法在网上参考较多,经过对比,我认为使用FreeMarker结合IText生成PDF最为简单。参考链接为ht…

    2026年9月22日
    300
  • Java多线程并发控制:告别线程优先级,拥抱锁机制

    本文深入探讨了在Java多线程环境中如何有效解决并发操作中断问题,特别是当多个线程尝试同时执行非原子性操作(如打印)时。文章指出,单纯依赖线程优先级并不可靠,并详细介绍了使用synchronized关键字配合共享锁对象实现互斥访问的关键技术,确保关键代码块的原子性执行,从而避免数据混乱和逻辑错误。 …

    2026年9月22日
    700
  • 设计VSCode三维图形编程界面与WebGL实时预览模块

    VSCode通过集成WebGL预览插件实现三维图形编程的实时反馈,利用扩展架构提供GLSL语法支持、文件关联及命令注册,并通过Webview嵌入渲染窗口,结合消息通信与动态编译技术实现实时预览,配合保存自动刷新、错误定位与多视图布局优化交互体验,构建高效闭环开发环境。 在使用 VSCode 进行三维…

    2026年9月22日
    100
  • 谷歌浏览器PDF文件注释功能无法使用怎么办

    谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办谷歌浏览器PDF文件注释功能无法使用怎么办

    首先检查PDF权限,若文件设有限制需用专业工具解除;2. 确认非PDF/A格式,必要时转换为普通PDF;3. 推荐使用UPDF等专业软件实现完整注释功能;4. 清除浏览器缓存或重置Chrome设置以排除临时故障。 谷歌浏览器自带的PDF阅读器功能虽然方便,但有时会遇到无法使用注释功能的问题。这通常与…

    2026年9月22日 用户投稿
    300
  • Apache Pulsar 主题分区创建与管理指南

    本文深入探讨Apache Pulsar主题分区的创建与管理。Pulsar主题分区是实现高吞吐量和可伸缩性的关键,但必须在主题创建时进行配置。文章详细介绍了两种主要的分区主题创建方法:通过Broker配置实现自动分区,以及利用Pulsar Admin API进行显式创建,并强调了分区主题一旦创建后不可…

    2026年9月22日
    100
  • 使用 Spring Boot Test @Sql 注解通过掩码描述文件的方法

    在 Spring Boot 测试中,我们经常使用 @Sql 注解来执行 SQL 脚本,以便在测试前准备数据或在测试后清理数据。 通常的用法如下: @Sql(scripts = “/folder/my_favourite_script.sql”)@Testpublic void myTest() { …

    2026年9月22日
    100
  • 密码管理器是如何安全地存储和填充大量复杂密码的,其工作原理是什么?

    密码管理器通过主密码生成加密密钥,在设备端使用AES-256等算法加密数据,结合PBKDF2或Argon2密钥派生函数增强安全性;加密后数据经HTTPS同步至云端,服务商无法访问明文,实现零知识存储;登录时浏览器插件匹配URL与表单,用户确认后在内存中解密并填充凭证,不暴露数据库或明文;支持生成唯一…

    2026年9月22日
    000
  • 笔记—Linux安装OpenCV及VSCode的配置编译

    笔记—Linux安装OpenCV及VSCode的配置编译笔记—Linux安装OpenCV及VSCode的配置编译笔记—Linux安装OpenCV及VSCode的配置编译笔记—Linux安装OpenCV及VSCode的配置编译

    在学习新技能的过程中,我选择了在linux系统上进行操作,这对于从未接触过linux的人来说是一个绝佳的学习机会。这篇文章记录了我在linux上安装opencv的过程。 我选择的Linux发行版是Ubuntu 20.04.3,并将其安装在Virtual Box虚拟机中。Ubuntu的相关资料丰富,选…

    2026年9月22日 用户投稿
    100
  • PHP如何执行存储过程_PHP调用mysql存储过程的详细步骤

    PHP调用MySQL存储过程主要通过PDO实现,需先启用PDO扩展并建立数据库连接。1. 使用new PDO()连接MySQL;2. 调用无参存储过程如CALL get_users(),执行后获取结果集;3. 对带输入参数的存储过程使用bindParam绑定参数;4. 处理OUT参数时通过用户变量(…

    2026年9月22日
    000
  • laravel Spatie/laravel-medialibrary包高级用法_Laravel Spatie Medialibrary高级功能使用方法

    Spatie/laravel-medialibrary 支持自定义磁盘路径、响应式图像、WebP格式、媒体集合分类、自定义属性存储及签名URL安全访问,并可通过队列异步处理文件转换,提升性能与安全性。 在 Laravel 应用中,Spatie/laravel-medialibrary 是处理文件上传…

    2026年9月22日
    1300
  • 机械革命Z系列电脑开机要按F1因BIOS中硬盘参数异常重新设置参数解决

    开机需按F1通常因BIOS设置异常,如硬盘参数错误、软驱启用或CMOS电池没电。进入BIOS检查SATA设备列表,将未连接的设备设为“None”,并关闭软驱选项;若设置混乱,可恢复默认配置(Load Optimized Defaults)并保存退出;若问题仍存,建议更换CMOS电池或检查硬件连接。 …

    2026年9月22日
    200
  • 米侠浏览器网页字体乱码怎么办 米侠浏览器字体显示异常修复方法

    字体乱码通常因编码错误、缓存问题或字体缺失引起。2. 首先尝试在米侠浏览器中切换网页编码为UTF-8、GBK或GB2312。3. 清除缓存、Cookie和网站数据可解决加载异常。4. 确保设备安装了常用中文字体如思源黑体或微软雅黑。5. 更新或重装最新版米侠浏览器以排除兼容性问题。6. 若仍无效,可…

    2026年9月22日
    100
  • Spring Boot集成MongoDB Atlas:正确配置与故障排除

    本教程详细指导如何在Spring Boot应用中正确配置与连接MongoDB Atlas集群。我们将重点讲解如何获取并使用正确的Atlas连接URI,安全地处理用户认证信息,以及准确指定目标数据库。通过实例代码和常见错误排查,帮助开发者避免连接失败,确保应用与MongoDB Atlas的顺畅集成。 …

    2026年9月22日
    600
  • VSCode配置TypeScript环境(详细步骤,强类型开发指南)

    配置VSCode的TypeScript环境需先安装TypeScript编译器(npm install -g typescript),再通过tsc –init生成tsconfig.json配置文件并设置编译选项,如target、module、outDir等;接着在VSCode中创建task…

    2026年9月22日
    800

发表回复

登录后才能评论
关注微信