解决 Puppeteer 在 Heroku 上运行中断:内存泄漏与浏览器资源管理

解决 puppeteer 在 heroku 上运行中断:内存泄漏与浏览器资源管理

本教程探讨 Puppeteer 在 Heroku 等云平台运行时,在执行少量任务后停止并抛出超时错误的问题。核心原因在于未正确关闭 Puppeteer 浏览器实例导致的内存泄漏。文章将详细解释这一现象,并提供通过在每次数据抓取后显式调用 browser.close() 来有效管理资源、防止内存耗尽的解决方案,确保 Puppeteer 脚本在生产环境中稳定运行。

问题现象:Puppeteer 在 Heroku 上的运行瓶颈

许多开发者在使用 Puppeteer 进行网页抓取或自动化时,可能会遇到一个常见且令人困惑的问题:脚本在本地开发环境中运行良好,但在部署到 Heroku 等云平台后,仅执行少量任务便会中断,并抛出 TimeoutError。

例如,一个旨在循环抓取多项数据的 Puppeteer 脚本,在本地可以顺利完成所有任务,但在 Heroku 的部署日志中,可能会在成功抓取几项数据后,出现类似以下的错误信息:

2023-05-22T17:29:18.421015+00:00 app[web.1]: == Finished grabbing CS 4752023-05-22T17:29:19.098698+00:00 app[web.1]: == Finished grabbing CS 3312023-05-22T17:29:19.783377+00:00 app[web.1]: == Finished grabbing CS 3702023-05-22T17:29:49.992190+00:00 app[web.1]: /app/node_modules/puppeteer/lib/cjs/puppeteer/common/util.js:3172023-05-22T17:29:49.992208+00:00 app[web.1]:     const timeoutError = new Errors_js_1.TimeoutError(`waiting for ${taskName} failed: timeout ${timeout}ms exceeded`);2023-05-22T17:29:49.992209+00:00 app[web.1]:                          ^2023-05-22T17:29:49.992210+00:00 app[web.1]: TimeoutError: waiting for target failed: timeout 30000ms exceeded

这个 TimeoutError,特别是 waiting for target failed,通常意味着 Puppeteer 尝试与浏览器实例建立连接或等待某个目标(如页面)时,浏览器本身已变得无响应或崩溃。这种现象往往指向资源耗尽,尤其是在 Heroku 这种具有严格内存限制的平台上。

深层原因:未关闭的浏览器实例导致的内存泄漏

Puppeteer 在执行 puppeteer.launch() 时,会启动一个全新的 Chromium 浏览器进程。这个浏览器进程及其打开的所有页面(page 对象)会占用相当可观的系统资源,包括内存和 CPU。如果在一个循环中反复调用 puppeteer.launch() 来执行独立的抓取任务,但每次任务完成后都没有显式地关闭浏览器实例,那么每个被启动的浏览器进程将持续占用资源而不会被释放。

在本地开发环境中,由于通常拥有更充足的系统资源,这种内存泄漏可能不会立即显现。然而,在 Heroku 的 Dyno 环境中,可用内存通常只有 512MB(对于免费或标准 Dyno),几个未关闭的浏览器实例就可能迅速耗尽所有可用内存。当内存耗尽时,操作系统可能会杀死进程,或者浏览器进程变得无响应,导致后续的 Puppeteer 操作超时失败。即使将 Puppeteer 运行在无头模式(headless mode),也仅仅是节省了图形界面的资源,并不能解决未关闭浏览器实例造成的内存泄漏问题。

解决方案:显式关闭 Puppeteer 浏览器

解决 Puppeteer 在云端部署时内存泄漏问题的关键在于,每次完成抓取任务后,必须显式地关闭浏览器实例。通过调用 await browser.close() 方法,可以确保所有相关的浏览器进程和资源被正确释放。

代码示例与改进

以下是原始的 scrapeData 函数及其改进版本,展示了如何正确地关闭浏览器:

原始 scrapeData 函数(存在内存泄漏风险):

async function scrapeData(code) {    const browser = await puppeteer.launch({      args: [        '--no-sandbox',        '--disable-setuid-sandbox'      ]    })    const page = await browser.newPage()    await page.goto("website url") // 替换为实际网址    await page.type('#crit-keyword', code)    await page.click('#search-button')    await page.waitForSelector(".result__headline")    await page.click(".result__headline")    await page.waitForSelector("div.text:nth-child(2)")    let data = await page.evaluate(() => {        let classTitle = document.querySelector("div.text:nth-child(2)").textContent            .toLowerCase().split(' ')            .map((s) => s.charAt(0).toUpperCase() + s.substring(1)).join(' ').replace('Ii', "II")        let classDesc =  document.querySelector(".section--description > div:nth-child(2)").textContent.replace('Lec/lab/rec.', '').trim()        return {            title: classTitle,            desc: classDesc        }    })    console.log(`== Finished grabbing ${code}`)    return data // 浏览器实例在此处未被关闭}

改进后的 scrapeData 函数(加入 browser.close() 和 try…finally):

async function scrapeData(code) {    let browser; // 将 browser 声明在 try 块外部,以便 finally 块访问    try {        browser = await puppeteer.launch({            args: [                '--no-sandbox',                '--disable-setuid-sandbox'            ]            // 默认的超时时间可能需要调整,但这里的TimeoutError主要由内存引起        });        const page = await browser.newPage();        await page.goto("your_website_url", { timeout: 30000 }); // 增加页面导航超时时间        await page.type('#crit-keyword', code);        await page.click('#search-button');        await page.waitForSelector(".result__headline", { timeout: 15000 }); // 增加等待选择器超时时间        await page.click(".result__headline");        await page.waitForSelector("div.text:nth-child(2)", { timeout: 15000 }); // 增加等待选择器超时时间        let data = await page.evaluate(() => {            let classTitle = document.querySelector("div.text:nth-child(2)").textContent                .toLowerCase().split(' ')                .map((s) => s.charAt(0).toUpperCase() + s.substring(1)).join(' ').replace('Ii', "II");            let classDesc = document.querySelector(".section--description > div:nth-child(2)").textContent.replace('Lec/lab/rec.', '').trim();            return {                title: classTitle,                desc: classDesc            };        });        console.log(`== Finished grabbing ${code}`);        return data;    } catch (error) {        console.error(`Error scraping data for ${code}:`, error);        throw error; // 重新抛出错误,以便上层调用者可以处理    } finally {        if (browser) {            await browser.close(); // 确保浏览器在任何情况下都被关闭        }    }}

通过在 scrapeData 函数的 finally 块中添加 await browser.close(),我们保证了无论数据抓取成功与否,浏览器实例及其占用的资源都会被妥善释放。这有效地解决了内存泄漏问题,使脚本能够在 Heroku 上稳定地处理所有预期的任务。

注意事项与最佳实践

资源管理是核心: 始终将 browser.close() 视为与 puppeteer.launch() 配对使用的关键操作。忘记关闭浏览器是 Puppeteer 内存泄漏最常见的原因。try…finally 块: 使用 try…catch…finally 结构是最佳实践。finally 块中的代码无论 try 块中是否发生错误都会执行,从而确保浏览器实例在任何情况下都能被关闭,避免因程序异常导致资源无法释放。Heroku Dyno 内存限制: 了解 Heroku Dyno 的资源限制至关重要。即使正确关闭了浏览器,如果单个抓取任务本身就需要大量内存,或者在短时间内并发启动了过多的浏览器实例,仍然可能遇到内存问题。对于大量任务,考虑使用队列机制或批处理,错峰执行,避免瞬间的资源高峰。超时设置: 原始日志中的 TimeoutError 也可能与网络延迟或页面加载缓慢有关。虽然内存泄漏是主要原因,但适当调整 page.goto()、page.waitForSelector() 等操作的超时时间(例如,从默认的 30 秒调整为更符合实际情况的值),可以提高脚本的鲁棒性。无头模式 (Headless Mode): 尽管无头模式能减少一些资源消耗,但它并不能替代显式关闭浏览器实例。在 Heroku 等服务器环境中,通常都应使用无头模式运行 Puppeteer。错误处理: 在 catch 块中捕获并记录错误,可以帮助调试和理解脚本失败的原因。根据应用需求,可以选择重新抛出错误、返回默认值或执行其他恢复操作。

总结

Puppeteer 在 Heroku 等云平台部署时遇到的运行中断问题,其核心往往是由于未正确关闭浏览器实例导致的内存泄漏。通过在每次抓取任务完成后,使用 await browser.close() 显式释放资源,并结合 try…finally 块确保资源在任何情况下都能被释放,可以有效解决这一问题。良好的资源管理是构建稳定、高效且可扩展的网页抓取或自动化脚本的关键。

以上就是解决 Puppeteer 在 Heroku 上运行中断:内存泄漏与浏览器资源管理的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1520277.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用 JsPDF 动态调整图片宽度并添加到 PDF 的正确方法
上一篇 2025年12月20日 13:11:02
使用 JsPDF 动态调整图片宽度并添加到 PDF 的教程
下一篇 2025年12月20日 13:11:07

相关推荐

  • NVIDIA RTX 4090是不是性能过剩了?

    RTX 4090是否性能过剩取决于用途:1. 游戏方面,在主流游戏如《守望先锋2》《赛博朋克2077》中性能明显溢出,多数玩家难以用满其能力;2. 生产力领域,凭借24GB显存和强大算力,它在AI训练、3D渲染等任务中仍具价值;3. 技术体验上,DLSS 3、Reflex等技术提供低延迟与未来兼容性…

    2026年9月26日
    1200
  • Debian OpenSSL如何进行数字签名验证

    在debian系统上使用openssl进行数字签名验证,可以按照以下步骤操作: 准备工作 安装OpenSSL:确保你的Debian系统已经安装了OpenSSL。如果没有安装,可以使用以下命令进行安装: sudo apt updatesudo apt install openssl 获取公钥:数字签名…

    2026年9月26日
    600
  • 解决Android计算器应用崩溃问题:数字输入处理优化

    解决Android计算器应用崩溃问题:数字输入处理优化解决Android计算器应用崩溃问题:数字输入处理优化解决Android计算器应用崩溃问题:数字输入处理优化解决Android计算器应用崩溃问题:数字输入处理优化

    本文将指导你如何解决Android计算器应用在数字输入时发生的崩溃问题。如摘要所述,崩溃通常是由于尝试将空字符串或null值传递给Double.parseDouble()方法引起的。以下是详细的解决方案和最佳实践。 问题分析 在Android计算器应用中,当用户点击数字按钮时,通常会将按钮上的数字追…

    2026年9月26日 • 用户投稿
    000
  • Claude是否能用于编写剧本 AI生成剧情内容的能力与使用体验

    Claude是否能用于编写剧本 AI生成剧情内容的能力与使用体验Claude是否能用于编写剧本 AI生成剧情内容的能力与使用体验Claude是否能用于编写剧本 AI生成剧情内容的能力与使用体验Claude是否能用于编写剧本 AI生成剧情内容的能力与使用体验

    本文将围绕利用AI工具进行剧本创作这一问题展开探讨。文章会首先介绍AI在剧情生成方面的核心能力,接着通过详细的步骤讲解,指导用户如何借助AI工具进行剧本的构思、撰写与优化,从而让用户了解整个操作流程。最后,会结合实际使用体验,分析其在创作过程中的优势与需要注意的方面,帮助创作者更有效地利用这一技术。…

    2026年9月26日 • 用户投稿
    700
  • win8电脑自动重启是什么原因_Win8自动重启原因及修复

    win8电脑自动重启是什么原因_Win8自动重启原因及修复win8电脑自动重启是什么原因_Win8自动重启原因及修复win8电脑自动重启是什么原因_Win8自动重启原因及修复win8电脑自动重启是什么原因_Win8自动重启原因及修复

    答案:Windows 8电脑无故重启主因是系统崩溃、硬件故障或软件冲突。应先关闭“系统失败时自动重启”以查看蓝屏代码,再更新驱动、运行SFC扫描修复系统文件,排查内存、散热及电源问题,并进行病毒查杀。 如果您发现Windows 8电脑在使用过程中无故自动重启,这通常是由系统崩溃、硬件故障或软件冲突引…

    2026年9月26日 • 用户投稿
    000
  • yandex搜索引擎入口地址 yandex网页入口引擎直达

    yandex搜索引擎入口地址 yandex网页入口引擎直达yandex搜索引擎入口地址 yandex网页入口引擎直达yandex搜索引擎入口地址 yandex网页入口引擎直达yandex搜索引擎入口地址 yandex网页入口引擎直达

    Yandex作为一款功能强大的搜索引擎,尤其在图像搜索和东欧语系内容方面表现出色,是许多用户的优选工具。本文将为您提供Yandex网页版的核心入口地址,并解析不同入口的特点,帮助您根据需求快速、直接地访问。 1、立即进入“☞☞☞☞点击yandex搜索引擎入口地址☜☜☜☜”; 2、立即进入“☞☞☞☞点…

    2026年9月26日 • 用户投稿
    000
  • 《流放之路2》国服98元起 9月11日开启不删档测试

    《流放之路2》国服98元起 9月11日开启不删档测试《流放之路2》国服98元起 9月11日开启不删档测试《流放之路2》国服98元起 9月11日开启不删档测试《流放之路2》国服98元起 9月11日开启不删档测试

    《流放之路2》国服名为《流放之路:降临》,定价从98元起,豪华版分为四个档次,价格区间为198元至798元,另有典藏版售价2888元。目前游戏已在腾讯wegame平台开启预购,国服预充值不删档测试定于2025年9月11日正式开启! 98元“基础创始人资格包”包含9800点券、测试资格以及数字原声带。…

    2026年9月26日 • 用户投稿
    400
  • sublime如何安装monokai pro主题_sublime Monokai Pro主题安装教程

    sublime如何安装monokai pro主题_sublime Monokai Pro主题安装教程sublime如何安装monokai pro主题_sublime Monokai Pro主题安装教程sublime如何安装monokai pro主题_sublime Monokai Pro主题安装教程sublime如何安装monokai pro主题_sublime Monokai Pro主题安装教程

    确保安装Package Control,通过官网获取代码在Sublime控制台运行;2. 使用Ctrl+Shift+P打开命令面板,通过Package Control搜索并安装Monokai Pro;3. 再次打开命令面板选择“Monokai Pro: Activate Theme”启用主题,或手动…

    2026年9月26日 • 用户投稿
    200
  • MySQL中窗口函数用法 窗口函数在数据分析中的实际案例

    窗口函数是在一组数据行上执行计算并为每一行返回一个值的函数。它与普通聚合函数不同,保留原始数据行并进行行级计算。常见函数包括row_number()、rank()、dense_rank()以及结合over()使用的sum()、avg()等。例如,在计算销售排名时,使用rank() over(orde…

    2026年9月26日
    000
  • 蓝猫 AI 如何生成复古风图标?蓝猫 AI 复古风图标生图全解析

    蓝猫 AI 如何生成复古风图标?蓝猫 AI 复古风图标生图全解析蓝猫 AI 如何生成复古风图标?蓝猫 AI 复古风图标生图全解析蓝猫 AI 如何生成复古风图标?蓝猫 AI 复古风图标生图全解析蓝猫 AI 如何生成复古风图标?蓝猫 AI 复古风图标生图全解析

    蓝猫ai生成复古风图标的关键在于理解复古核心元素并精准控制生成过程。首先需准备不同时期复古图标数据集并进行风格训练,如8-bit游戏、早期网页设计等;其次通过关键词引导与风格控制,如使用“8-bit pixel art icon”等描述,并提供色彩饱和度、线条粗细等参数调整;第三步可在生成后添加噪点…

    2026年9月26日 • 用户投稿
    100
  • windows商店打不开怎么办_Microsoft Store应用商店打不开修复教程

    windows商店打不开怎么办_Microsoft Store应用商店打不开修复教程windows商店打不开怎么办_Microsoft Store应用商店打不开修复教程windows商店打不开怎么办_Microsoft Store应用商店打不开修复教程windows商店打不开怎么办_Microsoft Store应用商店打不开修复教程

    使用UU加速器优化网络连接,2. 重置Microsoft Store缓存,3. 启用TLS 1.1和1.2协议,4. 更换为Google公共DNS,5. 重置Microsoft Store应用本身,可依次排查并解决商店无法打开问题。 如果您尝试打开Microsoft Store应用商店,但应用无法加…

    2026年9月26日 • 用户投稿
    000
  • 淘宝大瓜活动怎么介绍

    淘宝大瓜活动怎么介绍淘宝大瓜活动怎么介绍淘宝大瓜活动怎么介绍淘宝大瓜活动怎么介绍

    一、活动主题与亮点 本次盛会以“有大瓜”为核心概念,象征着数不尽的惊喜优惠和隐藏福利等你来发现。精彩纷呈,众多一线品牌强势加盟,带来前所未有的折扣力度。从潮流穿搭、精致美妆,到实用家居、前沿数码,品类齐全,轻松实现一站式购齐心愿清单。 二、参与方式 打开淘宝 app,搜索关键词“有大瓜”,即可直达专…

    2026年9月26日 • 用户投稿
    000
  • 电脑电池充满电后继续插着电源会损害电池吗?

    电脑电池充满电后继续插着电源会损害电池吗?电脑电池充满电后继续插着电源会损害电池吗?电脑电池充满电后继续插着电源会损害电池吗?电脑电池充满电后继续插着电源会损害电池吗?

    笔记本电池充满后继续插电不会过充,但长期满电和高温会加速电池老化,建议启用充电阈值功能(如60%~80%),并定期浅放电以延长寿命。 电脑电池充满电后继续插着电源,这事儿说起来挺微妙的。简单来说,现代笔记本电脑在充满电后,内部的智能充电电路会接管,让机器直接使用电源适配器的电力,而不是反复充放电池。…

    2026年9月26日 • 用户投稿
    000
  • WPS如何将图片转PDF_WPS图片转PDF合并与导出方法

    WPS如何将图片转PDF_WPS图片转PDF合并与导出方法WPS如何将图片转PDF_WPS图片转PDF合并与导出方法WPS如何将图片转PDF_WPS图片转PDF合并与导出方法WPS如何将图片转PDF_WPS图片转PDF合并与导出方法

    WPS Office支持将图片转为PDF并合并导出,适用于整理照片、扫描件等。1. 单张图片转换:新建→图片转PDF→选择文件→导出即可;2. 多张图片合并:通过“添加图片”多选并调整顺序,一键合成PDF,适合制作简历或作品集;3. 可选设置包括页面尺寸、图片质量和排版,提升输出效果;4. 手机端操…

    2026年9月26日 • 用户投稿
    100
  • Java中高效校验字节数组半字节(Nibble)值是否超限的技巧

    Java中高效校验字节数组半字节(Nibble)值是否超限的技巧Java中高效校验字节数组半字节(Nibble)值是否超限的技巧Java中高效校验字节数组半字节(Nibble)值是否超限的技巧Java中高效校验字节数组半字节(Nibble)值是否超限的技巧

    本文探讨了在Java中如何高效地检查字节数组中每个字节的两个半字节(nibble)是否都小于等于9。通过比较分析常见的校验方法,重点介绍了利用位运算符进行优化的解决方案,该方法避免了昂贵的算术运算和字符串转换,从而显著提升了性能,适用于需要快速验证字节数据格式的场景。 1. 问题背景与挑战 在处理字…

    2026年9月26日 • 用户投稿
    000
  • uc浏览器后台播放视频怎么设置_UC浏览器实现视频后台播放技巧

    uc浏览器后台播放视频怎么设置_UC浏览器实现视频后台播放技巧uc浏览器后台播放视频怎么设置_UC浏览器实现视频后台播放技巧uc浏览器后台播放视频怎么设置_UC浏览器实现视频后台播放技巧uc浏览器后台播放视频怎么设置_UC浏览器实现视频后台播放技巧

    UC浏览器支持后台播放,需开启悬浮窗权限或使用小窗/画中画功能。首先在设置中为UC浏览器授权“显示在其他应用上层”,播放视频后点击小窗按钮进入浮动窗口模式;若未自动触发,可手动在菜单选择“小窗播放”;同时在系统设置中启用画中画权限,并确保UC浏览器为最新版本,以实现锁屏或切换应用时持续播放。 如果您…

    2026年9月26日 • 用户投稿
    000
  • sublime怎么配置swift开发环境_sublime Swift开发环境配置教程

    sublime怎么配置swift开发环境_sublime Swift开发环境配置教程sublime怎么配置swift开发环境_sublime Swift开发环境配置教程sublime怎么配置swift开发环境_sublime Swift开发环境配置教程sublime怎么配置swift开发环境_sublime Swift开发环境配置教程

    安装Sublime Text 4并配置Package Control;2. 通过Package Control安装Swift语法插件;3. 创建自定义Build System运行Swift代码;4. 可选安装SwiftFormat实现代码格式化;5. 注意缺乏调试与完整类型提示,适用于学习和小项目。…

    2026年9月26日 • 用户投稿
    000
  • 用豆包AI实现Python内存管理优化

    用豆包AI实现Python内存管理优化用豆包AI实现Python内存管理优化用豆包AI实现Python内存管理优化用豆包AI实现Python内存管理优化

    豆包ai可通过分析内存使用模式、优化数据结构与对象创建、辅助编写内存友好代码帮助python内存管理优化。1. 发送代码片段给豆包ai,询问潜在内存问题,如循环引用或缓存未释放,并获得使用gc模块或弱引用的建议;2. 让豆包ai识别低效对象创建和不恰当数据结构,推荐生成器、itertools函数、节…

    2026年9月26日 • 用户投稿
    000
  • uc浏览器夸克网盘入口在哪里_UC浏览器内置夸克网盘功能入口

    uc浏览器夸克网盘入口在哪里_UC浏览器内置夸克网盘功能入口uc浏览器夸克网盘入口在哪里_UC浏览器内置夸克网盘功能入口uc浏览器夸克网盘入口在哪里_UC浏览器内置夸克网盘功能入口uc浏览器夸克网盘入口在哪里_UC浏览器内置夸克网盘功能入口

    1、打开UC浏览器并登录账号,向下滑动首页查找“常用服务”或“工具箱”中的夸克网盘图标;2、若未找到,点击右上角“三”图标,在菜单中查找网盘、云盘或“我的文件”选项;3、仍无结果时,可在顶部搜索框输入“夸克网盘”,从推荐服务中点击“直达”链接进入;4、最后检查设置中的“插件管理”,确保夸克网盘插件已…

    2026年9月26日 • 用户投稿
    100
  • 如何在Debian中自定义GitLab界面

    在debian中自定义gitlab界面可以通过以下几种方式进行: 更改界面语言为中文 登录GitLab并进入设置:打开浏览器,访问GitLab的URL。使用管理员账号登录。点击右上角的用户头像,选择“Settings”(设置)。修改用户界面语言:在左侧导航栏中找到“Preferences”(偏好设置…

    2026年9月26日
    100

发表回复

登录后才能评论
关注微信