Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用Puppeteer抓取TripAdvisor旅游景点数据:从基础到高级实践_创想鸟

使用Puppeteer抓取TripAdvisor旅游景点数据:从基础到高级实践

使用Puppeteer抓取TripAdvisor旅游景点数据:从基础到高级实践

本教程详细介绍了如何使用Node.js的Puppeteer库高效抓取TripAdvisor网站上的旅游景点数据。文章从解决常见的选择器错误入手,逐步演示如何提取景点标题、链接、图片、描述、价格和作者等关键信息,并提供了完整的示例代码和最佳实践,帮助开发者构建健壮的网页爬虫。

理解网页抓取挑战与Puppeteer

在进行网页抓取时,尤其面对像tripadvisor这类动态加载内容的网站,传统的http请求方式往往难以奏效。这些网站大量使用javascript来渲染页面内容,导致通过查看页面源代码无法直接获取所需数据。此时,像puppeteer这样的无头浏览器工具就显得尤为重要。

Puppeteer是一个Node.js库,它提供了一组高级API来控制Chrome或Chromium。通过Puppeteer,我们可以模拟用户在浏览器中的操作,例如打开页面、点击元素、填写表单,并等待JavaScript执行完毕,从而获取到完全渲染后的页面内容。这使得抓取动态网站变得可行。

核心问题:CSS选择器定位

在Puppeteer中,准确地定位页面元素是成功抓取数据的关键。这通常通过CSS选择器来完成。许多初学者在尝试抓取数据时,常常会遇到选择器错误,导致无法获取到预期的元素或数据。这可能是由于以下原因:

选择器不准确:未能精确匹配目标元素。元素未加载:在选择器执行时,目标元素尚未通过JavaScript渲染到DOM中。动态类名:网站可能使用动态生成的类名,导致选择器在页面刷新后失效。

例如,针对TripAdvisor景点列表页,要抓取列表项的标题,原始的选择器可能不够精确。以下是几种更健壮的选择器示例:

修正标题选择器的方法:

假设我们希望抓取TripAdvisor景点列表中的标题。我们可以通过检查页面结构,找到更稳定、更具描述性的CSS选择器。

使用article作为基础容器并精确定位内部链接:

const places = await page.evaluate(() =>   Array.from(document.querySelectorAll('article'), (e) => ({    title: e.querySelector('.VLKGO a:not([class])').innerText  })));

这里,我们首先找到每个article元素(通常代表一个独立的列表项),然后在每个article内部,通过.VLKGO a:not([class])来定位到标题链接。.VLKGO是一个包含标题的父容器,a:not([class])则确保我们选择的是没有额外类名的链接,这通常是标题链接的特征,避免选中其他辅助链接。

直接定位标题文本的父元素:

let places = await page.$$eval('article .VLKGO span > div', el =>   el.map(x => x.textContent));

这种方法利用$$eval在浏览器环境中执行JavaScript,直接选择所有匹配article .VLKGO span > div的元素,并提取它们的textContent。span > div进一步缩小了范围,确保我们直接获取到标题文本。

这些修正后的选择器,通过更具体或更稳定的元素结构来定位,大大提高了抓取的成功率。

构建全面的数据提取逻辑

仅抓取标题通常不足以满足需求。在实际应用中,我们可能需要提取更多信息,例如链接、图片、描述、价格和作者等。为了实现这一点,我们可以结合使用page.$$和element.$eval。

page.$$(‘selector’):在页面上下文中选择所有匹配的元素,并返回这些元素的ElementHandle数组。element.$eval(‘selector’, callback):在特定ElementHandle的上下文中执行回调函数,并返回回调函数的返回值。这允许我们在每个列表项的内部进行更精细的元素查找。

下面是一个完整的Puppeteer脚本,演示如何从TripAdvisor页面抓取包括标题、链接、图片、描述、价格和作者在内的多项数据:

const puppeteer = require("puppeteer");let browser; // 声明浏览器实例变量,以便在finally块中关闭(async () => {    browser = await puppeteer.launch({ headless: true }); // 建议生产环境设置为true    const page = await browser.newPage();    let url = 'https://www.tripadvisor.com/Attractions-g297476-Activities-c42-Cartagena_Cartagena_District_Bolivar_Department.html';    // 导航到目标URL,并等待页面加载完成和关键元素出现    await page.goto(url, { waitUntil: 'load', timeout: 30000 }); // 增加超时时间    await page.waitForSelector('main', { timeout: 10000 }); // 等待主要内容区域加载    // 获取所有代表一个景点的article元素    let places = await page.$$('article');    let data = [];    for (let place of places) {        try {            // 提取标题和链接            let header = await place.$eval('.VLKGO a:not([class])', el => {                // 清理标题前的序号(如 "1. ")                const name = el.textContent.split('.').pop().trim();                const link = el.getAttribute('href');                return { name, link };            });            // 提取图片URL            let image = await place.$eval('picture > img[srcset]', el => el.getAttribute('srcset'));            // 从srcset中获取最大尺寸的图片URL            image = image.split(',').pop().replace(/2x/gi, '').trim();            // 提取描述            let desc = await place.$eval('a:not([class]) > div > span', el => el.textContent.trim());            // 提取作者信息            let by = await place.$eval('.VLKGO div > div > div > a', el => {                const name = el.textContent.replace('By ', '').trim();                const link = el.getAttribute('href');                return { name, link };            });            // 提取价格(如果存在)            let price = null;            let priceTxt = null;            try {                const priceEl = await place.$('[data-automation=cardPrice]');                if (priceEl) {                    price = await priceEl.evaluate(el => el.textContent);                }            } catch (error) {                // 价格元素可能不存在,忽略错误            }            try {                const priceTxtEl = await place.$('div:nth-child(1) > div:nth-child(3):not([class])');                if (priceTxtEl) {                    priceTxt = await priceTxtEl.evaluate(el => el.textContent);                }            } catch (error) {                // 价格文本元素可能不存在,忽略错误            }            data.push({                name: header.name,                link: header.link,                desc: desc,                image: image,                price: price,                priceTxt: priceTxt,                by: by            });        } catch (error) {            console.error("在处理某个景点时发生错误:", error.message);            // 可以选择跳过当前景点或记录错误信息        }    }    console.log(data);    await browser.close();})().catch(err => console.error("抓取过程中发生未捕获错误:", err))    .finally(() => {        if (browser) {            browser.close(); // 确保在任何情况下都关闭浏览器        }    });

代码解析与最佳实践

puppeteer.launch({ headless: true }):

headless: true 表示在无头模式下运行浏览器,即不显示浏览器UI,这在生产环境中是推荐的,可以节省资源。调试时可以设置为false,以便观察浏览器行为。

page.goto(url, { waitUntil: ‘load’, timeout: 30000 }):

waitUntil: ‘load’:等待页面的load事件触发。对于动态页面,’domcontentloaded’可能不够。更稳妥的选项是’networkidle0’(网络空闲,没有超过0个网络连接)或’networkidle2’(网络空闲,没有超过2个网络连接),但它们可能导致更长的等待时间。timeout:设置页面加载的超时时间,防止页面卡住。

page.waitForSelector(‘main’, { timeout: 10000 }):

在尝试抓取元素之前,等待页面上某个关键元素(如main内容区)出现。这可以确保页面内容已经渲染,避免因元素未加载而导致的抓取失败。

page.$$(‘article’) 与 place.$eval():

page.$$(‘article’) 获取页面上所有符合条件的根级元素(这里是每个景点列表项的article标签)。通过for…of循环遍历这些ElementHandle。在循环内部,使用place.$eval(selector, callback)来在当前article元素的上下文中查找子元素并提取数据。这种方法比多次使用page.evaluate效率更高,因为它避免了频繁地在Node.js环境和浏览器环境之间切换。

数据清洗与处理:

标题: el.textContent.split(‘.’).pop().trim() 用于去除标题前的序号(如 “1. “),并清除首尾空格。图片: image.split(‘,’).pop().replace(/2x/gi, ”).trim() 用于从srcset属性中提取最大尺寸的图片URL。srcset通常包含多个尺寸的图片链接,我们取最后一个(通常是最大的),然后移除2x标识并清除空格。作者: el.textContent.replace(‘By ‘, ”).trim() 用于去除作者名前的”By “前缀。价格: 价格和价格文本元素可能不是每个列表项都存在,因此使用try…catch块来处理可能出现的ElementHandle.evaluate错误,并检查元素是否存在 (if (priceEl))。

错误处理:

在for…of循环内部使用try…catch可以确保即使某个景点的数据提取失败,整个抓取过程也能继续进行,避免因单个错误导致程序中断。外部的.catch().finally()块用于捕获整个异步操作链中的未处理错误,并确保浏览器实例在任何情况下都能被正确关闭,防止资源泄露。

注意事项

网站结构变化: 网站的HTML结构可能会随时更新。如果您的选择器突然失效,请重新检查目标网站的DOM结构并更新选择器。反爬机制: TripAdvisor等网站可能有反爬虫机制,例如IP限制、验证码、用户行为分析等。频繁或高速的抓取可能会触发这些机制。本教程的代码仅是基础实现,并未包含高级反爬策略。合法合规性: 在进行网页抓取前,请务必阅读网站的robots.txt文件和用户协议,确保您的行为合法合规。尊重网站数据所有权,避免对网站服务器造成不必要的负担。

总结

通过本教程,您应该已经掌握了使用Puppeteer抓取TripAdvisor旅游景点数据的基本方法和进阶技巧。从选择器的精确定位到复杂数据的结构化提取,再到错误处理和最佳实践,这些都是构建健壮、高效网页爬虫的关键要素。记住,深入理解目标网站的DOM结构,并灵活运用Puppeteer提供的API,是成功进行网页抓取的基石。

以上就是使用Puppeteer抓取TripAdvisor旅游景点数据:从基础到高级实践的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1520778.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年12月20日 13:37:39
如何利用JavaScript的Array方法实现数据不可变操作,以及它在Redux状态管理中的实际应用?
下一篇 2025年12月20日 13:37:50

相关推荐

  • Java Random类如何生成随机数

    Random类位于java.util包,通过实例化生成伪随机数;无参构造以系统时间作种子,带参构造用固定种子可复现序列;提供nextInt()、nextDouble()等方法生成不同类型随机值;指定范围整数可用rand.nextInt(max-min)+min实现;多线程推荐ThreadLocalR…

    2026年9月21日
    100
  • windows10如何查看S.M.A.R.T.硬盘状态_windows10硬盘S.M.A.R.T.状态查看方法

    电脑运行慢、蓝屏或文件损坏可能是硬盘故障前兆,可通过S.M.A.R.T.技术检测健康状况。1、使用WMIC命令行工具输入“wmic diskdrive get model,status”查看状态,显示Pred Fail需立即备份数据;2、CrystalDiskInfo可深度分析S.M.A.R.T.参…

    2026年9月21日
    100
  • Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧

    Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧

    Photopea的AI功能通过智能选择工具与内容感知技术结合,实现高效图片裁剪。首先使用对象选择、快速选择或魔棒工具智能识别主体或背景,再通过“选择并遮住”精细调整边缘,尤其适用于复杂轮廓如发丝。随后可应用图层蒙版透明化背景,并用裁剪工具调整画布范围。结合内容感知填充可移除干扰元素并自动补全画面,内…

    2026年9月21日 用户投稿
    300
  • Sublime开发MySQL存储过程教程实战_封装重复逻辑减少前端负担

    Sublime开发MySQL存储过程教程实战_封装重复逻辑减少前端负担Sublime开发MySQL存储过程教程实战_封装重复逻辑减少前端负担Sublime开发MySQL存储过程教程实战_封装重复逻辑减少前端负担Sublime开发MySQL存储过程教程实战_封装重复逻辑减少前端负担

    在web开发中使用mysql存储过程能有效封装逻辑并减少前端负担,本文介绍了其优势、环境配置及实战技巧。一、存储过程的优势包括减少网络传输、提高性能、统一业务逻辑;二、sublime text配置步骤为安装package control、sublimerepl插件、sql语法高亮插件,并建议新建.s…

    2026年9月21日 用户投稿
    800
  • Linux中如何安装Redis_Linux安装Redis服务的完整教程

    安装编译环境和依赖:Ubuntu/Debian用apt安装build-essential tcl wget,CentOS/RHEL用yum安装Development Tools和tcl wget。2. 下载Redis 7.2.4源码包并%ignore_a_1%,进入目录后执行make编译,可选mak…

    2026年9月21日
    000
  • VSCode代码空格怎么解决_VSCode缩进与格式处理教程

    解决VSCode代码空格和缩进问题,需配置settings.json中的缩进规则并引入外部格式化工具。首先设置”editor.tabSize”、”editor.insertSpaces”和”editor.detectIndentation&…

    2026年9月21日
    100
  • PHP框架中间件有什么用处_PHP框架中间件设计与实现

    PHP框架中间件是处理请求和响应的过滤器,用于实现身份验证、日志记录、CORS等通用逻辑,核心价值在于解耦和提升可维护性。通过定义中间件接口、具体中间件类及管道调度器可实现自定义中间件,如身份验证或CORS处理。在Laravel中可通过Kernel.php配置全局、分组或路由级中间件,执行顺序按注册…

    2026年9月21日
    000
  • Java中字符到数字转换:解决for循环提前返回的常见陷阱

    本文探讨java中`for`循环在字符到数字转换时,因`return`语句放置不当导致程序提前终止、无法完整处理字符串的问题。我们将分析这种常见陷阱,并提供修正方案,演示如何正确利用循环填充数组,并在循环结束后统一返回最终结果,确保每个字符都能被准确映射和组合。 引言:字符到数字的映射需求 在编程实…

    2026年9月21日
    000
  • Linux如何查看网络带宽使用情况

    使用iftop实时查看网络连接带宽,nethogs按进程监控流量,sar查看历史网络统计,vnstat记录长期流量,四者分别适用于实时监控、进程定位、短期统计和长期分析。 在Linux系统中,查看网络带宽使用情况有多种方法,可以通过命令行工具实时监控网络流量和带宽占用。以下是几种常用且实用的方式。 …

    2026年9月21日
    100
  • 系统界面美化的10个方法

    采用一致色彩方案,使用协调主色调并保持元素颜色统一;2. 选用清晰字体如思源黑体,规范字号层级;3. 增加留白提升视觉舒适度;4. 统一图标风格并使用SVG格式;5. 添加微动效增强交互引导;6. 采用卡片式布局与栅格系统;7. 支持深浅色模式切换并优化对比度;8. 精简装饰元素突出核心功能;9. …

    2026年9月21日
    200
  • win10登录界面不显示用户头像或名称怎么办_恢复登录界面完整显示的操作方法

    登录界面缺少头像或账户名时,先检查账户名一致性,修复头像缓存,重设头像,扫描系统文件,必要时创建新管理员账户验证问题。 如果您在启动Windows 10后,登录界面仅显示密码输入框而缺少用户头像或账户名称,则可能是由于系统设置、缓存异常或账户配置问题导致。以下是恢复登录界面完整显示的详细操作方法。 …

    2026年9月21日
    100
  • word怎么设置页边距_word文档页边距设置步骤

    首先打开Word文档,点击“布局”选项卡中的“页边距”按钮,可选择预设值或点击“自定义页边距”进行详细设置,输入上下左右边距及装订线数值,再通过“应用于”选择范围,最后点击“确定”完成设置。 在使用Word编辑文档时,设置合适的页边距能让内容排版更美观,也符合打印或提交要求。下面介绍如何在Word中…

    2026年9月21日
    000
  • 小红书合规引流全套方案2025:6招实现私域用户300%增长的实用技巧

    内容为王,精准定位:围绕目标用户画像创作高质量、垂直领域的原创内容,如教程攻略、真实好物推荐、生活分享与避坑指南,形式涵盖图文、短视频与直播,以解决用户实际问题为核心;2. 巧妙互动,建立连接:积极回复评论与私信,发起话题活动与抽奖提升参与感,并通过创建社群增强用户粘性,始终以真诚态度提供价值;3.…

    2026年9月21日
    000
  • 三星 A55通知提醒不及时怎么办 Samsung A55消息设置

    三星A55消息通知不及时需检查后台管理设置:1. 进入【设置】-【电池】-【后台使用限制】,开启【自动运行】,将微信等应用关闭【深度睡眠】并加入【不受限制的应用】;2. 在【通知】设置中确保允许通知、锁屏显示等权限开启,且未被暂停或静音;3. 检查网络稳定性和Samsung Account同步状态,…

    2026年9月21日
    200
  • 梦幻号虚拟主播电商运营宝典(附新手教程+配套工具清单)

    虚拟主播电商的核心在于“内容驱动销售,人设凝聚用户”,要让“梦幻号”真正动起来并实现带货,必须先赋予其鲜明的人设,包括清晰的定位标签(如美食家、科技宅)、独特的人格魅力(性格、口头禅、小缺点)和与产品的强关联性,使其具备辨识度和故事感,从而建立用户信任;接着通过obs studio、vtube st…

    2026年9月21日
    000
  • deepseek下载速度优化_从deepseek下载速度优化官网获取

    deepseek下载速度优化入口在官网https://www.deepseek.com,进入后可通过设置调整响应模式、使用智能路由和数据压缩技术提升速度。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ deepseek下载速度优化入口地址在…

    2026年9月21日
    000
  • Linux如何设置目录的执行权限

    目录的执行权限是访问其内容的“钥匙”,使用chmod命令可通过符号或八进制模式设置,常见权限为755(所有者rwx,组和其他用户rx),递归设置时推荐结合find命令分别处理文件和目录,避免误加执行权限。 在Linux中,设置目录的执行权限( x )并非意味着你可以“运行”这个目录,而是赋予了你进入…

    2026年9月21日
    000
  • 纯白颜值、双模切换:“纯白小金刚”技嘉M27UP ICE显示器登场

    纯白颜值、双模切换:“纯白小金刚”技嘉M27UP ICE显示器登场纯白颜值、双模切换:“纯白小金刚”技嘉M27UP ICE显示器登场纯白颜值、双模切换:“纯白小金刚”技嘉M27UP ICE显示器登场纯白颜值、双模切换:“纯白小金刚”技嘉M27UP ICE显示器登场

    在电竞DIY领域深耕多年的技嘉,始终致力于满足玩家对高颜值与个性化外设的追求。为助力用户打造一体化的纯白主题电竞空间,品牌全新推出了专为此场景设计的M27UP ICE显示器。这款产品定位于两千元左右价位,凭借出众的纯白外观、卓越性能与超高性价比,被玩家们亲切称为“纯白小金刚”。如果你正想入手一台兼具…

    2026年9月21日 用户投稿
    000
  • Java多线程API调用中Future.get()返回null的解决方案

    本文旨在解决%ignore_a_1%api调用中`future.get()`方法返回`null`的常见问题。当使用`callable`和`executorservice`并发执行api请求并尝试获取结果时,如果流读取逻辑不当,可能导致获取到的数据为空。文章将详细解释问题根源,并提供使用`string…

    2026年9月21日
    000
  • UC浏览器缓存清理失败怎么办 UC浏览器缓存管理优化方法

    先检查权限和存储空间,再用手机自带工具清理缓存文件夹,最后更新或重装UC浏览器解决清理失败问题。 UC浏览器缓存清理失败,通常不是按钮没反应,就是空间没释放。问题可能出在系统权限、文件顽固或设置冲突上。别急着重装,先试试这几个方法,基本能搞定。 检查应用权限与存储状态 如果UC浏览器自己都“进不去”…

    2026年9月21日
    000

发表回复

登录后才能评论
关注微信