使用Python和API高效抓取TechCrunch动态加载文章教程

程序猿 • 2025年12月14日 18:00:26 • 好文分享 • 阅读 0

本文详细介绍了如何在不使用selenium或beautifulsoup等模拟点击工具的情况下，利用python的`requests`库和网站的api接口，高效抓取techcrunch等网站动态加载的文章内容。通过浏览器开发者工具识别隐藏的api请求，并循环调用分页api，实现对大量文章的自动化数据采集，克服了“加载更多”按钮的限制。

识别动态加载内容的API接口

在许多现代网站上，为了提升用户体验，内容通常是动态加载的。这意味着当你首次访问页面时，浏览器接收到的HTML可能只包含一部分内容。当用户滚动页面或点击“加载更多”按钮时，网站会通过JavaScript向后端发送请求，获取更多数据，然后动态地插入到页面中。对于爬虫而言，如果仅抓取初始HTML，就无法获取到全部内容。

传统的网页抓取方法，如结合requests和BeautifulSoup，主要针对静态HTML内容。当网站内容依赖于JavaScript动态加载时，这些工具就显得力不从心。虽然Selenium等自动化测试工具可以模拟用户行为（如点击按钮、滚动页面）来触发JavaScript执行，进而获取动态内容，但它们通常资源消耗较大，运行速度较慢，并且在某些环境下可能无法使用。

为了在不使用Selenium等工具的情况下获取动态加载的内容，关键在于找到网站用来获取这些数据的API接口。这些API请求通常返回JSON格式的数据，其中包含了我们所需的内容。

如何发现这些API接口？

立即学习“Python免费学习笔记（深入）”；

最有效的方法是利用浏览器的“开发者工具”（Developer Tools）。以下是具体步骤：

打开目标网站： 在浏览器中访问 https://techcrunch.com/。打开开发者工具：在Chrome、Firefox等浏览器中，右键点击页面任意位置，选择“检查”（Inspect）或“检查元素”（Inspect Element）。或者使用快捷键：F12（Windows/Linux）或 Cmd + Option + I（macOS）。切换到“网络”（Network）选项卡： 这个选项卡会显示浏览器与服务器之间所有的网络请求。过滤请求类型： 为了更容易找到API请求，可以过滤请求类型。通常，动态加载的数据请求属于“XHR”或“Fetch”类型。点击“XHR”或“Fetch/XHR”按钮进行过滤。模拟用户行为： 在网页上找到“加载更多”（Load More）按钮并点击它。观察网络请求： 当你点击“加载更多”后，在“网络”选项卡中会看到新的请求出现。仔细观察这些新请求的URL。寻找那些看起来像数据接口的URL，它们通常包含api、json或特定的路径段。

对于TechCrunch网站，当你点击“加载更多”按钮后，在“网络”选项卡中，你会发现一个形如 https://techcrunch.com/wp-json/tc/v1/magazine?page={page}&_embed=true&es=true&cachePrevention=0 的请求。这就是我们需要的API接口。

解析TechCrunch的API结构

通过上述步骤，我们识别出了TechCrunch用于分页加载文章的API接口：

https://techcrunch.com/wp-json/tc/v1/magazine?page={page}&_embed=true&es=true&cachePrevention=0

仔细观察这个URL，我们可以发现几个关键点：

wp-json/tc/v1/magazine: 这是API的路径，表明它是一个WordPress JSON API，用于获取杂志（文章）内容。page={page}: 这是一个非常重要的查询参数，它控制了要获取的页码。通过改变{page}的值，我们可以请求不同页的文章。_embed=true, es=true, cachePrevention=0: 这些是其他查询参数，它们可能控制返回数据的详细程度、搜索行为或缓存行为。在我们的场景中，保持它们不变即可。

这个API返回的数据是JSON格式，每一页的响应都包含一个文章列表，每篇文章又是一个字典，其中包含了标题、链接、摘要等详细信息。

使用Python requests库进行数据抓取

有了API接口，我们就可以使用Python的requests库来发送HTTP请求，获取并解析数据了。

以下是一个完整的Python示例代码，演示如何迭代抓取TechCrunch的多页文章标题：

import requestsimport timeimport json # 用于美观打印JSON数据，可选# 定义API的基础URL，其中{page}是页码的占位符api_url_template = "https://techcrunch.com/wp-json/tc/v1/magazine?page={page}&_embed=true&es=true&cachePrevention=0"# 定义要抓取的页数范围# 注意：这里我们抓取1到9页，共9页。实际应用中可根据需求调整。# 网站可能没有无限页，抓取过多不存在的页码可能会返回空列表或错误。num_pages_to_fetch = 10 print(f"开始抓取TechCrunch文章，预计抓取 {num_pages_to_fetch-1} 页...")all_articles_data = []for page_num in range(1, num_pages_to_fetch): # 从第1页开始    current_api_url = api_url_template.format(page=page_num)    print(f"n正在请求第 {page_num} 页: {current_api_url}")    try:        # 发送GET请求        response = requests.get(current_api_url)        response.raise_for_status() # 检查请求是否成功，如果状态码不是200，则抛出HTTPError        # 解析JSON响应        data = response.json()        if not data:            print(f"第 {page_num} 页没有返回数据，可能已到达最后一页或请求有误。")            break # 如果返回空列表，则认为没有更多文章了，退出循环        # 遍历当前页的所有文章        for article in data:            title = article.get("title", {}).get("rendered", "无标题")            link = article.get("link", "无链接")            # 可以根据需要提取更多字段，例如摘要、发布日期等            # summary = article.get("excerpt", {}).get("rendered", "无摘要")            # published_date = article.get("date", "无日期")            print(f"  - 标题: {title}")            # print(f"    链接: {link}")            # print(f"    摘要: {summary}")            # print(f"    发布日期: {published_date}")            all_articles_data.append({                "title": title,                "link": link,                # ... 其他需要存储的数据            })    except requests.exceptions.RequestException as e:        print(f"请求第 {page_num} 页时发生错误: {e}")    except json.JSONDecodeError:        print(f"解析第 {page_num} 页的JSON响应时发生错误。")    # 为了避免给服务器造成过大压力，建议在每次请求后暂停一段时间    time.sleep(1) # 暂停1秒print(f"n抓取完成！共抓取到 {len(all_articles_data)} 篇文章。")# 示例：打印所有抓取到的文章标题（或存储到文件）# for article in all_articles_data:#     print(f"最终文章列表 - 标题: {article['title']}")# 可以将数据保存到JSON文件# with open("techcrunch_articles.json", "w", encoding="utf-8") as f:#     json.dump(all_articles_data, f, ensure_ascii=False, indent=4)# print("文章数据已保存到 techcrunch_articles.json")

代码解析：

import requests 和 import time: 导入HTTP请求库和时间库（用于控制请求频率）。api_url_template: 定义了API的模板URL，{page}是一个占位符，后续会用实际页码填充。num_pages_to_fetch: 设置你希望抓取的页数。请注意，网站的实际页数是有限的，如果请求的页码超出范围，API可能会返回空数据或错误。for page_num in range(1, num_pages_to_fetch): 循环遍历所需的页码。current_api_url = api_url_template.format(page=page_num): 构建当前页的完整API URL。requests.get(current_api_url): 发送HTTP GET请求到API。response.raise_for_status(): 这是一个非常重要的错误检查，如果HTTP响应状态码表示请求失败（例如4xx或5xx），它会抛出HTTPError。data = response.json(): 将API响应解析为Python字典或列表（因为API返回的是JSON数据）。if not data:: 检查返回的数据是否为空。如果API返回一个空列表，通常意味着没有更多文章了，此时可以提前退出循环。for article in data:: 遍历当前页返回的文章列表。article.get(“title”, {}).get(“rendered”, “无标题”): 从每篇文章的字典中提取标题。这里使用了.get()方法来安全地访问嵌套字典的键，避免在键不存在时引发KeyError。time.sleep(1): 在每次请求之间暂停1秒。这是为了避免请求过于频繁，给服务器造成过大压力，从而降低被封禁IP的风险。

注意事项与优化

页数限制的确定： 上述代码中num_pages_to_fetch是手动设置的。在实际应用中，你可能需要动态确定最大页数。一种方法是持续请求，直到API返回空列表或错误。更高级的API可能会在响应中包含总页数或下一页的链接。错误处理： 务必添加健壮的错误处理机制。除了response.raise_for_status()外，还应捕获requests.exceptions.RequestException（网络连接错误、超时等）和json.JSONDecodeError（JSON解析失败）。请求频率与反爬机制： 许多网站都有反爬虫机制。频繁、快速的请求可能导致你的IP被暂时或永久封禁。time.sleep(): 这是最简单的限速方法。随机User-Agent: 模拟不同的浏览器User-Agent，让请求看起来更像来自真实用户。代理IP池: 使用代理IP轮换，进一步避免IP被封。数据存储： 抓取到的文章数据可以存储在多种格式中，如：JSON文件: 适合结构化数据，易于读写。CSV文件: 适合表格数据，易于用电子表格软件打开。数据库: 对于大量数据或需要频繁查询的场景，可以考虑SQLite、MySQL或MongoDB等数据库。网站结构变化： API接口和返回的数据结构可能会随着网站的更新而改变。你的爬虫代码可能需要定期检查和维护。遵守Robots协议和网站政策： 在进行任何爬取活动之前，请务必查看网站的robots.txt文件和使用条款，确保你的行为合法合规。

总结

通过利用Web开发者工具发现网站的隐藏API接口，并结合Python的requests库，我们能够高效、灵活地抓取动态加载的内容，而无需依赖资源密集型的浏览器自动化工具。这种方法不仅速度更快，资源消耗更少，而且更隐蔽。掌握这一技巧，是进行现代网页数据采集的关键能力之一。

以上就是使用Python和API高效抓取TechCrunch动态加载文章教程的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1377707.html

go html java javascript js json linux mysql python wind word

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

SimPy进程顺序执行：确保一个过程完成后再启动另一个过程

上一篇 2025年12月14日 18:00:20

Python中字符串到日期时间转换：解决ValueError与格式匹配问题

下一篇 2025年12月14日 18:00:32

好文分享

如何解决本地图片在使用 mask JS 库时出现的跨域错误？

如何跨越localhost使用本地图片？问题: 在本地使用mask js库时，引入本地图片会报跨域错误。解决方案: 要解决此问题，需要使用本地服务器启动文件，以http或https协议访问图片，而不是使用file://协议。例如： python -m http.server 8000 然后，可以…

程序猿
2025年12月24日
2000
好文分享

使用 Mask 导入本地图片时，如何解决跨域问题？

跨域疑难：如何解决 mask 引入本地图片产生的跨域问题？在使用 mask 导入本地图片时，你可能会遇到令人沮丧的跨域错误。为什么会出现跨域问题呢？让我们深入了解一下： mask 框架假设你以 http(s) 协议加载你的 html 文件，而当使用 file:// 协议打开本地文件时，就会产生跨域…

程序猿
2025年12月24日
2000
好文分享

正则表达式在文本验证中的常见问题有哪些？

正则表达式助力文本输入验证在文本输入框的验证中，经常遇到需要限定输入内容的情况。例如，输入框只能输入整数，第一位可以为负号。对于不会使用正则表达式的人来说，这可能是个难题。下面我们将提供三种正则表达式，分别满足不同的验证要求。 1. 可选负号，任意数量数字如果输入框中允许第一位为负号，后面可输入…

程序猿
2025年12月24日
0000
好文分享

如何在 VS Code 中解决折叠代码复制问题？

解决 VS Code 折叠代码复制问题在 VS Code 中使用折叠功能可以帮助组织长代码，但使用复制功能时，可能会遇到只复制可见部分的问题。以下是如何解决此问题：当代码被折叠时，可以使用以下简单操作复制整个折叠代码：按下 Ctrl + C (Windows/Linux) 或 Cmd + C …

程序猿
2025年12月24日
0000
好文分享

网络进化！

Web 应用程序从静态网站到动态网页的演变是由对更具交互性、用户友好性和功能丰富的 Web 体验的需求推动的。以下是这种范式转变的概述： 1. 静态网站（1990 年代）定义：静态网站由用 HTML 编写的固定内容组成。每个页面都是预先构建并存储在服务器上，并且向每个用户传递相同的内容。技术：HT…

程序猿
2025年12月24日
0000
好文分享

为什么多年的经验让我选择全栈而不是平均栈

在全栈和平均栈开发方面工作了 6 年多，我可以告诉您，虽然这两种方法都是流行且有效的方法，但它们满足不同的需求，并且有自己的优点和缺点。这两个堆栈都可以帮助您创建 Web 应用程序，但它们的实现方式却截然不同。如果您在两者之间难以选择，我希望我在两者之间的经验能给您一些有用的见解。在这篇文章中，我…

程序猿
2025年12月24日
0000
好文分享

姜戈顺风

本教程演示如何在新项目中从头开始配置 django 和 tailwindcss。 django 设置创建一个名为 .venv 的新虚拟环境。 # windows$ python -m venv .venv$ .venvscriptsactivate.ps1(.venv) $# macos/linu…

程序猿
2025年12月24日
0000
好文分享

花 $o 学习这些编程语言或免费

→ Python → JavaScript → Java → C# → 红宝石 → 斯威夫特 → 科特林 → C++ → PHP → 出发 → R → 打字稿 []https://x.com/e_opore/status/1811567830594388315?t=_j4nncuiy2wfbm7ic…

程序猿
2025年12月24日
0000
好文分享

学会从头开始学习CSS，掌握制作基本网页框架的技巧

从零开始学习CSS，掌握网页基本框架制作技巧前言：在现今互联网时代，网页设计和开发是一个非常重要的技能。而学习CSS（层叠样式表）是掌握网页设计的关键之一。CSS不仅可以为网页添加样式和布局，还可以为用户呈现独特且具有吸引力的页面效果。在本文中，我将为您介绍一些基本的CSS知识，以及一些常用的代…

程序猿
2025年12月24日
2000
好文分享

揭秘Web标准涵盖的语言：了解网页开发必备的语言范围

在当今数字时代，互联网成为了人们生活中不可或缺的一部分。作为互联网的基本构成单位，网页承载着我们获取和分享信息的重要任务。而网页开发作为一门独特的技术，离不开一些必备的语言。本文将揭秘Web标准涵盖的语言，让我们一起了解网页开发所需的语言范围。首先，HTML（HyperText Markup La…

程序猿
2025年12月24日
0000
好文分享

揭开Web开发的语言之谜：了解构建网页所需的语言有哪些？

Web标准中的语言大揭秘：掌握网页开发所需的语言有哪些？随着互联网的快速发展，网页开发已经成为人们重要的职业之一。而要成为一名优秀的网页开发者，掌握网页开发所需的语言是必不可少的。本文将为大家揭示Web标准中的语言大揭秘，介绍网页开发所需的主要语言。 HTML（超文本标记语言）HTML是网页开发的…

程序猿
2025年12月24日
4000
好文分享

常用的网页开发语言：了解Web标准的要点

了解Web标准的语言要点：常见的哪些语言应用在网页开发中？随着互联网的不断发展，网页已经成为人们获取信息和交流的重要途径。而要实现一个高质量、易用的网页，离不开一种被广泛接受的Web标准。Web标准的制定和应用，涉及到多种语言和技术，本文将介绍常见的几种语言在网页开发中的应用。首先，HTML（H…

程序猿
2025年12月24日
0000
好文分享

网页开发中常见的Web标准语言有哪些？

探索Web标准语言的世界：网页开发中常用的语言有哪些？在现代社会中，互联网的普及程度越来越高，网页已成为人们获取资讯、娱乐、交流的重要途径。而网页的开发离不开各种编程语言的应用和支持。在这个虚拟世界的网络，有许多被广泛应用的标准化语言，用于为用户提供优质的网页体验。本文将探索网页开发中常用的语言，…

程序猿
2025年12月24日
0000
好文分享

深入探究Web标准语言的范围，涵盖了哪些语言？

Web标准是指互联网上的各个网页所需遵循的一系列规范，确保网页在不同的浏览器和设备上能够正确地显示和运行。这些标准包括HTML、CSS和JavaScript等语言。本文将深入解析Web标准涵盖的语言范围。首先，HTML（HyperText Markup Language）是构建网页的基础语言。它使…

程序猿
2025年12月24日
0000
好文分享

深入理解CSS框架与JS之间的关系

深入理解CSS框架与JS之间的关系在现代web开发中，CSS框架和JavaScript (JS) 是两个常用的工具。CSS框架通过提供一系列样式和布局选项，可以帮助我们快速构建美观的网页。而JS则提供了一套功能强大的脚本语言，可以为网页添加交互和动态效果。本文将深入探讨CSS框架和JS之间的关系，…

程序猿
2025年12月24日
0000
好文分享

项目实践：如何结合CSS和JavaScript打造优秀网页的经验总结

项目实践：如何结合CSS和JavaScript打造优秀网页的经验总结随着互联网的快速发展，网页设计已经成为了各行各业都离不开的一项技能。优秀的网页设计可以给用户留下深刻的印象，提升用户体验，增加用户的黏性和转化率。而要做出优秀的网页设计，除了对美学的理解和创意的运用外，还需要掌握一些基本的技能，如…

程序猿
2025年12月24日
2000
好文分享

CSS 超链接属性解析：text-decoration 和 color

CSS 超链接属性解析：text-decoration 和 color 超链接是网页中常用的元素之一，它能够在不同页面之间建立连接。为了使超链接在页面中有明显的标识和吸引力，CSS 提供了一些属性来调整超链接的样式。本文将重点介绍 text-decoration 和 color 这两个与超链接相关的…

程序猿
2025年12月24日
0000
好文分享

学完HTML和CSS之后我应该做什么？

网页开发是一段漫长的旅程，但是掌握了HTML和CSS技能意味着你已经赢得了一半的战斗。这两种语言对于学习网页开发技能来说非常重要和基础。现在不可或缺的是下一个问题，学完HTML和CSS之后我该做什么呢？对这些问题的答案可以分为2-3个部分，你可以继续练习你的HTML和CSS编码，然后了解在学习完H…

程序猿
2025年12月24日
0000
聊聊怎么利用CSS实现波浪进度条效果

本篇文章给大家分享css 高阶技巧，介绍一下如何使用css实现波浪进度条效果，希望对大家有所帮助！本文是 CSS Houdini 之 CSS Painting API 系列第三篇。现代 CSS 之高阶图片渐隐消失术现代 CSS 高阶技巧，像 Canvas 一样自由绘图构建样式！在上两篇中，我们…

程序猿
2025年12月24日 • 好文分享
2000
巧用距离、角度及光影制作炫酷的 3D 文字特效

如何利用 css 实现3d立体的数字？下面本篇文章就带大家巧用视觉障眼法，构建不一样的 3d 文字特效，希望对大家有所帮助！最近群里有这样一个有意思的问题，大家在讨论，使用 CSS 3D 能否实现如下所示的效果：这里的核心难点在于，如何利用 CSS 实现一个立体的数字？CSS 能做到吗？不是特…

程序猿
2025年12月24日 • 好文分享
0000