Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
解决Python Requests爬取登录网站406错误的实战教程_创想鸟

解决Python Requests爬取登录网站406错误的实战教程

解决Python Requests爬取登录网站406错误的实战教程

本教程旨在解决使用python `requests`库爬取需要登录的网站时遇到的“406 not acceptable”错误。核心内容是揭示服务器端对http请求头部的验证机制,并提供通过添加或修改关键http头部(如`user-agent`)来模拟浏览器行为的解决方案,确保python爬虫能够成功进行身份验证并获取数据。

在进行网络数据抓取时,尤其是针对需要用户登录的平台,我们经常会遇到请求被服务器拒绝的情况。即使提供了正确的用户名和密码,POST请求也可能返回“406 Not Acceptable”状态码。这通常不是认证信息本身的问题,而是服务器对请求头部的严格校验导致的。许多网站会检查请求的User-Agent等头部信息,以识别并阻止非浏览器发起的自动化请求。

遇到的问题示例

假设我们尝试使用requests库登录一个交易平台(如Plus500),并获取实时市场数据。初始代码可能如下所示:

import requestsfrom pprint import pprint# 假设Config模块中定义了username和password# from Config import username, password # 示例用户名和密码,实际应用中应从安全配置中加载username = "your_email@example.com"password = "YourRandomCode87"def main():    # 目标登录URL,通常包含一些会话或追踪参数    url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login'           '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 '    with requests.Session() as session:        # 使用session发送POST请求,并尝试进行HTTP基本认证        response = session.post(url, auth=(username, password))        pprint(response.text)if __name__ == '__main__':    main()

运行上述代码后,我们可能会得到类似以下的响应:

('{n' '  "status": "Rejected",n' '  "statusCode": "406",n' '  "supportID": "...",n' '  "ipAddress": "my IP",n' '  "timeStamp": "2022-08-27 12:30:47"n' '}')

响应明确指出status: “Rejected”和statusCode: “406”,这意味着服务器拒绝了我们的请求,通常是由于请求的头部不符合服务器的预期。

立即学习“Python免费学习笔记(深入)”;

解决方案:模拟浏览器请求头

解决这类问题的关键在于让我们的Python脚本尽可能地模拟一个真实的浏览器行为。这通常通过在请求中添加或修改HTTP头部信息来实现。最常见的也是最重要的头部是User-Agent,它标识了发出请求的客户端类型。此外,Accept-Encoding、Accept、Accept-Language和Connection等头部也常用于模拟浏览器。

核心HTTP头部解释:

User-Agent: 告诉服务器客户端的类型、操作系统和浏览器版本。这是最常用于识别和过滤自动化请求的头部。Accept-Encoding: 告知服务器客户端支持的编码方式(如gzip, deflate),以便服务器可以压缩响应内容。Accept: 告知服务器客户端能够处理的媒体类型(MIME类型),例如text/html, application/xhtml+xml等。Accept-Language: 告知服务器客户端偏好的语言。Connection: 控制网络连接的选项,keep-alive表示客户端希望保持连接以便后续请求复用。

修正后的代码示例

通过在requests.post方法中添加headers参数,我们可以解决上述问题:

import requestsfrom pprint import pprint# 假设Config模块中定义了username和password# from Config import username, password # 示例用户名和密码,实际应用中应从安全配置中加载username = "your_email@example.com"password = "MyRandomCode87"def main():    url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login'           '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 '    # 定义模拟浏览器行为的HTTP头部    headers = {        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:20.0) Gecko/20100101 Firefox/20.0",        "Accept-Encoding": "gzip, deflate",        "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",        "Accept-Language": "en-US,en;q=0.5",        "Connection": "keep-alive"    }    with requests.Session() as session:        # 在POST请求中加入headers参数        response = session.post(url, auth=(username, password), headers=headers)        pprint(response.text)if __name__ == '__main__':    main()

通过添加这些头部,服务器将更倾向于将我们的请求视为来自合法浏览器,从而允许认证和后续的数据访问。

如何确定必要的HTTP头部

在实际的爬虫开发中,我们可能需要更精确地确定哪些头部是必需的。以下是一些常用的方法:

浏览器开发者工具(Developer Tools):

打开目标网站的登录页面。按F12(或右键点击页面 -> 检查)打开开发者工具。切换到“Network”(网络)选项卡。进行登录操作,观察登录请求(通常是POST请求)。点击该请求,查看其“Request Headers”(请求头部)部分。复制其中关键的头部信息到你的Python代码中。User-Agent是首要关注的,但有时也需要Referer、Origin、Content-Type等。

逐步测试: 如果不确定哪些头部是必需的,可以从User-Agent开始,然后逐步添加其他头部,直到请求成功。

阅读网站的Robots.txt和使用条款: 在进行任何爬取活动之前,务必检查网站的robots.txt文件,了解允许或禁止爬取的部分。同时,仔细阅读网站的服务条款,确保你的行为符合规定,避免不必要的法律风险。

注意事项与最佳实践

尊重网站政策: 始终遵守网站的robots.txt协议和使用条款。未经授权的爬取可能导致IP被封禁,甚至引发法律问题。频率控制: 不要以过高的频率发送请求,这可能被服务器识别为DDoS攻击。使用time.sleep()在请求之间添加延时。异常处理: 编写健壮的代码来处理网络错误、超时、不同的HTTP状态码等异常情况。动态User-Agent: 为了进一步模拟真实用户,可以维护一个User-Agent列表,并在每次请求时随机选择一个。Cookie管理: requests.Session会自动处理Cookie,这对于维护登录状态至关重要。代理IP: 如果IP被封禁,可以考虑使用代理IP池来轮换IP地址。

总结

当使用Python requests库爬取需要登录的网站时遇到“406 Not Acceptable”等拒绝访问的问题,通常是由于请求头部不符合服务器的预期。通过模拟浏览器发送的HTTP头部,特别是User-Agent,可以有效解决这类问题。理解并正确设置这些头部是成功进行网络数据抓取的关键一步。在实践中,结合浏览器开发者工具分析实际请求头,并遵循网络爬取的最佳实践和道德规范,将有助于更高效、更稳定地获取所需数据。

以上就是解决Python Requests爬取登录网站406错误的实战教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1590351.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
处理重叠元素点击事件:z-index 切换策略
上一篇 2025年12月23日 05:54:18
CSS幻灯片导航箭头定位:解决容器溢出问题
下一篇 2025年12月23日 05:54:30

相关推荐

  • UC浏览器如何设置默认下载工具_UC浏览器调用第三方下载器设置方法

    UC浏览器如何设置默认下载工具_UC浏览器调用第三方下载器设置方法UC浏览器如何设置默认下载工具_UC浏览器调用第三方下载器设置方法UC浏览器如何设置默认下载工具_UC浏览器调用第三方下载器设置方法UC浏览器如何设置默认下载工具_UC浏览器调用第三方下载器设置方法

    首先开启UC浏览器的第三方下载权限,进入设置→下载设置→启用“使用第三方下载工具”;然后在默认下载工具中选择目标应用如IDM+或ADM;若未显示可选应用需确认安装并刷新列表;还可通过系统设置→应用管理→默认应用→下载管理器中指定默认下载器;对于不支持直接绑定的版本,可用Tasker或Auto.js等…

    2026年9月24日 • 用户投稿
    100
  • 怎样备份和恢复Debian邮件服务器数据

    备份和恢复debian邮件服务器数据的方法取决于邮件服务器的具体配置和使用的软件。以下是一些通用的步骤和建议: 壁纸样机神器 免费壁纸样机生成 0 查看详情 备份步骤 确定备份内容:首先,确定需要备份的数据类型,例如邮件内容、用户信息、配置文件等。使用备份工具:根据邮件服务器的软件选择合适的备份工具…

    2026年9月24日
    000
  • 怎么用豆包AI帮我实现CQRS模式 3步教你用AI分离读写模型

    怎么用豆包AI帮我实现CQRS模式 3步教你用AI分离读写模型怎么用豆包AI帮我实现CQRS模式 3步教你用AI分离读写模型怎么用豆包AI帮我实现CQRS模式 3步教你用AI分离读写模型怎么用豆包AI帮我实现CQRS模式 3步教你用AI分离读写模型

    实现cqrs模式可通过三步借助豆包ai快速完成:一、理清业务场景,将写操作(如用户下单)与读操作(如查看订单列表)分离,可复制代码给豆包ai分析归类;二、让豆包ai生成基础结构代码,输入类似“基于cqrs的订单管理系统,用python flask实现”的指令,获取命令处理器、查询处理器等模块模板;三…

    2026年9月24日 • 用户投稿
    000
  • win8如何关闭自动更新_Win8关闭自动更新教程

    win8如何关闭自动更新_Win8关闭自动更新教程win8如何关闭自动更新_Win8关闭自动更新教程win8如何关闭自动更新_Win8关闭自动更新教程win8如何关闭自动更新_Win8关闭自动更新教程

    通过控制面板将Windows更新设置为从不检查更新;2. 在服务管理中禁用Windows Update服务并停止其运行;3. 使用组策略编辑器(专业版)禁用自动更新策略,彻底阻止系统自动下载和安装更新。 如果您希望阻止Windows 8系统自动下载和安装更新,以避免占用网络带宽或防止在不适当的时间重…

    2026年9月24日 • 用户投稿
    000
  • WPS如何制作个人简历_WPS简历模板选择与内容填写教程

    WPS如何制作个人简历_WPS简历模板选择与内容填写教程WPS如何制作个人简历_WPS简历模板选择与内容填写教程WPS如何制作个人简历_WPS简历模板选择与内容填写教程WPS如何制作个人简历_WPS简历模板选择与内容填写教程

    使用WPS制作简历需先选择合适模板,填写个人信息、求职意向、教育背景、工作经历等内容,突出成果与技能,调整格式后导出为PDF。关键在于内容真实、条理清晰、重点突出,便于HR快速识别优势。 在求职过程中,一份清晰、专业的简历至关重要。WPS Office 提供了多种简历模板和便捷的编辑功能,帮助用户快…

    2026年9月24日 • 用户投稿
    300
  • 袋鼠数据库工具 8.90.1 版已上线

    袋鼠数据库工具 8.90.1 版已上线袋鼠数据库工具 8.90.1 版已上线袋鼠数据库工具 8.90.1 版已上线袋鼠数据库工具 8.90.1 版已上线

    袋鼠数据库工具 是一款由 ai 驱动的主流数据库系统客户端,支持多种数据库类型,包括 mariadb、mongodb、mysql、oracle、postgresql、redis、sqlite、sqlserver 等,具备建表、数据查询、模型设计、结构同步、数据导入导出等丰富功能。兼容 windows…

    2026年9月24日 • 用户投稿
    000
  • 使用 Appium 实现 Gmail OTP 验证自动化

    使用 Appium 实现 Gmail OTP 验证自动化使用 Appium 实现 Gmail OTP 验证自动化使用 Appium 实现 Gmail OTP 验证自动化使用 Appium 实现 Gmail OTP 验证自动化

    本文档旨在指导开发者如何使用 Appium 自动化测试移动应用中的 Gmail OTP (One-Time Password) 验证流程。我们将探讨如何通过 Appium 定位 OTP 输入框,并使用获取到的 OTP 值进行输入,从而完成验证流程的自动化。 定位 OTP 输入框 在 Appium 中…

    2026年9月24日 • 用户投稿
    200
  • Java程序Ubuntu上如何备份

    在ubuntu上备份java程序,你可以遵循以下步骤: 确定备份位置:首先,你需要确定一个安全的位置来存储备份文件。这可以是一个外部硬盘、网络驱动器或其他任何可靠的存储设备。 打包Java项目:你可以使用tar命令将整个Java项目打包成一个压缩文件。例如,如果你的项目位于/home/usernam…

    2026年9月24日
    000
  • 抖音怎么看直播回放?小米14抖音怎么看别人的直播回放

    短视频平台已成为现代生活的重要组成部分。抖音作为国内领先的短视频平台,凭借其独特的直播功能吸引了众多用户。然而,有时因时间冲突等原因未能及时观看直播,令人遗憾。本文将为您深入解析抖音直播回放功能,助您不错过任何精彩瞬间。 一、抖音直播回放的优势 1. 再次欣赏 通过抖音直播回放,用户可在直播结束后随…

    2026年9月24日
    000
  • Chrome浏览器怎么用快捷键切换标签页_常用标签页切换快捷键大全

    Chrome浏览器怎么用快捷键切换标签页_常用标签页切换快捷键大全Chrome浏览器怎么用快捷键切换标签页_常用标签页切换快捷键大全Chrome浏览器怎么用快捷键切换标签页_常用标签页切换快捷键大全Chrome浏览器怎么用快捷键切换标签页_常用标签页切换快捷键大全

    掌握Chrome快捷键可快速切换标签页:Ctrl+Tab循环切换下一标签,Ctrl+Shift+Tab切换上一标签,Ctrl+数字键直接跳转指定位置,Ctrl+Page Down/Up也可实现上下标签切换。 如果您在浏览网页时打开了多个标签页,想要快速在它们之间进行切换,掌握Chrome浏览器的快捷…

    2026年9月24日 • 用户投稿
    200
  • AI工具+自动发布系统:打造不熬夜的新媒体工作流

    AI工具+自动发布系统:打造不熬夜的新媒体工作流AI工具+自动发布系统:打造不熬夜的新媒体工作流AI工具+自动发布系统:打造不熬夜的新媒体工作流AI工具+自动发布系统:打造不熬夜的新媒体工作流

    ai工具和自动发布系统能高效提升新媒体运营效率,解放时间和精力。①ai可生成文案、分析数据、优化内容;②自动发布系统支持定时发布,避免遗漏;③选择ai工具需明确需求、试用对比;④使用时注意平台兼容性、账号安全;⑤配合标准化流程、批量处理等技巧,兼顾质量与效率。 ☞☞☞AI 智能聊天, 问答助手, A…

    2026年9月24日 • 用户投稿
    000
  • FydeOS v21 发布,升级至 r138,更强的启动器、即圈即搜和无障碍功能

    FydeOS v21 发布,升级至 r138,更强的启动器、即圈即搜和无障碍功能FydeOS v21 发布,升级至 r138,更强的启动器、即圈即搜和无障碍功能FydeOS v21 发布,升级至 r138,更强的启动器、即圈即搜和无障碍功能FydeOS v21 发布,升级至 r138,更强的启动器、即圈即搜和无障碍功能

    我们隆重推出 FydeOS v21:Sunlit Epiphany 正式版本!此次发布带来了众多全新功能、更流畅的操作体验以及更强的系统稳定性——致力于为你打造更加高效且精致的使用感受。本次更新还将底层 Chromium OS 从 r132 升级至 r138,让你第一时间获得最新的性能优化与安全补丁…

    2026年9月24日 • 用户投稿
    000
  • windows怎么查看端口被哪个进程占用_查看端口占用进程的方法

    windows怎么查看端口被哪个进程占用_查看端口占用进程的方法windows怎么查看端口被哪个进程占用_查看端口占用进程的方法windows怎么查看端口被哪个进程占用_查看端口占用进程的方法windows怎么查看端口被哪个进程占用_查看端口占用进程的方法

    使用netstat命令可查端口占用,通过PID和tasklist找到对应进程;2. PowerShell用Get-NetTCPConnection和Get-Process获取进程详情;3. 资源监视器图形化查看监听端口及进程名;4. 第三方工具TcpView实时显示并管理端口占用。 如果您在使用Wi…

    2026年9月24日 • 用户投稿
    100
  • 贝壳找房App如何筛选楼层和朝向_贝壳找房楼层朝向筛选方法

    贝壳找房App如何筛选楼层和朝向_贝壳找房楼层朝向筛选方法贝壳找房App如何筛选楼层和朝向_贝壳找房楼层朝向筛选方法贝壳找房App如何筛选楼层和朝向_贝壳找房楼层朝向筛选方法贝壳找房App如何筛选楼层和朝向_贝壳找房楼层朝向筛选方法

    在贝壳找房App中筛选楼层和朝向可快速精准找房。1. 进入二手房或新房页面,点击“筛选”按钮;2. 在“楼层”选项中选择低、中、高楼层或排除顶层/底层;3. 在“朝向”中勾选南、南北通透等偏好;4. 确认后列表仅显示匹配房源;5. 进入详情页查看具体楼层位置、总楼层及朝向信息,结合户型图判断采光。操…

    2026年9月24日 • 用户投稿
    000
  • sublime怎么给代码添加书签并快速跳转_sublime书签功能使用与跳转技巧

    sublime怎么给代码添加书签并快速跳转_sublime书签功能使用与跳转技巧sublime怎么给代码添加书签并快速跳转_sublime书签功能使用与跳转技巧sublime怎么给代码添加书签并快速跳转_sublime书签功能使用与跳转技巧sublime怎么给代码添加书签并快速跳转_sublime书签功能使用与跳转技巧

    Sublime Text的书签功能通过F12添加/删除书签,Ctrl/Cmd+F12在书签间跳转,并支持通过菜单查看、管理及清除所有书签,提升代码导航效率。 Sublime Text 的书签功能可以帮助开发者在代码中快速标记关键位置,并实现一键跳转,特别适合处理大型文件或频繁切换代码段的场景。使用书…

    2026年9月24日 • 用户投稿
    100
  • VSCode如何设置代码缩进和制表符 VSCode缩进与制表符的自定义调整方法

    要解决vscode缩进混乱问题,需将”editor.detectindentation”设为false,避免自动检测干扰;2. 统一使用空格或制表符的关键在于团队一致性,推荐通过settings.json明确设置”editor.insertspaces&#8221…

    2026年9月24日
    100
  • UC浏览器网页加载不全是什么原因_UC浏览器网页加载不全原因及解决方法

    网页显示不全可依次检查网络、清除缓存、关闭省流模式、更新浏览器或修改DNS。首先确认Wi-Fi信号稳定,尝试切换网络;进入UC浏览器“设置”清除缓存与Cookie;关闭“省流加速”功能并重启;更新至最新版本或重装应用;最后通过静态IP设置DNS为8.8.8.8和8.8.4.4以优化解析。 如果您在使…

    2026年9月24日
    300
  • 如何在Java中实现CompletableFuture异步任务

    CompletableFuture 提供非阻塞异步编程,支持链式调用与任务组合,通过 supplyAsync/runAsync 创建任务,thenApply/thenAccept/thenRun 连接操作,allOf/anyOf 管理多任务,exceptionally/handle 处理异常,避免阻…

    2026年9月24日
    1100
  • DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价

    DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价

    深度求索正式推出 deepseek-v3.2-exp 模型,该版本为实验性(experimental)更新。 作为通向新一代架构的过渡性尝试,V3.2-Exp 在 V3.1-Terminus 的基础上集成了 DeepSeek Sparse Attention(DSA),引入了一种创新的稀疏注意力机制…

    2026年9月24日 • 用户投稿
    500
  • 全彩3D漫画汉化资源汇总_ACG漫画在线观看地址

    全彩3D漫画汉化资源汇总_ACG漫画在线观看地址全彩3D漫画汉化资源汇总_ACG漫画在线观看地址全彩3D漫画汉化资源汇总_ACG漫画在线观看地址全彩3D漫画汉化资源汇总_ACG漫画在线观看地址

    全彩3D漫画汉化资源可通过manwa.size/booklist平台获取,该网站汇集日漫、韩漫及国创全彩漫画,支持下拉式阅读,界面简洁且适配多端,无需下载即可在线流畅观看。 全彩3D漫画汉化资源汇总_ACG漫画在线观看地址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来全彩3D漫画汉化资源…

    2026年9月24日 • 用户投稿
    600

发表回复

登录后才能评论
关注微信