
本教程旨在解决使用python `requests`库爬取需要登录的网站时遇到的“406 not acceptable”错误。核心内容是揭示服务器端对http请求头部的验证机制,并提供通过添加或修改关键http头部(如`user-agent`)来模拟浏览器行为的解决方案,确保python爬虫能够成功进行身份验证并获取数据。
在进行网络数据抓取时,尤其是针对需要用户登录的平台,我们经常会遇到请求被服务器拒绝的情况。即使提供了正确的用户名和密码,POST请求也可能返回“406 Not Acceptable”状态码。这通常不是认证信息本身的问题,而是服务器对请求头部的严格校验导致的。许多网站会检查请求的User-Agent等头部信息,以识别并阻止非浏览器发起的自动化请求。
遇到的问题示例
假设我们尝试使用requests库登录一个交易平台(如Plus500),并获取实时市场数据。初始代码可能如下所示:
import requestsfrom pprint import pprint# 假设Config模块中定义了username和password# from Config import username, password # 示例用户名和密码,实际应用中应从安全配置中加载username = "your_email@example.com"password = "YourRandomCode87"def main(): # 目标登录URL,通常包含一些会话或追踪参数 url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login' '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 ' with requests.Session() as session: # 使用session发送POST请求,并尝试进行HTTP基本认证 response = session.post(url, auth=(username, password)) pprint(response.text)if __name__ == '__main__': main()
运行上述代码后,我们可能会得到类似以下的响应:
('{n' ' "status": "Rejected",n' ' "statusCode": "406",n' ' "supportID": "...",n' ' "ipAddress": "my IP",n' ' "timeStamp": "2022-08-27 12:30:47"n' '}')
响应明确指出status: “Rejected”和statusCode: “406”,这意味着服务器拒绝了我们的请求,通常是由于请求的头部不符合服务器的预期。
立即学习“Python免费学习笔记(深入)”;
解决方案:模拟浏览器请求头
解决这类问题的关键在于让我们的Python脚本尽可能地模拟一个真实的浏览器行为。这通常通过在请求中添加或修改HTTP头部信息来实现。最常见的也是最重要的头部是User-Agent,它标识了发出请求的客户端类型。此外,Accept-Encoding、Accept、Accept-Language和Connection等头部也常用于模拟浏览器。
核心HTTP头部解释:
User-Agent: 告诉服务器客户端的类型、操作系统和浏览器版本。这是最常用于识别和过滤自动化请求的头部。Accept-Encoding: 告知服务器客户端支持的编码方式(如gzip, deflate),以便服务器可以压缩响应内容。Accept: 告知服务器客户端能够处理的媒体类型(MIME类型),例如text/html, application/xhtml+xml等。Accept-Language: 告知服务器客户端偏好的语言。Connection: 控制网络连接的选项,keep-alive表示客户端希望保持连接以便后续请求复用。
修正后的代码示例
通过在requests.post方法中添加headers参数,我们可以解决上述问题:
import requestsfrom pprint import pprint# 假设Config模块中定义了username和password# from Config import username, password # 示例用户名和密码,实际应用中应从安全配置中加载username = "your_email@example.com"password = "MyRandomCode87"def main(): url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login' '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 ' # 定义模拟浏览器行为的HTTP头部 headers = { "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:20.0) Gecko/20100101 Firefox/20.0", "Accept-Encoding": "gzip, deflate", "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8", "Accept-Language": "en-US,en;q=0.5", "Connection": "keep-alive" } with requests.Session() as session: # 在POST请求中加入headers参数 response = session.post(url, auth=(username, password), headers=headers) pprint(response.text)if __name__ == '__main__': main()
通过添加这些头部,服务器将更倾向于将我们的请求视为来自合法浏览器,从而允许认证和后续的数据访问。
如何确定必要的HTTP头部
在实际的爬虫开发中,我们可能需要更精确地确定哪些头部是必需的。以下是一些常用的方法:
浏览器开发者工具(Developer Tools):
打开目标网站的登录页面。按F12(或右键点击页面 -> 检查)打开开发者工具。切换到“Network”(网络)选项卡。进行登录操作,观察登录请求(通常是POST请求)。点击该请求,查看其“Request Headers”(请求头部)部分。复制其中关键的头部信息到你的Python代码中。User-Agent是首要关注的,但有时也需要Referer、Origin、Content-Type等。
逐步测试: 如果不确定哪些头部是必需的,可以从User-Agent开始,然后逐步添加其他头部,直到请求成功。
阅读网站的Robots.txt和使用条款: 在进行任何爬取活动之前,务必检查网站的robots.txt文件,了解允许或禁止爬取的部分。同时,仔细阅读网站的服务条款,确保你的行为符合规定,避免不必要的法律风险。
注意事项与最佳实践
尊重网站政策: 始终遵守网站的robots.txt协议和使用条款。未经授权的爬取可能导致IP被封禁,甚至引发法律问题。频率控制: 不要以过高的频率发送请求,这可能被服务器识别为DDoS攻击。使用time.sleep()在请求之间添加延时。异常处理: 编写健壮的代码来处理网络错误、超时、不同的HTTP状态码等异常情况。动态User-Agent: 为了进一步模拟真实用户,可以维护一个User-Agent列表,并在每次请求时随机选择一个。Cookie管理: requests.Session会自动处理Cookie,这对于维护登录状态至关重要。代理IP: 如果IP被封禁,可以考虑使用代理IP池来轮换IP地址。
总结
当使用Python requests库爬取需要登录的网站时遇到“406 Not Acceptable”等拒绝访问的问题,通常是由于请求头部不符合服务器的预期。通过模拟浏览器发送的HTTP头部,特别是User-Agent,可以有效解决这类问题。理解并正确设置这些头部是成功进行网络数据抓取的关键一步。在实践中,结合浏览器开发者工具分析实际请求头,并遵循网络爬取的最佳实践和道德规范,将有助于更高效、更稳定地获取所需数据。
以上就是解决Python Requests爬取登录网站406错误的实战教程的详细内容,更多请关注创想鸟其它相关文章!
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1590351.html
微信扫一扫
支付宝扫一扫