从Google Spreadsheet URL获取文件名称的Python教程

程序猿 • 2025年12月14日 12:18:33 • 用户投稿 • 阅读 0

本教程详细介绍了如何通过编程方式从Google Spreadsheet的导出URL中提取其文件名称。主要方法是利用HTTP Content-Disposition响应头，通过requests库发送GET请求并解析头部信息。文章还提供了使用urllib.parse.unquote处理编码字符的示例，并简要提及了使用Google Drive API作为更强大的替代方案，适用于需要更高级访问控制的场景。

概述与问题背景

在使用pandas等库处理google spreadsheet数据时，我们常常需要将导入的数据保存为本地文件，并希望以原始的电子表格名称来命名这些文件，以保持一致性和描述性。然而，pd.read_excel()函数本身无法直接从google spreadsheet的url中提取其原始名称。本教程将探讨两种主要方法来解决这一问题：通过http请求头解析和通过google drive api。

方法一：通过HTTP请求头获取文件名称

当通过浏览器或HTTP客户端访问Google Spreadsheet的导出URL时，服务器会在响应头中包含文件的元数据，其中就包括文件名。我们可以利用Python的requests库来模拟这一过程，并解析Content-Disposition头信息。

核心原理

Google Spreadsheet的导出URL通常是这样的格式：https://docs.google.com/spreadsheets/d/{sheet_id}/export?format=xlsx。当我们向这个URL发送GET请求时，服务器的响应头会包含一个Content-Disposition字段，其值类似于attachment; filename*=UTF-8”文件名.xlsx。我们可以从这个字段中提取出文件的名称。

示例代码

以下是使用requests库获取文件名称的Python代码：

import pandas as pdimport requestsfrom urllib.parse import unquote# 假设用户输入Google Spreadsheet的完整URL# 例如: https://docs.google.com/spreadsheets/d/123abcDEF_GHIjKLM_NopQRS/edit#gid=0link = input("请输入Google Spreadsheet的URL: ")# 从URL中提取sheet_id# 假设URL格式是标准的Google Sheets URLtry:    link_parts = link.split('/')    sheet_id = link_parts[5]    print(f"提取到的Spreadsheet ID: {sheet_id}")except IndexError:    print("URL格式不正确，无法提取Sheet ID。请确保URL包含'/d/sheet_id/'。")    exit()# 构建导出URLexport_url = f"https://docs.google.com/spreadsheets/d/{sheet_id}/export?format=xlsx"try:    # 发送GET请求获取响应头    r = requests.get(export_url)    r.raise_for_status() # 检查请求是否成功    # 打印完整的Content-Disposition头信息    print(f"Content-Disposition: {r.headers.get('content-disposition')}")    # 从Content-Disposition头中提取文件名    content_disposition = r.headers.get('content-disposition')    if content_disposition:        # 查找 'filename*=UTF-8'' 后面的部分        # 有些情况下可能是 filename="文件名.xlsx"        if "filename*=UTF-8''" in content_disposition:            # 提取并解码文件名，然后移除 .xlsx 后缀            encoded_filename = content_disposition.split("filename*=UTF-8''")[1]            filename_with_extension = unquote(encoded_filename)            filename = filename_with_extension.replace(".xlsx", "")        elif "filename=" in content_disposition:            # 处理不带UTF-8编码的旧格式或不同格式            filename_part = content_disposition.split("filename=")[1]            # 移除双引号并解码（如果有的话）            filename_with_extension = unquote(filename_part.strip('"'))            filename = filename_with_extension.replace(".xlsx", "")        else:            filename = "未知文件"            print("Content-Disposition头中未找到文件名信息。")    else:        filename = "未知文件"        print("响应头中未找到Content-Disposition信息。")    print(f"提取到的文件名称: {filename}")    # 接下来可以使用这个文件名来保存数据    # 例如：    # sheet_data = pd.read_excel(export_url, header=0)    # sheet_data.to_csv(f"{filename}.csv", index=False)    # print(f"数据已成功保存为 {filename}.csv")except requests.exceptions.RequestException as e:    print(f"请求发生错误: {e}")    print("请确保Google Spreadsheet已公开共享，或检查URL是否正确。")except Exception as e:    print(f"处理过程中发生错误: {e}")

注意事项

公开共享: 这种方法要求Google Spreadsheet必须设置为“公开”或至少“知道链接的人可以查看”。如果电子表格是私有的，requests.get()请求将无法成功获取内容，也无法得到Content-Disposition头。URL编码: 文件名中可能包含特殊字符或非ASCII字符，这些字符在HTTP头中会被URL编码。使用urllib.parse.unquote函数可以正确解码这些字符，确保获取到原始的文件名。错误处理: 务必添加错误处理机制，例如try-except块，以应对网络问题、URL格式错误或电子表格权限不足等情况。

方法二：使用Google Drive API（更强大、更灵活）

对于需要处理私有电子表格、或者需要更精细的权限控制和元数据获取的场景，使用Google Drive API是更健壮的选择。Google Drive API允许我们通过身份验证来访问用户的Google Drive文件，包括电子表格的元数据（如名称、创建时间、修改时间等）。

立即学习“Python免费学习笔记（深入）”；

核心原理

通过Google Drive API，我们可以使用files.get方法来查询特定文件（Google Spreadsheet也是一种文件）的元数据。这需要进行OAuth 2.0身份验证，并提供API Key或OAuth凭据。

示例代码（需要API Key或OAuth认证）

以下是一个使用API Key获取文件名称的简化示例。请注意，实际应用中通常会使用OAuth 2.0进行用户授权，而不是直接使用API Key来访问私人文件。

import requestsimport json# 请替换为您的Google API Key# 访问 Google Cloud Console (console.cloud.google.com) 创建项目并启用 Drive API，然后生成API Keyapi_key = "YOUR_API_KEY" # 请替换为您的Google Spreadsheet ID# 例如: https://docs.google.com/spreadsheets/d/YOUR_SPREADSHEET_ID/editspreadsheet_id = "YOUR_SPREADSHEET_ID" if api_key == "YOUR_API_KEY" or spreadsheet_id == "YOUR_SPREADSHEET_ID":    print("请设置您的API Key和Spreadsheet ID。")else:    api_url = f"https://www.googleapis.com/drive/v3/files/{spreadsheet_id}?key={api_key}&fields=name"    try:        r = requests.get(api_url)        r.raise_for_status() # 检查请求是否成功        response_data = r.json()        filename = response_data.get("name", "未知文件")        print(f"通过Google Drive API获取到的文件名称: {filename}")    except requests.exceptions.RequestException as e:        print(f"API请求发生错误: {e}")        print("请检查API Key是否有效，以及Spreadsheet ID是否正确。")        print(f"API响应: {r.text if 'r' in locals() else '无响应'}")    except json.JSONDecodeError:        print("API响应不是有效的JSON格式。")    except Exception as e:        print(f"处理过程中发生错误: {e}")

注意事项

API Key vs. OAuth: API Key适用于访问公开数据或需要特定服务账户权限的场景。对于访问用户的私有Google Drive文件，您需要实现OAuth 2.0流程，让用户授权您的应用程序访问其数据。这通常涉及创建客户端ID、secret，并处理授权码和访问令牌。启用Drive API: 在Google Cloud Console中，您需要为您的项目启用Google Drive API。权限控制: 通过API，您可以获取文件的各种元数据，而不仅仅是名称。fields=name参数用于限制返回的数据，只获取文件名，提高效率。

总结

获取Google Spreadsheet文件名称的方法取决于您的具体需求和电子表格的访问权限：

对于公开共享的电子表格，通过解析HTTP响应的Content-Disposition头是最直接和轻量级的方法。它不需要额外的API配置或身份验证，适用于快速脚本和一次性任务。对于私有或需要更高级控制的电子表格，使用Google Drive API是更推荐的选择。它提供了强大的身份验证和授权机制，可以访问更丰富的元数据，并与其他Google服务无缝集成。

在实际应用中，建议根据项目的复杂性、安全要求和电子表格的共享状态来选择最合适的方法。

以上就是从Google Spreadsheet URL获取文件名称的Python教程的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1372416.html

ai csv excel go google js json python 浏览器编码网络问题

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

解决Python csv.writer 生成CSV文件中的空白行问题

上一篇 2025年12月14日 12:18:32

Pythonic姓名字符串重排与首字母大写处理

下一篇 2025年12月14日 12:18:39

用户投稿

修复Django电商项目中AJAX过滤产品列表图片不显示问题

在Django电商项目中，当使用AJAX动态加载过滤后的产品列表时，常遇到图片无法正常显示的问题。这通常是由于前端模板中图片加载方式（如data-setbg属性结合JavaScript库）与AJAX动态内容更新机制不兼容所致。解决方案是直接在AJAX返回的HTML中使用标准的标签来渲染图片，确保浏览…

程序猿
2026年5月10日
0000
用户投稿

开源免费PHP工具 PHP开发效率提升利器

推荐开源免费PHP开发工具以提升效率：VS Code、Sublime Text轻量高效，PhpStorm专业强大；调试用Xdebug、Kint、Ray；依赖管理选Composer；代码质量工具包括PHPStan、Psalm、PHP_CodeSniffer；数据库管理可用%ignore_a_1%MyA…

程序猿
2026年5月10日
0000
Matplotlib 地图中多类型图例的创建与优化

本教程旨在解决matplotlib地图可视化中，如何在一个图例中同时展示颜色块（如区域分类）和自定义标记（如特定兴趣点）的问题。文章详细介绍了当传统`patch`对象无法正确显示标记时，如何利用`matplotlib.lines.line2d`创建标记图例句柄，并将其与颜色块图例句柄合并，从而生成一…

程序猿
2026年5月10日 • 用户投稿
1000
用户投稿

Golang JSON序列化：控制敏感字段暴露的最佳实践

本教程探讨golang中如何高效控制结构体字段在json序列化时的可见性。当需要将包含敏感信息的结构体数组转换为json响应时，通过利用`encoding/json`包提供的结构体标签，特别是`json:”-“`，可以轻松实现对特定字段的忽略，从而避免敏感数据泄露，确保api…

程序猿
2026年5月10日
0000
用户投稿

利用海象运算符简化条件赋值：Python教程与最佳实践

本文旨在探讨Python中海象运算符（:=）在条件赋值场景下的应用。通过对比传统if/else语句与海象运算符，以及条件表达式，分析海象运算符在简化代码、提高可读性方面的优势与局限性。并通过具体示例，展示如何在列表推导式等场景下合理使用海象运算符，同时强调其潜在的复杂性及替代方案，帮助开发者更好地掌…

程序猿
2026年5月10日
1000
用户投稿

怎么在PHP代码中实现图片上传功能_PHP图片上传功能实现与安全处理教程

首先创建含enctype的HTML表单，再用PHP接收文件，检查目录、移动临时文件，验证类型与大小，生成唯一文件名，并调整php.ini限制以确保上传成功。如果您尝试在PHP项目中添加图片上传功能，但服务器无法正确接收或保存文件，则可能是由于表单配置、文件处理逻辑或安全限制的问题。以下是实现该功能…

程序猿
2026年5月10日
1000
用户投稿

比特币新手教程比特币交易平台有哪些

比特币是一种去中心化的数字货币，基于区块链技术实现点对点交易，具有匿名性、有限发行和不可篡改等特点；新手可通过交易所购买，P2P交易获得比特币，常用平台包括Binance、OKX和Huobi；交易流程包括注册账户、实名认证、绑定支付方式、充值法币并下单购买，可选择市价单或限价单；比特币存储方式有交易…

程序猿
2026年5月10日
0000
用户投稿

c++中的SFINAE技术是什么_c++模板编程中的SFINAE原理与应用

SFINAE 是“替换失败不是错误”的原则，指模板实例化时若参数替换导致错误，只要存在其他合法候选，编译器不报错而是继续重载决议。它用于条件启用模板、类型检测等场景，如通过 decltype 或 enable_if 控制函数重载，实现类型特征判断。尽管 C++20 引入 Concepts 简化了部分…

程序猿
2026年5月10日
0000
用户投稿

Golang gRPC流式请求异常处理

在Golang的gRPC流式通信中，必须通过context.Context处理异常。应监听上下文取消或超时，及时释放资源，设置合理超时，避免连接长时间挂起，并在goroutine中通过context控制生命周期。在使用 Golang 和 gRPC 实现流式通信时，异常处理是确保服务健壮性的关键部分…

程序猿
2026年5月10日
0000
用户投稿

Go语言mgo查询构建：深入理解bson.M与日期范围查询的正确实践

本文旨在解决go语言mgo库中构建复杂查询时，特别是涉及嵌套`bson.m`和日期范围筛选的常见错误。我们将深入剖析`bson.m`的类型特性，解释为何直接索引`interface{}`会导致“invalid operation”错误，并提供一种推荐的、结构清晰的代码重构方案，以确保查询条件能够正确…

程序猿
2026年5月10日
1000
用户投稿

vscode上怎么运行html_vscode上运行html步骤【指南】

首先保存文件为.html格式，再通过浏览器或Live Server插件打开预览；推荐安装Live Server实现本地服务器运行与实时刷新，提升开发体验。在 VS Code 上运行 HTML 文件并不需要复杂的配置，只需几个简单步骤即可预览页面效果。VS Code 本身是一个代码编辑器，不直接运行…

程序猿
2026年5月10日
1000
用户投稿

RichHandler与Rich Progress集成：解决显示冲突的教程

在使用rich库的`richhandler`进行日志输出并同时使用`progress`组件时，可能会遇到显示错乱或溢出问题。这通常是由于为`richhandler`和`progress`分别创建了独立的`console`实例导致的。解决方案是确保日志处理器和进度条组件共享同一个`console`实例…

程序猿
2026年5月10日
0000
用户投稿

修复点击时按钮抖动：CSS垂直对齐实践

本文探讨了在Web开发中，交互式按钮（如播放/暂停按钮）在点击时发生意外垂直位移的问题。通过分析CSS样式变化对元素布局的影响，我们发现这是由于按钮不同状态下的边框样式和内边距改变，以及默认的垂直对齐行为共同作用所致。核心解决方案是利用CSS的vertical-align属性，将其设置为middle…

程序猿
2026年5月10日
1000
用户投稿

Golang goroutine与channel调试技巧

使用go run -race检测数据竞争，结合runtime.NumGoroutine监控协程数量，通过pprof分析阻塞调用栈，利用select超时避免永久阻塞，有效排查goroutine泄漏、死锁和数据竞争问题。 Go语言的goroutine和channel是并发编程的核心，但它们也带来了调试上…

程序猿
2026年5月10日
0000
《魔兽世界》将于6月11日开启国服回归技术测试

《%ign%ignore_a_1%re_a_1%》官方宣布，将于6月11日开启国服回归技术测试，时间为7天，并称可以在6月内正式开服，玩家们可以访问官网下载战网客户端并预下载“巫妖王之怒”客户端，技术测试详情见下图。 WordAi WordAI是一个AI驱动的内容重写平台 53 查看详情以上就是《…

程序猿
2026年5月10日 • 用户投稿
2000
用户投稿

使用 Jupyter Notebook 进行探索性数据分析

Jupyter Notebook通过单元格实现代码与Markdown结合，支持数据导入（pandas）、清洗（fillna）、探索（matplotlib/seaborn可视化）、统计分析（describe/corr）和特征工程，便于记录与分享分析过程。 Jupyter Notebook 是进行探索性…

程序猿
2026年5月10日
0000
用户投稿

如何在HTML中插入表单元素_HTML表单控件与输入类型使用指南

HTML表单通过标签构建，包含action和method属性定义数据提交目标与方式，常用input类型如text、password、email等适配不同输入需求，配合label、required、placeholder提升可用性，结合textarea、select、button等控件实现完整交互，是…

程序猿
2026年5月10日
1000
用户投稿

前端缓存策略与JavaScript存储管理

根据数据特性选择合适的存储方式并制定清晰的读写与清理逻辑，能显著提升前端性能；合理运用Cookie、localStorage、sessionStorage、IndexedDB及Cache API，结合缓存策略与定期清理机制，可在保证用户体验的同时避免安全与性能隐患。前端缓存和JavaScript存…

程序猿
2026年5月10日
2000
用户投稿

HTML5网页如何实现手势操作 HTML5网页移动端交互的处理技巧

首先利用原生touch事件实现滑动判断，再通过preventDefault解决滚动冲突，接着引入Hammer.js处理复杂手势，最后通过优化点击区域、避免事件冲突和增加视觉反馈提升体验。在移动端浏览器中，HTML5网页可以通过触摸事件实现手势操作，提升用户体验。虽然原生JavaScript提供了基…

程序猿
2026年5月10日
0000
用户投稿

深入理解 Express.js 中 next() 参数的作用与中间件机制

本文深入探讨 express.js 中间件函数中的 `next()` 参数。它负责将控制权传递给请求-响应周期中的下一个中间件或路由处理程序。文章将详细解释 `next()` 的工作原理、中间件的注册与执行顺序，以及不正确使用 `next()` 可能导致请求挂起的风险，并通过代码示例和实际应用场景，…

程序猿
2026年5月10日
0000