Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用 Python 和 Boto3 库高效统计 AWS S3 存储桶中特定文件_创想鸟

使用 Python 和 Boto3 库高效统计 AWS S3 存储桶中特定文件

使用 python 和 boto3 库高效统计 aws s3 存储桶中特定文件

本教程详细介绍了如何使用 Python 和 Boto3 库高效地统计 AWS S3 存储桶中符合特定命名模式的文件数量。文章重点阐述了 boto3.resource 相较于 boto3.client 在处理 S3 对象列表和分页方面的优势,并提供了结合前缀过滤与客户端精确匹配的完整代码示例,帮助用户实现自动化文件校验与管理。

引言:S3 文件计数挑战

在 AWS S3(Simple Storage Service)中管理大量文件时,经常需要统计特定目录或符合特定命名规则的文件数量。例如,对于视频切片存储场景,可能需要验证每个视频质量版本(如 144p, 360p)下是否存在预期数量的切片文件(如 file_000.ts, file_001.ts 等)。手动检查这些文件既耗时又容易出错,因此编写自动化脚本变得尤为重要。

Python 的 boto3 库是与 AWS 服务交互的官方 SDK,提供了强大的功能来操作 S3。然而,在使用 boto3 进行文件计数时,尤其是在文件数量庞大且分散在多个“文件夹”中时,需要注意一些关键点,如分页处理和精确的文件名匹配。

传统 boto3.client 方法的局限性

在最初尝试使用 boto3.client().list_objects_v2 方法时,可能会遇到以下挑战:

手动分页处理:list_objects_v2 每次请求最多返回 1000 个对象。如果 S3 路径下的文件数量超过此限制,需要通过检查响应中的 IsTruncated 字段和使用 NextContinuationToken 参数来手动迭代所有页面,才能获取完整的对象列表。若未正确处理分页,将导致计数不完整。不精确的过滤:list_objects_v2 的 Prefix 参数用于服务器端初步过滤,但它只能匹配对象键的开头。如果需要根据对象键的中间或结尾部分进行更复杂的匹配(例如,匹配所有以 file_ 开头且以 .ts 结尾的文件),则需要在客户端(即 Python 脚本中)对返回的对象列表进行二次过滤。原始尝试中 obj[‘Key’].startswith(‘file_000.ts’) 过于具体,无法统计所有 file_*.ts 文件。S3 路径解析:S3 中的“文件夹”实际上是对象键的一部分。例如,s3://bucket/folder/subfolder/file.txt 中,folder/subfolder/ 是 file.txt 对象键的一部分。在构建 Prefix 时,需要确保其与 S3 对象的实际键结构匹配。

推荐方案:使用 boto3.resource 进行高效计数

boto3.resource 接口提供了更高级别的抽象,相较于 boto3.client,它更面向对象,并能自动处理许多底层细节,包括分页。这使得代码更简洁、更易读。

立即学习“Python免费学习笔记(深入)”;

1. boto3.resource 的优势

自动分页:resource 对象(如 bucket.objects.filter())在迭代时会自动处理分页,无需手动管理 ContinuationToken。更 Pythonic 的接口:提供了更直观的方法和属性来访问 S3 桶和对象。

2. 基本计数示例

以下是一个使用 boto3.resource 统计 S3 桶中特定前缀下,符合 file_*.ts 模式文件数量的基本函数:

import boto3def count_specific_files_in_s3(bucket_name, s3_prefix, file_name_starts_with='file_', file_name_ends_with='.ts'):    """    统计S3桶中指定前缀下,符合特定命名模式的文件数量。    Args:        bucket_name (str): S3 桶的名称。        s3_prefix (str): 要搜索的S3前缀(即“文件夹”路径)。                         例如:'Financial_Freedom_Course_Kannada/00_Course_Trailer_New_update/144p/'        file_name_starts_with (str): 文件名应以此字符串开头。        file_name_ends_with (str): 文件名应以此字符串结尾。    Returns:        int: 符合条件的文件数量。    """    s3 = boto3.resource('s3')    bucket = s3.Bucket(bucket_name)    actual_count = 0    print(f"正在检查 S3 路径: s3://{bucket_name}/{s3_prefix}...")    # 使用 Prefix 进行服务器端初步过滤    # bucket.objects.filter() 会自动处理分页    for obj in bucket.objects.filter(Prefix=s3_prefix):        # 进一步在客户端过滤,确保符合命名约定且不是S3模拟的文件夹对象        # S3中没有真正的文件夹,以'/'结尾的键通常被视为文件夹        if obj.key.startswith(f'{s3_prefix}{file_name_starts_with}') and            obj.key.endswith(file_name_ends_with) and            not obj.key.endswith('/'): # 排除S3模拟的文件夹对象            actual_count += 1            # print(f"  找到匹配文件: {obj.key}") # 可用于调试    return actual_count# 示例用法 (请替换为您的实际桶名和前缀)# fixed_bucket_name = 'your-s3-bucket-name'# example_prefix = 'your-folder-path/sub-folder/'# count = count_specific_files_in_s3(fixed_bucket_name, example_prefix)# print(f"在 s3://{fixed_bucket_name}/{example_prefix} 路径下找到 {count} 个文件。")

3. 深入理解 Prefix 和 Key 过滤

Prefix 参数: 这是 S3 服务端提供的过滤机制。它能有效地减少从 S3 传输到本地的数据量,提高效率。当您指定 Prefix=’path/to/folder/’ 时,S3 只会返回键以 path/to/folder/ 开头的对象。obj.key 客户端过滤: 尽管 Prefix 很有用,但它可能不足以满足所有复杂的过滤需求。例如,您可能需要匹配文件名的特定模式,或者排除某些类型的文件。这时,您需要在 Python 代码中对 obj.key 属性进行字符串操作(如 startswith(), endswith(), in 或正则表达式)来精确匹配所需的文件。在上述示例中,我们结合了 startswith(f'{s3_prefix}{file_name_starts_with}’) 和 endswith(file_name_ends_with) 来实现精确匹配,并排除了以 / 结尾的“文件夹”对象。

整合到实际应用场景:批量校验 S3 视频切片

结合原始问题中从 CSV 读取 URL 并写入结果的需求,我们可以构建一个完整的脚本来自动化这一过程。

假设 ldt_ffw_course_videos_temp.csv 文件包含以下结构:

course_video_s3_url,course_video_ts_file_cntFinancial_Freedom_Course_Kannada/00_Course_Trailer_New_update/144p/,28Financial_Freedom_Course_Kannada/00_Course_Trailer_New_update/360p/,54Financial_Freedom_Course_Kannada/00_Course_Trailer_New_update/720p/,34

其中 course_video_s3_url 是相对于 S3 桶根目录的路径,course_video_ts_file_cnt 是该路径下期望的文件数量。

import csvimport boto3from urllib.parse import urlparse # 用于解析S3 URL,如果需要# 辅助函数:解析 S3 URL 获取桶名和前缀 (如果输入CSV中是完整S3 URL)def parse_s3_url(s3_url):    """从完整的S3 URL中解析出桶名和前缀路径。"""    parsed = urlparse(s3_url)    if parsed.scheme != 's3':        raise ValueError("URL 必须以 's3://' 开头。")    bucket_name = parsed.netloc    # path 包含前导斜杠,需要去除    prefix = parsed.path.lstrip('/')    return bucket_name, prefix# 改进的计数函数 (与上面示例相同)def count_specific_files_in_s3(bucket_name, s3_prefix, file_name_starts_with='file_', file_name_ends_with='.ts'):    s3 = boto3.resource('s3')    bucket = s3.Bucket(bucket_name)    actual_count = 0    for obj in bucket.objects.filter(Prefix=s3_prefix):        if obj.key.startswith(f'{s3_prefix}{file_name_starts_with}') and            obj.key.endswith(file_name_ends_with) and            not obj.key.endswith('/'):            actual_count += 1    return actual_count# 输入和输出 CSV 文件名input_csv_file = 'ldt_ffw_course_videos_temp.csv'output_csv_file = 'file_count_result.csv'# 假设 S3 桶名是固定的。请替换为您的实际桶名。# 如果您的CSV中包含完整的S3 URL (如 s3://bucket-name/path/...), 则可以使用 parse_s3_url 函数动态获取桶名。fixed_bucket_name = 'coursevideotesting' # 替换为你的S3桶名# 主处理逻辑try:    with open(input_csv_file, mode='r', encoding='utf-8') as infile,          open(output_csv_file, mode='w', newline='', encoding='utf-8') as outfile:        reader = csv.DictReader(infile)        # 验证输入CSV文件是否包含必要的列        required_columns = ['course_video_s3_url', 'course_video_ts_file_cnt']        if not all(col in reader.fieldnames for col in required_columns):            raise ValueError(f"输入CSV文件必须包含以下列: {', '.join(required_columns)}")        #

以上就是使用 Python 和 Boto3 库高效统计 AWS S3 存储桶中特定文件的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1368294.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
在Python asyncio应用中优雅地运行后台协程任务
上一篇 2025年12月14日 08:39:35
实时控制音频播放:基于PyAudio的无固定时长声音生成与停止
下一篇 2025年12月14日 08:39:44

相关推荐

  • AI图片优化修复有哪些 AI图片优化修复工具汇总

    AI图片优化修复有哪些 AI图片优化修复工具汇总AI图片优化修复有哪些 AI图片优化修复工具汇总AI图片优化修复有哪些 AI图片优化修复工具汇总AI图片优化修复有哪些 AI图片优化修复工具汇总

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 吐司AI高清 由吐司AI开发的图像清晰化与修复服务 绘蛙AI高清 绘蛙平台推出的AI图像高清修复功能 稿定AI变清晰 稿定设计提供的AI图像清晰增强处理工具 Facet 用于AI图像修饰和质量提…

    2026年9月25日 • 用户投稿
    000
  • 苹果壁纸设计网页正版访问_苹果壁纸设计网页直达入口

    苹果壁纸设计网页正版访问_苹果壁纸设计网页直达入口苹果壁纸设计网页正版访问_苹果壁纸设计网页直达入口苹果壁纸设计网页正版访问_苹果壁纸设计网页直达入口苹果壁纸设计网页正版访问_苹果壁纸设计网页直达入口

    苹果壁纸设计网页正版访问入口是http://eyu.zaixian-fanyi.com/fan_wei_13269529,该平台提供海量高清壁纸、支持用户上传分享、内置编辑工具并定期更新主题内容,界面简洁流畅,支持一键收藏与多设备同步,同时整合设计模板、贴纸素材与艺术字体,提升创作灵活性。 苹果壁纸…

    2026年9月25日 • 用户投稿
    000
  • 夸克浏览器PC版怎么下载安装_夸克浏览器电脑版下载与安装全流程

    夸克浏览器PC版怎么下载安装_夸克浏览器电脑版下载与安装全流程夸克浏览器PC版怎么下载安装_夸克浏览器电脑版下载与安装全流程夸克浏览器PC版怎么下载安装_夸克浏览器电脑版下载与安装全流程夸克浏览器PC版怎么下载安装_夸克浏览器电脑版下载与安装全流程

    首先访问夸克官网下载电脑版安装包,运行QuarkSetup.exe完成安装并创建快捷方式,最后启动浏览器登录阿里系账号同步数据并进行个性化设置。 如果您尝试在电脑上使用夸克浏览器,但尚未安装其桌面版本,则需要完成下载与安装流程。以下是解决此问题的步骤: 本文运行环境:联想小新Air 14,Windo…

    2026年9月25日 • 用户投稿
    000
  • safari浏览器如何管理和删除Cookie_safari浏览器Cookie管理和删除方法

    清除或管理Safari浏览器的Cookie可解决网页加载异常、登录状态丢失等问题。1、通过“设置-隐私-管理网站数据”可查看并删除特定网站的Cookie;2、点击“移除全部”可彻底清除所有Cookie,重置浏览状态;3、勾选“阻止所有Cookie”能增强隐私保护,但会影响网站正常功能;4、使用“无痕…

    2026年9月25日
    100
  • 解决JavaFX应用导出为可运行JAR后FXMLLoader资源加载失败的问题

    解决JavaFX应用导出为可运行JAR后FXMLLoader资源加载失败的问题解决JavaFX应用导出为可运行JAR后FXMLLoader资源加载失败的问题解决JavaFX应用导出为可运行JAR后FXMLLoader资源加载失败的问题解决JavaFX应用导出为可运行JAR后FXMLLoader资源加载失败的问题

    本文旨在解决JavaFX应用在Eclipse中正常运行,但导出为可运行JAR包后,因FXMLLoader无法找到FXML资源文件而抛出IllegalStateException: Location is not set异常的问题。核心解决方案是调整FXMLLoader.setLocation()方法…

    2026年9月25日 • 用户投稿
    100
  • iQOO Z10 Turbo+ 续航登顶各大榜单 8000mAh 电池绝了

    iQOO Z10 Turbo+ 续航登顶各大榜单 8000mAh 电池绝了iQOO Z10 Turbo+ 续航登顶各大榜单 8000mAh 电池绝了iQOO Z10 Turbo+ 续航登顶各大榜单 8000mAh 电池绝了iQOO Z10 Turbo+ 续航登顶各大榜单 8000mAh 电池绝了

    8 月 4 日,iqoo 产品团队公布了 iqoo z10 turbo+ 的续航测试成绩,该机凭借出色的续航表现强势登顶多家主流媒体榜单,引发广泛关注。搭载 8000mah 超大容量蓝海电池与联发科最新旗舰芯片天玑 9400+,iqoo z10 turbo+ 成为兼顾高性能与持久续航用户的理想之选。…

    2026年9月25日 • 用户投稿
    100
  • 快手 Kwaipilot 团队发布两款 KAT 系列 Agentic Coding 大模型

    快手 Kwaipilot 团队发布两款 KAT 系列 Agentic Coding 大模型快手 Kwaipilot 团队发布两款 KAT 系列 Agentic Coding 大模型快手 Kwaipilot 团队发布两款 KAT 系列 Agentic Coding 大模型快手 Kwaipilot 团队发布两款 KAT 系列 Agentic Coding 大模型

    快手 kwaipilot 团队近日推出了两款全新的 kat 系列 agentic coding 大模型,标志着在代码智能领域的重大突破:开源的 32b 参数模型 kat-dev-32b 以及闭源的旗舰级模型 kat-coder。 据悉,这两款模型在代码理解与生成方面分别展现了卓越的轻量化性能与顶级的…

    2026年9月25日 • 用户投稿
    200
  • Deepseek 满血版联合 Scribble Diffusion Pro,绘制专业级图像​

    Deepseek 满血版联合 Scribble Diffusion Pro,绘制专业级图像​Deepseek 满血版联合 Scribble Diffusion Pro,绘制专业级图像​Deepseek 满血版联合 Scribble Diffusion Pro,绘制专业级图像​Deepseek 满血版联合 Scribble Diffusion Pro,绘制专业级图像​

    使用deepseek满血版配合scribble diffusion pro可高效进行专业图像创作。1. scribble diffusion pro是基于草图生成高质量图像的插件,适合已有初步构图的创作者;2. deepseek提供更强文本理解与细节控制能力,提升风格、光影等描述精准度;3. 高效使…

    2026年9月25日 • 用户投稿
    200
  • Debian Apache日志对SEO有何影响

    debian apache日志记录了网站的所有访问请求,包括ip地址、请求类型、响应状态等详细信息。这些日志对于seo有以下几个方面的影响: SEO GPT 免费的白帽SEO,PPC和网站经销商平台 17 查看详情 Apache日志对SEO的重要性 监控网站流量和用户行为:通过分析Apache访问日…

    2026年9月25日
    000
  • Java多态中成员变量是否具有动态绑定特性

    成员变量不具有动态绑定特性,其访问基于引用变量的声明类型而非实际对象类型。例如,当父类和子类存在同名成员变量时,通过父类引用访问该变量将获取父类中的值,即使实际对象是子类实例。这体现了静态绑定,即在编译期确定访问的变量。相比之下,实例方法支持动态绑定(后期绑定),在运行时根据对象的实际类型决定调用哪…

    2026年9月25日
    100
  • 摩尔线程科创板上市 IPO 已过会,冲刺“国产 GPU 第一股”

    摩尔线程科创板上市 IPO 已过会,冲刺“国产 GPU 第一股”摩尔线程科创板上市 IPO 已过会,冲刺“国产 GPU 第一股”摩尔线程科创板上市 IPO 已过会,冲刺“国产 GPU 第一股”摩尔线程科创板上市 IPO 已过会,冲刺“国产 GPU 第一股”

    2025 年 9 月 26 日,上交所官方网站信息显示,摩尔线程智能科技(北京)股份有限公司(简称“摩尔线程”)的科创板 ipo 项目已顺利通过上市委审议,保荐机构为中信证券股份有限公司。 从正式提交申请获上交所受理,到成功过会,摩尔线程历时不足三个月,创下科创板企业上市审核速度的新纪录。本次IPO…

    2026年9月25日 • 用户投稿
    100
  • 2025 上半年中国蓝牙耳机市场份额出炉:小米第一

    2025 上半年中国蓝牙耳机市场份额出炉:小米第一2025 上半年中国蓝牙耳机市场份额出炉:小米第一2025 上半年中国蓝牙耳机市场份额出炉:小米第一2025 上半年中国蓝牙耳机市场份额出炉:小米第一

    根据 idc 最新发布的数据,2025 年上半年中国蓝牙耳机市场出货量约为 5998 万台,同比增长 7.5%。其中,小米以 16.5% 的市场份额位居榜首。值得注意的是,耳夹式耳机在 2025 年上半年的市场规模与增速首次超越耳挂式产品,实现出货量 651 万台,同比增长高达 41.0%。 小米耳…

    2026年9月25日 • 用户投稿
    200
  • Java 中处理货币数据的正确方式

    Java 中处理货币数据的正确方式Java 中处理货币数据的正确方式Java 中处理货币数据的正确方式Java 中处理货币数据的正确方式

    在 Java 应用程序中,尤其是在处理财务数据时,选择正确的数据类型至关重要。货币数据通常以特定的格式呈现,例如包含货币符号(如美元符号 $)和千位分隔符(如逗号 ,)。直接将这些数据映射到 DTO 类时,我们需要仔细考虑数据类型的选择,以避免潜在的精度损失和计算错误。 货币数据类型选择考量 常见的…

    2026年9月25日 • 用户投稿
    000
  • 如何在Debian上检测Nginx SSL状态

    在debian系统上检测nginx的ssl状态,可以通过以下几种方法进行: 使用Nginx命令行工具:打开终端,输入以下命令来检查Nginx的SSL配置是否正确: sudo nginx -t -c /etc/nginx/nginx.conf 这个命令会测试Nginx配置文件的语法是否正确,并且会显示…

    2026年9月25日
    000
  • AI思维导图工具有哪些_好用的AI思维导图工具大全

    AI思维导图工具有哪些_好用的AI思维导图工具大全AI思维导图工具有哪些_好用的AI思维导图工具大全AI思维导图工具有哪些_好用的AI思维导图工具大全AI思维导图工具有哪些_好用的AI思维导图工具大全

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ TreeMind树图:新一代AI智能思维导图,一句话生成思维导图 博思白板:博思云创推出的AI多功能白板工具 ProcessOn:在线AI流程图和思维导图制作工具 自由画布:百度文库和百度网盘联…

    2026年9月25日 • 用户投稿
    000
  • 幕布新手入门教程:从零开始创建你的第一个文档

    幕布新手入门教程:从零开始创建你的第一个文档幕布新手入门教程:从零开始创建你的第一个文档幕布新手入门教程:从零开始创建你的第一个文档幕布新手入门教程:从零开始创建你的第一个文档

    首先注册登录幕布账号,进入主界面后点击新建文档并输入标题,通过回车创建节点、Tab键调整层级,利用快捷键提升效率,最后插入待办、加粗、链接等富文本内容完成结构化笔记。 如果您刚刚开始使用幕布,想要快速上手并创建属于自己的第一份结构化文档,可以通过以下步骤完成基础操作。幕布以大纲笔记为核心,帮助用户高…

    2026年9月25日 • 用户投稿
    000
  • Java 中处理货币数据的最佳实践

    Java 中处理货币数据的最佳实践Java 中处理货币数据的最佳实践Java 中处理货币数据的最佳实践Java 中处理货币数据的最佳实践

    本文旨在探讨在 Java 中处理货币数据的最佳实践。面对 JSON 数据中包含的货币值(例如 “$234,205,860″),直接使用 String 存储是一种选择,但可能并非最优。本文将深入分析各种数据类型在处理货币时的优劣,并推荐使用 BigDecimal 进行精确计算,…

    2026年9月25日 • 用户投稿
    000
  • 苹果13pro参数详细参数

    苹果13pro参数详细参数苹果13pro参数详细参数苹果13pro参数详细参数苹果13pro参数详细参数

    iPhone 13 Pro 拥有 1200 万像素的后置广角、超广角和长焦摄像头,以及 1200 万像素的前置摄像头。后置摄像头支持光学图像稳定和电影模式,前置摄像头支持人像模式。手机搭载苹果 A15 仿生芯片,具有 128GB 至 1TB 的存储容量。 ☞☞☞☞点击夸克ai手把手教你,操作像呼吸一…

    2026年9月25日 • 用户投稿
    000
  • 首个开源多模态 Deep Research 智能体,超越多个闭源方案

    首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案首个开源多模态 Deep Research 智能体,超越多个闭源方案

    研究团队 投稿 量子位 | 公众号 QbitAI 首个开源多模态 Deep Research Agent 来了。 整合了网页浏览、图像搜索、代码解释器、内部 OCR 等多种工具,通过全自动流程生成高质量推理轨迹,并用冷启动微调和强化学习优化决策,使模型在任务中能自主选择合适的工具组合和推理路径。 假…

    2026年9月25日 • 用户投稿
    100
  • 【每日收评】集微指数跌0.99%,蔚来宣布完成高速换电千站计划

    【每日收评】集微指数跌0.99%,蔚来宣布完成高速换电千站计划【每日收评】集微指数跌0.99%,蔚来宣布完成高速换电千站计划【每日收评】集微指数跌0.99%,蔚来宣布完成高速换电千站计划【每日收评】集微指数跌0.99%,蔚来宣布完成高速换电千站计划

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 7月9日,A股三大指数今日冲高回落,沪指3500点得而复失。截止收盘,沪指跌0.13%,收报3493.05点;深证成指跌0.06%,收报10581.80点;创业板指涨0.16%,收报2184.6…

    2026年9月25日 • 用户投稿
    100

发表回复

登录后才能评论
关注微信