Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Python中高效查找指定子文件夹的策略_创想鸟

Python中高效查找指定子文件夹的策略

python中高效查找指定子文件夹的策略

本文探讨在Python中高效查找特定子文件夹的策略。针对传统os.listdir在大规模目录下性能低下的问题,引入并详细介绍了os.scandir。通过对比分析,阐明os.scandir如何利用系统级优化减少I/O操作,提供更快的目录遍历能力,并给出优化后的代码示例,帮助开发者构建高性能的文件系统操作。

性能瓶颈:传统方法的挑战

在Python中,我们经常需要遍历文件系统来查找符合特定条件的子文件夹。一个常见的做法是结合使用os.listdir和os.path.isdir,并通过正则表达式筛选目标文件夹。然而,对于包含大量(例如数十万)子文件夹的目录,这种方法会遇到显著的性能问题。

考虑以下传统实现方式:

import osimport redef find_subfolders_of_interest_traditional(dir_of_interest, starting_string_of_interest):    # 1. 获取目录下所有文件和文件夹的名称    all_items = os.listdir(dir_of_interest)    # 2. 筛选出所有子文件夹    all_subfolders = [item for item in all_items if os.path.isdir(os.path.join(dir_of_interest, item))]    # 3. 使用正则表达式匹配感兴趣的子文件夹    startWithPattern = starting_string_of_interest    regexp_pattern = re.compile(startsWithPattern)    all_subfolders_of_interest = list(filter(regexp_pattern.match, all_subfolders))    return all_subfolders_of_interest# 示例调用# subfolders = find_subfolders_of_interest_traditional('path/to/your/large/directory', 'prefix_')

这种方法的性能瓶颈主要在于以下两点:

多次系统调用: os.listdir首先执行一次系统调用获取所有条目名称。然后,对于列表中的每个条目,os.path.isdir都会执行另一次系统调用来检查它是否是一个目录。在大型目录中,这意味着成千上万甚至数十万次的独立系统调用,导致I/O开销巨大。内存占用 os.listdir会一次性将目录下的所有条目名称加载到内存中,对于包含大量条目的目录,这可能导致较高的内存消耗。

os.scandir:高效目录遍历的利器

为了解决上述性能问题,Python 3.5 引入了 os.scandir 函数。os.scandir返回一个迭代器,该迭代器生成 DirEntry 对象,而不是简单的字符串名称。每个 DirEntry 对象都包含了文件系统条目的名称以及预先缓存的属性(如是否为目录、是否为文件等),从而避免了对每个条目进行额外的系统调用。

立即学习“Python免费学习笔记(深入)”;

使用 os.scandir 的主要优势包括:

减少系统调用: DirEntry 对象在创建时就缓存了文件系统信息,如 is_dir() 和 is_file(),因此无需为每个条目单独进行 os.path.isdir 或 os.path.isfile 调用。惰性加载: os.scandir 返回的是一个迭代器,它按需生成 DirEntry 对象,而不是一次性加载所有条目到内存中,这对于处理超大型目录尤其有利。

以下是 os.scandir 的一个基本用法示例,用于列出指定路径下的所有子目录:

import osdef subdirs_basic(path):    """生成给定路径下不以'.'开头的目录名称。"""    for entry in os.scandir(path):        if not entry.name.startswith('.') and entry.is_dir():            yield entry.name# 示例调用# for subdir in subdirs_basic('/path/to/directory'):#     print(subdir)

使用 os.scandir 查找目标子文件夹

结合 os.scandir 的优势,我们可以重构之前的函数,以更高效地查找以特定字符串开头的子文件夹。

import osdef find_subfolders_of_interest_optimized(dir_of_interest, starting_string_of_interest):    """    高效查找指定目录下以特定字符串开头的子文件夹。    Args:        dir_of_interest (str): 要扫描的目录路径。        starting_string_of_interest (str): 子文件夹名称的起始字符串。    Returns:        list: 符合条件的子文件夹名称列表。    """    all_subfolders_of_interest = []    # 遍历目录中的每个条目    for entry in os.scandir(dir_of_interest):        # 检查条目是否为目录且名称以指定字符串开头        # entry.is_dir() 利用了DirEntry对象缓存的信息,避免了额外的系统调用        if entry.is_dir() and entry.name.startswith(starting_string_of_interest):            all_subfolders_of_interest.append(entry.name)    return all_subfolders_of_interest# 示例调用if __name__ == '__main__':    # 创建一个测试目录结构    test_dir = 'test_folder_scandir'    os.makedirs(test_dir, exist_ok=True)    os.makedirs(os.path.join(test_dir, 'string_of_interest_01'), exist_ok=True)    os.makedirs(os.path.join(test_dir, 'string_of_interest_02'), exist_ok=True)    os.makedirs(os.path.join(test_dir, 'other_folder'), exist_ok=True)    with open(os.path.join(test_dir, 'some_file.txt'), 'w') as f:        f.write('hello')    print(f"在 '{test_dir}' 中查找以 'string_of_interest' 开头的子文件夹:")    found_subfolders = find_subfolders_of_interest_optimized(test_dir, 'string_of_interest')    print(found_subfolders) # 预期输出: ['string_of_interest_01', 'string_of_interest_02']    # 清理测试目录    import shutil    shutil.rmtree(test_dir)

性能优势分析

find_subfolders_of_interest_optimized 函数通过以下方式实现了显著的性能提升:

单次系统调用获取信息: 当 os.scandir 迭代时,它会从操作系统获取目录条目及其基本属性(如类型),并将这些信息缓存到 DirEntry 对象中。这意味着 entry.is_dir() 方法可以直接访问这些缓存信息,而无需进行额外的系统调用。按需迭代: os.scandir 返回一个迭代器,它只在需要时才从文件系统读取数据。这与 os.listdir 一次性读取所有条目不同,尤其在处理包含大量条目的目录时,可以显著降低内存使用并提高响应速度。内建字符串方法: 使用 entry.name.startswith() 进行前缀匹配通常比编译和执行正则表达式更快,特别是当模式相对简单时。

在面对数十万个文件和文件夹的场景中,这种优化能够将处理时间从数分钟缩短到数秒,极大地提升了文件系统操作的效率。

总结与最佳实践

当需要在Python中进行目录遍历并筛选文件或文件夹时,尤其是在性能敏感或处理大型目录的场景下,强烈建议使用 os.scandir 而非传统的 os.listdir 结合 os.path.isdir。

关键点回顾:

os.scandir 返回 DirEntry 对象的迭代器。DirEntry 对象缓存了文件系统信息,如 is_dir() 和 is_file(),避免了重复的系统调用。os.scandir 采用惰性加载,减少内存占用。对于简单匹配,直接使用 entry.name.startswith() 或 entry.name.endswith() 通常比正则表达式更高效。

通过采纳 os.scandir,开发者可以编写出更健壮、更高效的文件系统操作代码,以应对各种复杂的目录遍历需求。

以上就是Python中高效查找指定子文件夹的策略的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1376921.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
PyCharm文件移动重构中未使用的导入自动移除问题及局部解决方案
上一篇 2025年12月14日 16:19:58
PyMilvus连接Milvus Cloud数据库故障排除与最佳实践
下一篇 2025年12月14日 16:20:09

相关推荐

  • 谷歌浏览器为什么会自动弹出广告窗口_谷歌浏览器弹出广告原因及屏蔽方法

    首先检查并移除可疑浏览器扩展,再通过设置禁止弹窗和重定向,安装uBlock Origin等广告拦截工具,并使用杀毒软件扫描清除系统级广告软件,可彻底解决谷歌浏览器自动弹出广告问题。 如果您在使用谷歌浏览器时,发现页面会自动弹出广告窗口,这通常不是浏览器本身的问题,而是由网站行为、恶意扩展程序或系统中…

    2026年9月23日
    000
  • VSCode调试FPGA的AXI接口(结合Vivado,总线分析技巧)

    调试FPGA的AXI接口,尤其结合VSCode和Vivado,并不是说VSCode能直接像调试软件那样去“单步”硬件。这其实是一种协同作战的模式:VSCode主要负责你的软件层(无论是裸机程序、RTOS应用还是Linux驱动),它驱动着AXI总线上的行为;而Vivado则通过其内置的硬件调试工具(如…

    2026年9月23日
    000
  • mysql如何查看索引 mysql创建索引并验证效果步骤

    mysql如何查看索引 mysql创建索引并验证效果步骤mysql如何查看索引 mysql创建索引并验证效果步骤mysql如何查看索引 mysql创建索引并验证效果步骤mysql如何查看索引 mysql创建索引并验证效果步骤

    查看索引使用show index和show create table;2. 创建索引用create index或alter table;3. 验证索引使用explain分析查询计划;4. 索引失效原因包括数据类型不匹配、函数操作、模糊查询以%开头、or条件复杂、优化器判断选择性低等;5. 常见索引类…

    2026年9月23日 用户投稿
    100
  • Spring Security控制器测试中403错误排查与解决方案

    本文探讨Spring Security控制器测试中遇到403错误的常见原因及解决方案。当安全配置要求特定角色(如ADMIN)访问所有端点时,测试环境下的模拟用户权限可能不匹配。教程将指导如何通过临时放宽安全规则或确保模拟用户角色正确配置来解决此类权限问题,确保测试顺利进行。 在spring secu…

    2026年9月23日
    100
  • VSCode如何通过扩展实现SQL查询 VSCode SQL编辑器插件的使用技巧

    首先确认数据库服务运行且vscode可访问数据库服务器,其次检查扩展配置信息如数据库类型、主机地址、端口、用户名密码等,确保本地路径正确或远程连接正常,检查防火墙是否开放数据库端口,确认已安装必要驱动程序如mysql或psycopg2,查看vscode输出面板获取错误信息,尝试更新或重装扩展,必要时…

    2026年9月23日
    000
  • win11重装系统后驱动怎么装_win11系统重装后驱动安装教程

    首先通过Windows更新获取官方验证驱动,其次可用设备管理器手动更新特定硬件驱动,或从戴尔等官网下载最新驱动安装,最后可选第三方工具快速部署。 如果您刚刚完成 Windows 11 系统的重新安装,系统可能缺少必要的硬件驱动程序,导致设备无法正常工作或性能受限。以下是几种有效的驱动程序安装方法。 …

    2026年9月23日
    100
  • Linux命令行介绍

    Linux命令行介绍Linux命令行介绍Linux命令行介绍Linux命令行介绍

    一、命令行的介绍 命令行界面(英语:command-line interface,缩写:cli)是在图形用户界面得到普及之前使用最为广泛的用户界面,它通常不支持鼠标,用户通过键盘输入指令,计算机接收到指令后,予以执行。也有人称之为字符用户界面cui。通常认为,命令行界面(cli)没有图形用户界面gu…

    2026年9月23日 用户投稿
    300
  • 液晶显示器HDR功能需要哪些硬件支持?

    要真正发挥HDR功能,液晶显示器需具备高亮度、局部调光和宽色域;显卡须支持HDR解码与输出;接口和线缆需满足HDMI 2.0b或DP 1.4以上标准。缺少任一环节,HDR体验将大打折扣。判断真伪HDR应参考VESA DisplayHDR认证,优先选择DisplayHDR 600及以上等级,具备FAL…

    2026年9月23日
    000
  • Navicat连接MySQL的完整步骤

    Navicat连接MySQL的完整步骤Navicat连接MySQL的完整步骤Navicat连接MySQL的完整步骤Navicat连接MySQL的完整步骤

    navicat连接mysql的关键在于正确配置连接信息并排除常见问题。步骤包括:①下载安装navicat;②启动后创建mysql连接;③填写主机名、端口、用户名和密码等信息;④测试连接并保存;⑤双击连接进入数据库。常见问题及解决:①mysql服务未启动需手动启动;②端口被占用可检查并释放;③防火墙阻…

    2026年9月23日 用户投稿
    100
  • 为什么某些外设需要安装特定驱动才能全功能使用?

    外设需专用驱动因通用驱动仅支持基础功能,无法解析厂商私有协议,导致高级特性如自定义按键、RGB灯效、DPI调节等无法使用,且性能优化不足,影响体验。 某些外设需要安装特定驱动才能全功能使用,核心原因在于操作系统自带的通用驱动只能提供最基础的“即插即用”功能,而外设制造商为了充分发挥其硬件的独特性能、…

    2026年9月23日
    100
  • Linux sudoers文件配置方法

    使用visudo编辑sudoers文件可安全配置用户权限,避免语法错误。通过用户、主机、命令别名简化管理,合理分配无需密码或特定命令权限,禁止赋予shell类命令无限制权限,并将规则写入/etc/sudoers.d/目录便于维护,配置后需测试并备份以防出错。 sudoers 文件用于配置 Linux…

    2026年9月23日
    200
  • mysql添加索引命令 mysql创建普通唯一复合索引教程

    mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程

    在mysql中给表加索引的核心目的是提升查询效率。解决方案是通过create index或alter table语句创建不同类型的索引:1. 普通索引用于加快非唯一列的查询;2. 唯一索引确保列值唯一性并提升性能;3. 复合索引支持多列组合查询,遵循最左前缀原则;4. 复合唯一索引结合复合和唯一特性…

    2026年9月23日 用户投稿
    100
  • PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法

    PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法

    PaintToolSAI没有AI裁剪功能,其裁剪依赖手动操作。用户需使用选区工具框选区域,再通过“画布→裁剪”完成,过程基础但精确,适合专注绘画而非复杂图像处理的场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ PaintToolSAI…

    2026年9月23日 用户投稿
    100
  • D盘和C盘有什么区别_D盘与C盘功能及用途对比解析

    C盘是系统核心,负责电脑启动和运行,存放操作系统及关键文件,需谨慎操作并预留至少20%空间;D盘为数据存储区,用于保存个人文件和软件,可自由管理但需定期整理与备份。 电脑里的C盘和D盘虽然都是用来存东西的,但它们的角色完全不同。简单说,C盘是系统的大本营,管着电脑能不能正常开机运行;D盘是你的私人仓…

    2026年9月23日
    100
  • X 旗下 Grok 推出即时语音搜索功能 向 Google 发起挑战?

    近日,X 平台的人工智能助手 Grok 正式上线“即时语音搜索”功能,用户现在可通过语音直接提问,触发实时网络检索,并迅速获得整合后的精准答复。这项新能力意在优化信息查询流程,推动人机互动向更自然、高效的形态发展。 根据官方说明与实际用户体验,Grok 的语音搜索实现了“说话即搜、即时回应”的流畅体…

    2026年9月23日
    100
  • Java JUnit assertThrows 与异常消息比对:避免常见陷阱

    本教程深入探讨在 Java JUnit 中使用 assertThrows 进行异常测试时常见的 assertEquals 误用问题。它详细解释了为何不能直接将期望的字符串消息与捕获到的异常对象进行比对,并提供了正确的解决方案:通过 e.getMessage() 获取异常消息进行精确断言,确保测试的准…

    2026年9月23日
    100
  • safari浏览器如何导入Netscape格式的书签文件_safari浏览器导入Netscape书签方法

    Safari无法直接读取Netscape格式书签时,可通过HTML文件转换、第三方工具修复或借助Chrome/Firefox中转导入。首先确认书签文件含标准结构,尝试直接导入Safari;若失败,使用Linkman Lite等工具修复格式后导入;或通过Chrome先行导入再导出标准HTML文件,最后…

    2026年9月23日
    000
  • VSCode如何通过AI优化内存使用 VSCode智能内存分析调试插件

    ai并不能直接优化vscode的内存占用,而是通过赋能智能化的内存分析调试插件,间接提升vscode的运行效率和开发体验;2. 这类插件通过采集堆快照、cpu性能数据、gc日志和扩展资源消耗等运行时信息,结合ai的模式识别与异常检测能力,精准识别内存泄漏、未清理的事件监听器、循环引用等问题;3. a…

    2026年9月23日
    300
  • win8系统要求最低配置_Win8最低系统要求

    win8系统要求最低配置_Win8最低系统要求win8系统要求最低配置_Win8最低系统要求win8系统要求最低配置_Win8最低系统要求win8系统要求最低配置_Win8最低系统要求

    如果您准备在电脑上安装Windows 8操作系统,但不确定硬件是否满足基本运行条件,则需要确认设备是否达到微软官方设定的最低配置标准。以下是确保系统可正常安装和启动的具体要求。 本文运行环境:Dell XPS 13,Windows 11 一、处理器(CPU)要求 Windows 8系统要求处理器主频…

    2026年9月23日 用户投稿
    100
  • PHP容器与依赖注入怎么理解_PHP中DI容器概念与Pimple等库应用

    依赖注入通过外部传入依赖解耦代码,容器如Pimple集中管理对象创建与依赖解析,提升可测试性与维护性,适用于中小型项目。 PHP中的容器和依赖注入(Dependency Injection,简称DI)是现代开发中解耦代码、提升可测试性和可维护性的核心技术。理解它们的关键在于掌握“控制反转”(Inve…

    2026年9月23日
    100

发表回复

登录后才能评论
关注微信