Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
高效导入多目录Python文件字典至Pandas DataFrame_创想鸟

高效导入多目录Python文件字典至Pandas DataFrame

高效导入多目录Python文件字典至Pandas DataFrame

本文详细介绍了如何从多层嵌套目录中的python文件里提取包含特定格式的字典数据,并利用`os.walk`遍历文件系统、`ast.literal_eval`安全解析字典字符串,最终将其高效整合并构建成一个统一的pandas dataframe。教程涵盖了文件路径获取、内容读取、字典解析及dataframe构建与合并的完整流程。

在数据处理和自动化任务中,我们经常会遇到需要从散布在文件系统各处的配置文件或数据文件中提取结构化信息的情况。特别是在复杂的项目结构中,如果数据以Python字典的形式存储在多个.py文件中,并需要将其汇总到一个统一的Pandas DataFrame中进行分析,这就需要一套系统性的处理方法。本教程将指导您完成这一过程,包括文件系统遍历、文件内容读取、字典字符串的安全解析以及最终的DataFrame构建与合并。

1. 遍历文件系统以定位目标文件

首先,我们需要一种机制来扫描指定根目录下的所有子目录,找到包含目标字典的Python文件。Python的os模块提供了强大的文件系统交互功能,其中os.walk()函数是实现这一目标的核心工具。它会递归地遍历目录树,为每个目录生成一个三元组:(root, dirs, files),分别代表当前目录路径、子目录列表和文件列表。

假设我们的目标文件是form.py,并且它们可能位于任意深度的子目录中。我们可以使用os.walk()结合文件后缀名过滤来找到这些文件。

import osimport pandas as pdimport ast # 用于安全地评估字符串中的Python字面量# 定义起始搜索路径,可以替换为您的实际根目录# 例如:base_path = os.environ["JUPYTER_ROOT"] + "/charts/"base_path = "./charts_data/" # 示例路径,请根据实际情况修改target_files = []for root, dirs, files in os.walk(base_path):    for file in files:        if file.endswith("form.py"):            file_path = os.path.join(root, file)            target_files.append(file_path)print(f"找到 {len(target_files)} 个目标文件。")# print(target_files) # 打印找到的文件路径列表

2. 读取文件内容并提取字典字符串

找到所有目标文件后,下一步是打开每个文件,读取其内容,并从中识别出我们需要的字典字符串。在许多场景中,字典可能以变量赋值的形式存在,例如 def_options = {‘key1’: ‘value1’, ‘key2’: ‘value2’}。我们需要解析这些行,提取出字典的纯字符串表示。

立即学习“Python免费学习笔记(深入)”;

笔目鱼英文论文写作器 笔目鱼英文论文写作器

写高质量英文论文,就用笔目鱼

笔目鱼英文论文写作器 87 查看详情 笔目鱼英文论文写作器

为了确保提取的准确性,我们可以结合字符串查找和分割操作。例如,如果已知字典包含特定的键(如”name”和”age”),我们可以利用这些键来定位包含字典的行。

extracted_dictionaries = []for file_path in target_files:    with open(file_path, "r", encoding="utf-8") as f:        for line in f:            stripped_line = line.strip()            # 假设字典行包含 'name' 和 'age' 键,并且以 'def_options =' 开头            # 您需要根据实际的字典定义格式调整此处的判断逻辑            if "name" in stripped_line and "age" in stripped_line and "def_options =" in stripped_line:                try:                    # 分割字符串,获取等号右侧的字典部分                    dictionary_str = stripped_line.split("=", 1)[1].strip()                    extracted_dictionaries.append(dictionary_str)                    break # 假设每个文件只包含一个目标字典,找到后即可跳出当前文件循环                except IndexError:                    print(f"警告: 无法从文件 {file_path} 的行中正确分割字典字符串: {stripped_line}")                except Exception as e:                    print(f"警告: 处理文件 {file_path} 的行时发生错误: {e} - 行内容: {stripped_line}")# print(f"提取到 {len(extracted_dictionaries)} 个字典字符串。")# for d_str in extracted_dictionaries:#     print(d_str)

3. 安全解析字典字符串为Python字典

直接使用Python的eval()函数来解析从文件中读取的字符串存在安全风险,因为它会执行任意代码。为了安全地将字典字符串转换为实际的Python字典对象,我们应该使用ast.literal_eval()。这个函数只能评估包含Python字面量(字符串、数字、元组、列表、字典、布尔值和None)的字符串,而不会执行任意代码。

parsed_dictionaries = []for dict_str in extracted_dictionaries:    try:        # 使用 ast.literal_eval 安全地解析字典字符串        dictionary_obj = ast.literal_eval(dict_str)        if isinstance(dictionary_obj, dict): # 确保解析结果确实是字典            parsed_dictionaries.append(dictionary_obj)        else:            print(f"警告: 解析结果不是字典类型: {dict_str}")    except (ValueError, SyntaxError) as e:        print(f"错误: 无法解析字典字符串 '{dict_str}': {e}")print(f"成功解析 {len(parsed_dictionaries)} 个字典对象。")

4. 构建并合并Pandas DataFrame

有了所有解析好的字典对象列表,最后一步是将其转换为Pandas DataFrame。由于所有字典具有相同的键,我们可以直接将字典列表传递给pd.DataFrame构造函数,或者逐个字典转换为DataFrame行并进行合并。对于大量字典,通常建议先收集所有字典到一个列表,然后一次性构建DataFrame,这比反复连接DataFrame更高效。

# 确保所有字典具有相同的键,这是构建统一DataFrame的前提if not parsed_dictionaries:    print("没有可用的字典来构建DataFrame。")else:    # 方式一:直接从字典列表构建DataFrame(推荐)    final_dataframe = pd.DataFrame(parsed_dictionaries)    print("n最终构建的Pandas DataFrame (方式一):")    print(final_dataframe.head())    # 方式二:逐个字典构建DataFrame并合并(适用于特殊情况,效率可能略低)    # all_dfs = []    # for d in parsed_dictionaries:    #     # 将单个字典转换为DataFrame的一行    #     df_row = pd.DataFrame([d])    #     all_dfs.append(df_row)    #    # if all_dfs:    #     final_dataframe_concat = pd.concat(all_dfs, ignore_index=True)    #     print("n最终构建的Pandas DataFrame (方式二):")    #     print(final_dataframe_concat.head())    # else:    #     print("没有可用的字典来构建DataFrame。")

完整示例代码

import osimport pandas as pdimport astdef import_dictionaries_to_dataframe(base_path: str, filename_pattern: str = "form.py", dict_key_indicators: tuple = ("name", "age"), dict_var_name: str = "def_options =") -> pd.DataFrame:    """    从多层嵌套目录的Python文件中提取字典,并构建Pandas DataFrame。    Args:        base_path (str): 开始搜索的根目录路径。        filename_pattern (str): 目标Python文件的文件名模式,例如 "form.py"。        dict_key_indicators (tuple): 用于识别包含目标字典的行的键指示器,例如 ("name", "age")。        dict_var_name (str): 字典变量在文件中的赋值前缀,例如 "def_options ="。    Returns:        pd.DataFrame: 包含所有提取字典数据的Pandas DataFrame。                      如果未找到或解析任何字典,则返回空的DataFrame。    """    target_files = []    for root, dirs, files in os.walk(base_path):        for file in files:            if file.endswith(filename_pattern):                file_path = os.path.join(root, file)                target_files.append(file_path)    extracted_dictionaries_data = []    for file_path in target_files:        with open(file_path, "r", encoding="utf-8") as f:            for line in f:                stripped_line = line.strip()                # 检查行是否包含所有指示键和变量名                if all(key in stripped_line for key in dict_key_indicators) and dict_var_name in stripped_line:                    try:                        # 提取字典字符串                        dictionary_str = stripped_line.split(dict_var_name, 1)[1].strip()                        # 安全解析字典字符串                        dictionary_obj = ast.literal_eval(dictionary_str)                        if isinstance(dictionary_obj, dict):                            extracted_dictionaries_data.append(dictionary_obj)                            break # 假设每个文件只包含一个目标字典                        else:                            print(f"警告: 文件 {file_path} 中解析结果不是字典类型: {dictionary_str}")                    except (ValueError, SyntaxError) as e:                        print(f"错误: 无法解析文件 {file_path} 中的字典字符串 '{dictionary_str}': {e}")                    except IndexError:                        print(f"警告: 文件 {file_path} 的行 '{stripped_line}' 无法正确分割字典字符串。")                    except Exception as e:                        print(f"警告: 处理文件 {file_path} 的行时发生未知错误: {e} - 行内容: {stripped_line}")    if extracted_dictionaries_data:        return pd.DataFrame(extracted_dictionaries_data)    else:        print("未找到或成功解析任何字典数据。")        return pd.DataFrame()# 示例使用:# 假设您的项目结构如下:# ./charts_data/# ├── ahc_visits/# │   └── booking_breakdown_per_age_group/# │       └── form.py  (内容:def_options = {'name': 'Alice', 'age': 30, 'city': 'NY'})# └── other_charts/#     └── some_report/#         └── form.py  (内容:def_options = {'name': 'Bob', 'age': 25, 'city': 'LA'})# 创建一些模拟文件用于测试os.makedirs("./charts_data/ahc_visits/booking_breakdown_per_age_group", exist_ok=True)with open("./charts_data/ahc_visits/booking_breakdown_per_age_group/form.py", "w") as f:    f.write("def_options = {'name': 'Alice', 'age': 30, 'city': 'New York'}n")os.makedirs("./charts_data/other_charts/some_report", exist_ok=True)with open("./charts_data/other_charts/some_report/form.py", "w") as f:    f.write("def_options = {'name': 'Bob', 'age': 25, 'city': 'Los Angeles'}n")os.makedirs("./charts_data/another_folder", exist_ok=True)with open("./charts_data/another_folder/form.py", "w") as f:    f.write("def_options = {'name': 'Charlie', 'age': 35, 'city': 'Chicago', 'occupation': 'Engineer'}n")# 调用函数base_dir = "./charts_data/"df = import_dictionaries_to_dataframe(base_dir, dict_key_indicators=("name", "age"), dict_var_name="def_options =")if not df.empty:    print("n最终生成的DataFrame:")    print(df)else:    print("DataFrame为空。")# 清理模拟文件import shutilif os.path.exists(base_dir):    shutil.rmtree(base_dir)

注意事项与总结

字典格式一致性: 本教程假设所有form.py文件中的字典都具有相同的键结构。如果键不一致,pd.DataFrame会自动填充NaN值。字典识别逻辑: 识别包含字典的行 (if “name” in stripped_line and “age” in stripped_line and “def_options =” in stripped_line:) 是关键。您需要根据实际文件中字典的定义方式来调整此处的条件判断和字符串分割逻辑。例如,如果字典没有前缀变量名,或者有其他独特的标识符,需要相应修改。错误处理: 在实际应用中,文件可能损坏、格式不符或不包含预期的字典。代码中包含了try-except块来捕获ast.literal_eval可能引发的ValueError或SyntaxError,以及其他潜在的异常,从而提高程序的健壮性。编码 读取文件时指定encoding=”utf-8″是一个好习惯,可以避免因编码问题导致的错误。性能优化: 对于极其庞大的文件系统和海量文件,可以考虑使用多线程或多进程来并行处理文件,以提高数据提取效率。数据存储替代方案: 如果form.py文件仅用于存储数据而非执行代码,考虑使用更适合数据存储的格式,如JSON或YAML,它们有更完善的解析库,且通常更明确地表示数据结构。

通过上述步骤,您可以有效地从分散在多层目录中的Python文件中提取结构化字典数据,并将其整合到一个易于分析和操作的Pandas DataFrame中。

以上就是高效导入多目录Python文件字典至Pandas DataFrame的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/588403.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Win10系统如何让不同的程序使用不同的音量
上一篇 2025年11月10日 14:15:38
以沃喜壁挂炉代码为主题的技术分析与应用探索(揭秘沃喜壁挂炉代码优势)
下一篇 2025年11月10日 14:15:41

相关推荐

  • 如何在Weka中处理向量属性:ARFF格式的限制与解决方案

    本文探讨了weka中arff格式对直接向量属性表示的限制,并提供了两种主要解决方案。对于时间序列数据,建议利用weka的内置时间序列分析功能。对于非时间序列数据,核心在于通过特征工程(如使用addexpression、multifilter等)将向量拆解并转换为可被weka有效处理的独立特征,以揭示…

    2026年9月21日
    000
  • 蝴蝶号内容创作不露脸的五大绝技与执行方法 | 快速提升曝光率的实用操作流程

    不露脸也能玩转蝴蝶号内容创作,关键在于将焦点从个人形象转移到内容本身与观众体验上,通过声音叙事、动态文字、手部特写、数据可视化和场景搭建五大核心策略构建吸引力,结合高质量音画配合、精准的受众定位、稳定更新与算法互动,提升曝光率;同时规避素材版权、声音质量与画面单调等技术挑战,善用免费或付费正版素材、…

    2026年9月21日
    100
  • 哪些Docker扩展能让你在VSCode内轻松管理容器?

    Docker官方扩展是VSCode中管理容器的核心工具,提供容器、镜像、卷、网络的可视化操作,结合Remote-Containers可实现容器内开发,辅以YAML、GitLens等扩展提升效率,需确保本地Docker daemon运行。 在 VSCode 中管理 Docker 容器,最核心的扩展是 …

    2026年9月21日
    000
  • windows10如何解决“找不到恢复环境”的问题_windows10恢复环境修复方法

    首先启用恢复环境,若失败则修复BCD引导配置,最后检查并恢复Winre.wim文件以解决“找不到恢复环境”问题。 如果您尝试在Windows 10系统中使用“重置此电脑”或“高级启动”功能,但收到“找不到恢复环境”的提示,则可能是由于恢复环境被禁用、引导配置错误或核心文件丢失。以下是解决此问题的步骤…

    2026年9月21日
    200
  • win11系统搜索索引损坏导致搜索缓慢怎么办_Win11搜索索引损坏修复方法

    首先运行搜索和索引疑难解答,然后重启Windows搜索服务;若问题依旧,需重建搜索索引数据库并重置Windows搜索应用组件,最后使用SFC和DISM命令修复系统文件,以彻底解决Windows 11搜索功能响应缓慢或结果不完整的问题。 如果您尝试在Windows 11中使用搜索功能,但发现响应缓慢或…

    2026年9月21日
    000
  • Flyway配置中安全使用环境变量的实践指南

    flyway配置中直接暴露数据库连接参数存在安全隐患。本文详细阐述了如何通过命令行参数和api调用两种主要方式,将环境变量安全地集成到flyway配置流程中。通过外部化管理敏感信息,可以有效提升数据库迁移配置的安全性、灵活性和可维护性,避免将凭证硬编码到配置文件中。 在数据库迁移实践中,将敏感的数据…

    2026年9月21日
    100
  • 如何为VSCode设置最小化到系统托盘?

    VSCode不支持内置最小化到系统托盘功能,可通过第三方工具实现:Windows推荐使用RBTray或AutoHotkey脚本,Linux可借助AppIndicator扩展,macOS则依赖Dock最小化及辅助工具视觉隐藏。 VSCode 本身不提供内置的“最小化到系统托盘”功能,但可以通过一些方法…

    2026年9月21日
    000
  • UC浏览器自带的截图功能快捷键是什么 UC浏览器内置截图快捷键使用说明

    首先通过快捷键或图标触发截图,再选择区域完成截取。UC浏览器支持三种方式:1. 使用Ctrl+Shift+X(Windows)或Command+Shift+X(Mac)快捷键截图;2. 点击地址栏右侧剪刀图标进行全屏、可见区域或自定义截图;3. 在设置中启用手势控制,使用三指下滑手势快速截图。所有截…

    2026年9月21日
    000
  • 怎样在iPhone情侣模式中设置情侣专属表情?个性化聊天的技巧

    怎样在iPhone情侣模式中设置情侣专属表情?个性化聊天的技巧怎样在iPhone情侣模式中设置情侣专属表情?个性化聊天的技巧怎样在iPhone情侣模式中设置情侣专属表情?个性化聊天的技巧怎样在iPhone情侣模式中设置情侣专属表情?个性化聊天的技巧

    通过Memoji、第三方贴纸应用和iOS 16+抠图功能,可为情侣打造专属表情包;结合自定义聊天背景、语音消息、共享相册等方式,既能提升聊天趣味性,又能保持沟通效率,增强情感连接。 在iPhone上设置情侣专属表情,与其说是开启一个内置的“情侣模式”,不如说是巧妙利用iOS系统和第三方应用提供的各种…

    2026年9月21日 用户投稿
    100
  • 如何用SumoPaint的AI裁剪图片?快速完成智能图片裁剪教程

    如何用SumoPaint的AI裁剪图片?快速完成智能图片裁剪教程如何用SumoPaint的AI裁剪图片?快速完成智能图片裁剪教程如何用SumoPaint的AI裁剪图片?快速完成智能图片裁剪教程如何用SumoPaint的AI裁剪图片?快速完成智能图片裁剪教程

    答案:SumoPaint虽无AI裁剪功能,但可通过魔棒、套索工具精确选区,结合图层蒙版与羽化、反选等操作实现智能裁剪效果,最后按需导出PNG或JPG高质量文件。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在SumoPaint中,虽然它不…

    2026年9月21日 用户投稿
    100
  • Java OOP如何使用内部类提高代码组织性

    内部类提升Java代码组织性与封装性,成员内部类增强封装,静态内部类分离逻辑,局部与匿名内部类简化回调,私有内部类隐藏实现细节。 内部类在Java面向对象编程中是一种有效提升代码组织性和封装性的工具。通过将一个类定义在另一个类的内部,可以更好地表达类之间的逻辑关系,控制访问权限,并减少命名冲突。合理…

    2026年9月21日
    000
  • MySQL缓存机制对性能提升的作用_MySQL缓存配置及调优方案

    MySQL缓存机制对性能提升的作用_MySQL缓存配置及调优方案MySQL缓存机制对性能提升的作用_MySQL缓存配置及调优方案MySQL缓存机制对性能提升的作用_MySQL缓存配置及调优方案MySQL缓存机制对性能提升的作用_MySQL缓存配置及调优方案

    mysql的缓存机制主要包括innodb缓冲池、查询缓存和操作系统文件系统缓存等,其中innodb缓冲池是性能优化的核心。1. innodb缓冲池缓存表数据和索引页,减少磁盘i/o,提升读写效率;2. 查询缓存因失效频繁及锁竞争问题,在高并发场景下易成瓶颈,已在mysql 8.0中移除;3. 操作系…

    2026年9月21日 用户投稿
    100
  • VSCode中竖线怎么设置_VSCode编辑区竖线(标尺)显示与配置教程

    在VSCode中启用垂直标尺需修改settings.json文件中的editor.rulers属性,如设置{ “editor.rulers”: [80, 120] }可在第80和120列显示竖线,提升代码对齐与可读性;虽原生不支持自定义颜色样式,但可通过安装Guides或In…

    2026年9月21日
    100
  • PHP 数组值比较与嵌套数组过滤教程

    本教程详细讲解如何在 PHP 中比较一个简单数组与一个复杂嵌套数组,并根据特定条件(如文件名匹配)过滤嵌套数组中的所有相关子数组。我们将通过识别非匹配项的索引,然后从所有子数组中移除这些项并重新索引,实现精确的数据筛选。 问题背景 在 php 开发中,我们经常会遇到需要处理结构复杂的数组数据。例如,…

    2026年9月21日
    100
  • Linux之包管理工具(RPM和YUM)

    包管理工具1. rpm包1.1 rpm指令1.1.1 查询指令使用rpm查询已安装的rpm列表:rpm -qa | grep xx 检查是否已安装firefox:rpm -qa | grep firefox 如果显示i686或i386,表示32位系统,noarch表示通用rpm -qa:列出所有已安…

    2026年9月21日
    000
  • windows11磁盘分区怎么操作_windows11磁盘分区调整方法

    可通过系统磁盘管理或易我分区大师调整Windows 11分区。先使用磁盘管理压缩卷释放未分配空间,再新建简单卷;或用易我分区大师无损调整分区,拖动滑块释放空间后合并至目标分区,最后执行任务完成操作。 如果您希望对Windows 11的硬盘进行重新规划,但不确定如何安全地拆分或合并存储空间,则可能是由…

    2026年9月21日
    100
  • Java集合框架在数据处理中的应用实例

    使用Set去重:通过LinkedHashSet去除标签重复并保持顺序;2. Map统计频次:利用HashMap统计单词出现次数;3. List结合Comparator排序:按年龄升序、姓名降序排列用户;4. 集合嵌套处理数据:用Map组织部门与员工列表。集合框架提升数据处理效率与代码可读性。 Jav…

    2026年9月21日
    000
  • Chrome浏览器怎么开启数据同步功能_Chrome浏览器跨设备数据同步设置教程

    首先登录Google账户启用Chrome同步功能,确保书签、历史记录、密码等数据跨设备一致;接着在设置中自定义同步内容类型以满足隐私需求;然后通过Google账户密钥或自定义密码加密同步数据,提升安全性;最后在新设备登录同一账户,自动接收已同步的浏览数据,实现无缝体验。 如果您希望在不同设备间无缝使…

    2026年9月21日
    000
  • 如何为iPhone12Pro刷机固件下载?一步步教你操作

    首先使用爱思助手一键下载适用于iPhone 12 Pro的iOS 18固件,若失败则手动导入IPSW文件,最后可通过恢复模式配合电脑工具强制刷机完成系统重装。 如果您尝试为您的设备重新安装操作系统,但无法获取正确的系统文件,则可能是由于固件下载路径不正确或工具不支持。以下是解决此问题的步骤: 本文运…

    2026年9月21日
    000
  • 如何使用XGBoost训练AI大模型?优化机器学习模型的步骤

    XGBoost并非用于训练GPT类大模型,而是擅长处理结构化数据的高效梯度提升算法,其优势在于速度快、准确性高、支持并行计算、内置正则化与缺失值处理,适用于表格数据建模;通过分阶段超参数调优(如学习率、树深度、采样策略)、结合贝叶斯优化与交叉验证,并配合特征工程、数据预处理和集成学习等关键步骤,可显…

    2026年9月21日
    000

发表回复

登录后才能评论
关注微信