Python实现文本文件单词逐行写入新文件教程

Python实现文本文件单词逐行写入新文件教程

本教程详细讲解如何使用Python编写函数,从指定文本文件中读取内容,将其拆分为独立的单词,并将每个单词逐行写入一个新的输出文件。文章涵盖了文件操作的最佳实践、字符串分割技巧以及健壮的错误处理机制,确保代码高效且可靠地完成文本处理任务。

核心功能实现:words_from_file 函数

在文本处理任务中,将文本内容按单词进行拆分并进行后续处理是一种常见需求。本节将详细介绍如何编写一个python函数words_from_file(filename1, filename2),该函数能够读取一个指定文件中的文本内容,将其分解为独立的单词,并将每个单词写入一个新的文件,每个单词占据一行。

函数定义与参数

words_from_file 函数接受两个字符串参数:

filename1: 源文件的路径,从中读取文本内容。filename2: 目标文件的路径,处理后的单词将写入此文件。

文件打开与管理

Python 推荐使用 with open(…) as f: 语句来处理文件操作。这种方式能够确保文件在使用完毕后被正确关闭,即使在处理过程中发生错误也不例外,从而避免资源泄露。在我们的函数中,源文件和目标文件都将采用这种方式打开。

立即学习“Python免费学习笔记(深入)”;

def words_from_file(filename1, filename2):    try:        # 打开源文件用于读取        with open(filename1, 'r') as f:            # 打开目标文件用于写入,'w'模式会覆盖原有内容            with open(filename2, 'w') as g:                # ... 后续处理逻辑    except FileNotFoundError:        print("错误:文件未找到。请检查文件路径是否正确。")    except Exception as e:        print(f"发生未知错误:{e}")

逐行读取与单词分割

文件内容通常是按行组织的。我们可以通过遍历文件对象来逐行读取。对于每一行,我们需要将其拆分成独立的单词。Python 的字符串 split() 方法非常适合此任务。默认情况下,split() 方法会根据任意空白字符(空格、制表符、换行符等)进行分割,并自动处理多个连续的空白字符,返回一个单词列表。

                for line in f:  # 逐行读取源文件                    words = line.split()  # 将当前行拆分为单词列表                    # ... 逐词写入

逐词写入新文件

获取到单词列表后,我们需要将每个单词写入目标文件,并确保每个单词独占一行。g.write() 方法用于向文件写入字符串。为了实现每个单词一行,我们需要在每个单词后面添加一个换行符 n。

                    for word in words:                        g.write(word + 'n')  # 写入单词并添加换行符

错误处理

健壮的程序需要考虑各种异常情况。文件操作最常见的异常是 FileNotFoundError,即指定的文件不存在。使用 try-except 块可以优雅地捕获并处理这类错误,向用户提供有用的反馈信息,而不是让程序崩溃。

示例代码

将上述所有组件整合,完整的 words_from_file 函数如下所示:

def words_from_file(filename1, filename2):    """    读取指定文本文件,将其内容拆分为单词,    并将每个单词逐行写入一个新的文件。    Args:        filename1 (str): 源文件的路径。        filename2 (str): 目标文件的路径,处理后的单词将写入此文件。    """    try:        with open(filename1, 'r') as f:            with open(filename2, 'w') as g:                for line in f:                    words = line.split()  # 默认按空白字符分割                    for word in words:                        g.write(word + 'n')        print(f"文件 '{filename1}' 已成功处理,单词已写入 '{filename2}'。")    except FileNotFoundError:        print(f"错误:文件 '{filename1}' 未找到。请检查文件路径是否正确。")    except Exception as e:        print(f"处理文件时发生未知错误:{e}")# --- 使用示例 ---# 1. 创建一个示例输入文件 (input.txt)# 假设 input.txt 包含以下内容:# It is a sample file.# This is another line.with open("input.txt", "w") as f_in:    f_in.write("It is a sample file.n")    f_in.write("This is another line.n")    f_in.write("One_wordn") # 包含下划线的单词print("已创建示例输入文件 'input.txt'。")# 2. 调用函数进行处理words_from_file("input.txt", "output.txt")# 3. 验证输出文件内容 (output.txt)print("n'output.txt' 文件内容:")try:    with open("output.txt", "r") as f_out:        print(f_out.read())except FileNotFoundError:    print("输出文件 'output.txt' 未生成。")# --- 预期 output.txt 内容 ---# It# is# a# sample# file.# This# is# another# line.# One_word

关键点与注意事项

with 语句的重要性: 使用 with open(…) 是一种 Pythonic 的最佳实践。它确保文件在块执行完毕后(无论是否发生异常)都会被自动关闭,避免了手动调用 f.close() 的麻烦和潜在的资源泄露。split() 方法的灵活运用: str.split() 方法是字符串处理的利器。不带参数调用时,它会根据任何空白字符(空格、制表符、换行符)进行分割,并自动过滤掉空字符串,非常适合将句子拆分成单词。如果需要根据特定分隔符分割(例如逗号),可以传入分隔符作为参数,如 line.split(‘,’)。逐词写入与换行符: g.write(word + ‘n’) 是实现每个单词一行写入的关键。g.writelines() 方法接受一个字符串列表,并将其所有元素写入文件,但它不会自动添加换行符,需要手动在列表中每个元素后添加。对于本例中每个单词需要独立一行的情况,write() 方法配合 n 更直观。避免重复打开写入文件: 在最初的尝试中,可能存在将 with open(filename2, ‘w’) as g: 语句放置在读取文件循环内部的情况。这将导致目标文件在处理每一行时都被重新打开并清空,最终只会保留最后一行文本所产生的单词。正确的做法是在外部循环之前打开目标文件一次,如本教程所示。精确的异常处理: 使用 except FileNotFoundError: 比通用的 except: 更具针对性。它只捕获文件未找到的错误,而不会掩盖其他可能导致程序异常的错误,有助于调试和维护。

总结

通过本教程,我们学习了如何构建一个健壮的Python函数,用于从文本文件中提取单词并将其逐行写入新文件。这包括了文件I/O的最佳实践、字符串分割技巧以及重要的错误处理机制。掌握这些技能对于进行各种文本数据预处理和分析任务至关重要。通过灵活运用 with 语句、split() 方法和恰当的错误处理,我们可以编写出高效、可靠且易于维护的文本处理程序。

以上就是Python实现文本文件单词逐行写入新文件教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1362972.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python文件处理:高效实现文本按词拆分并逐行写入新文件
上一篇 2025年12月14日 03:08:50
Python文件处理:将文本按词拆分并逐行写入新文件
下一篇 2025年12月14日 03:09:03

相关推荐

  • MySQL安全认证插件使用_MySQL提升登录安全性的方案

    MySQL安全认证插件使用_MySQL提升登录安全性的方案MySQL安全认证插件使用_MySQL提升登录安全性的方案MySQL安全认证插件使用_MySQL提升登录安全性的方案MySQL安全认证插件使用_MySQL提升登录安全性的方案

    mysql登录安全性核心在于认证插件,推荐使用caching_sha2_password。1.检查默认插件:show variables like ‘default_authentication_plugin’; 2.修改my.cnf配置default_authenticat…

    2026年9月1日 用户投稿
    200
  • Python中pip install sklearn和pip install scikit-learn有什么区别?

    pip install sklearn 与 pip install scikit-learn:细微差别与最佳实践 在 Python 的机器学习领域,您可能会遇到两种安装 scikit-learn 库的命令:pip install sklearn 和 pip install scikit-learn。…

    2026年9月1日
    100
  • Windows下使用VS2013编译使用SDL库

    Windows下使用VS2013编译使用SDL库Windows下使用VS2013编译使用SDL库Windows下使用VS2013编译使用SDL库Windows下使用VS2013编译使用SDL库

    simple directmedia layer(sdl)是一个跨平台开发库,旨在通过opengl和direct3d提供对音频、键盘、鼠标、操纵杆和图形硬件的低级访问。多种软件,如视频播放工具、仿真器和许多热门游戏(包括valve的获奖作品和humble bundle中的众多游戏)都依赖于它。 SD…

    2026年9月1日 用户投稿
    300
  • pip install sklearn和pip install scikit-learn究竟有何区别?

    pip install sklearn 和 pip install scikit-learn 的区别与联系 这两个命令看似相似,实则指向不同的包。它们的区别在于: pip install scikit-learn: 这是正确的安装 Scikit-learn 库的命令。它只安装 Scikit-lear…

    2026年9月1日
    200
  • ChatGPT怎么用_ChatGPT注册登录与基础使用教程

    答案是注册并掌握提问技巧后,ChatGPT能成为高效工具。需通过官网注册,验证邮箱和手机号,登录后可在聊天界面输入问题,利用上下文记忆、角色设定、明确指令等技巧提升回答质量,免费版适合初试,Plus版则提供GPT-4、插件、数据分析等高级功能,适合高频深度使用者。 ☞☞☞AI 智能聊天, 问答助手,…

    2026年9月1日
    200
  • 响指AI开发平台进阶版重磅上线:后端能力全面开放!

    “我本来只是想帮我们机构整理一下志愿者信息,没想到最后竟然做出了一个能在线报名、筛选和地图导航的完整平台。” 李瑶是一家公益组织的项目协调员,她原计划请人开发一个志愿者报名系统,但被动辄上万的开发费用劝退了。 后来她试用了响指进阶版,只输入一句话:“我想做一个可以收集志愿者报名信息、自动分组、并在地…

    2026年9月1日
    100
  • 怎么在VSCode安装Pylint_VSCode配置Python代码检查工具Pylint教程

    答案是安装并配置Pylint扩展与Python包,再在VSCode中启用并自定义规则。首先安装VSCode的Pylint扩展,然后通过pip install pylint在Python环境中安装库;接着在settings.json中设置”python.linting.pylintEnab…

    2026年9月1日
    700
  • 怎么清除VSCode的设置_VSCode恢复默认设置与用户配置清除教程

    清除VSCode设置需删除用户配置文件夹,路径因系统而异,可选择完全或部分清除,建议先备份;用户设置影响全局,工作区设置仅限当前项目,优先级依次升高;扩展设置通常存于settings.json,卸载或手动删除可清除,部分数据可能残留;也可通过命令面板清空设置或重置单项,同步功能需注意云端覆盖。 清除…

    2026年9月1日
    300
  • Python环境安装教程

    Python环境安装教程Python环境安装教程Python环境安装教程Python环境安装教程

    引言 通常我们将#%#$#%@%@%$#%$#%#%#$%@_23eeeb4347bdd26bfc++6b7ee9a3b755dd和java语言归为解释型语言,而对于c/c++则归为编译型语言。 安装Python解释器最新版本下载 官网下载(https://www.Python.org/) 选择最新…

    2026年9月1日 用户投稿
    400
  • 怎么用VSCode运行代码_VSCode代码执行与调试教程

    VSCode中运行和调试代码的核心方法包括:1. 使用内置终端手动执行命令,灵活但需重复输入;2. 通过Code Runner插件一键运行,快捷但功能有限;3. 借助语言扩展与调试器深度调试,支持断点、变量监控、调用堆栈等高级功能,适合复杂项目。配置时需安装对应语言扩展、设置解释器路径、合理使用se…

    2026年9月1日
    100
  • AI整理文档怎么高效_使用ChatGPT进行文档摘要与归类

    答案是利用ChatGPT高效整理文档需明确目标并分解任务,通过准备文本、设计精准Prompt、迭代优化及整合结果,结合背景信息、示例引导和自动化脚本提升摘要准确性与批量归类效率,并可拓展至翻译、校对、生成等应用。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek…

    2026年9月1日
    100
  • 使用minio搭建私有化对象存储服务

    使用minio搭建私有化对象存储服务使用minio搭建私有化对象存储服务使用minio搭建私有化对象存储服务使用minio搭建私有化对象存储服务

    在工作中,我们常常会接触到对象存储服务,但这些服务大多是云服务。对于需要对外开放的项目而言,这类服务是可行的。然而,当我们需要私有化部署时,如何继续使用对象存储呢? 这里介绍一个开源项目MinIO,使用它,我们可以轻松搭建属于自己的私有云服务。 MinIO是一个非常轻量级的服务,可以简单地与其他应用…

    2026年8月31日 用户投稿
    200
  • 安装perplexity教程-如何安装perplexity的详细指引

    首先确认Python版本并安装transformers、torch等依赖库,接着可通过pip或GitHub源码安装Perplexity工具,配置CUDA与预训练模型后,运行测试脚本验证是否成功输出perplexity值。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 Deep…

    2026年8月31日
    200
  • deepseek本地部署后怎么训练详细教程

    本文主要介绍在本地部署 DeepSee 模型并进行训练的详细教程。DeepSee 是一款用于理解和生成文本数据的先进自然语言处理模型。通过该教程,读者可以逐步了解如何设置 DeepSee 的本地环境,准备训练数据,配置模型参数,以及启动训练过程。通过遵循本教程,研究人员和机器学习从业人员可以充分利用…

    2026年8月31日
    200
  • Java如何高效模拟JavaScript字典结构?

    java高效模拟javascript字典结构 本文探讨如何在Java中高效模拟JavaScript或Python字典的结构,并提供一种基于枚举和Lombok的简洁解决方案。JavaScript字典的典型用法如下: policy = { “expiration”:”2021-02-02t12:00:0…

    2026年8月31日
    100
  • Java如何优雅地实现类似JavaScript或Python字典的结构?

    java优雅实现类似javascript或python字典结构 本文探讨如何在Java中优雅地实现类似于JavaScript或Python字典的结构,即使用键值对存储数据。 直接使用Java基本数据类型无法达到Python或JavaScript字典的简洁性,因此需要借助其他方式。 一种有效的方法是结…

    2026年8月31日
    100
  • [python]windows上通过whl文件安装numpy+mkl教程

    在windows系统中通过 .whl 文件安装 numpy+mkl ,可遵循以下步骤完成: 一、前期准备 下载对应版本的 .whl 文件:前往可信的Python第三方库镜像站点,例如 gitee.com/FIRC/pythonlibs_whl_mirror 。进入页面后按下 Ctrl+F 搜索关键词…

    2026年8月31日
    200
  • 如何在Java中使用LinkedHashSet

    LinkedHashSet继承HashSet并保持插入顺序,适用于去重且需顺序的场景。1. 创建时可指定初始容量;2. add()添加元素,自动去重;3. 遍历时按插入顺序输出;4. 支持remove()、contains()等操作;5. 常用于关键词去重、缓存等。注意:允许null、非线程安全。 …

    2026年8月31日
    300
  • VSCode用户代码片段管理_VSCode自定义模板快速创建入口

    VSCode通过用户代码片段和自定义模板显著提升开发效率。1. 可通过“文件 > 首选项 > 用户代码片段”为特定语言或全局创建代码片段,使用prefix触发、body定义代码结构、description标注用途。2. 合理管理需区分语言特定与全局片段,避免prefix冲突,善用desc…

    2026年8月31日
    700
  • Java中如何高效地模拟Python字典或JavaScript对象的键值对结构?

    java中高效模拟python字典或javascript对象的键值对结构 本文探讨如何在Java中便捷地创建类似Python字典或JavaScript对象的键值对数据结构,并提供一种基于枚举和Lombok的解决方案。 文中以一个名为policy的对象为例,展示如何优雅地处理这种需求。 Java原生类…

    2026年8月30日
    400

发表回复

登录后才能评论
关注微信