Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Python实现文本文件单词逐行写入的函数指南_创想鸟

Python实现文本文件单词逐行写入的函数指南

python实现文本文件单词逐行写入的函数指南

本教程详细介绍了如何使用Python编写一个名为words_from_file的函数,该函数能高效地读取指定文本文件,将文件内容按单词进行拆分,并将每个单词独立地写入到另一个新文件中,确保每个单词占据一行。文章涵盖了文件操作、字符串处理以及健壮的错误处理机制。

1. 功能概述与函数定义

在文本处理任务中,我们经常需要将文件内容分解为更小的单元,例如单词。本指南将展示如何创建一个Python函数words_from_file(filename1, filename2),其核心功能是从filename1指定的输入文件中读取文本,将其中的每个单词提取出来,然后将这些单词逐行写入到filename2指定的新文件中。

2. 核心实现与代码解析

实现此功能的关键在于正确地处理文件读写操作以及字符串的分割。以下是推荐的函数实现:

def words_from_file(filename1, filename2):    """    读取指定文本文件,将其内容按单词拆分,并将每个单词逐行写入到另一个新文件。    参数:    filename1 (str): 输入文件的路径。    filename2 (str): 输出文件的路径。    """    try:        # 以只读模式打开输入文件        with open(filename1, 'r', encoding='utf-8') as f_in:            # 以写入模式打开输出文件。注意:'w'模式会清空文件内容,            # 如果文件不存在则创建新文件。            with open(filename2, 'w', encoding='utf-8') as f_out:                # 逐行读取输入文件                for line in f_in:                    # 使用split()方法将每行文本分割成单词。                    # 默认情况下,split()会根据所有空白字符(空格、制表符、换行符等)进行分割,                    # 并移除空字符串。                    words = line.split()                    # 遍历当前行的所有单词,并逐一写入输出文件                    for word in words:                        # 将每个单词写入文件,并在其后添加换行符,确保每个单词占据一行                        f_out.write(word + 'n')    except FileNotFoundError:        # 捕获文件未找到的异常,并打印友好的错误信息        print(f"错误:文件 '{filename1}' 或 '{filename2}' 未找到。请检查文件路径。")    except Exception as e:        # 捕获其他可能的I/O或运行时错误        print(f"发生未知错误:{e}")

代码解析:

文件打开模式与上下文管理器 (with open(…)):

with open(filename1, ‘r’, encoding=’utf-8′) as f_in:: 使用’r’模式以只读方式打开输入文件。推荐指定encoding=’utf-8’以处理各种字符编码,避免乱码。with语句确保文件在操作完成后自动关闭,即使发生错误。with open(filename2, ‘w’, encoding=’utf-8′) as f_out:: 使用’w’模式以写入方式打开输出文件。重要提示: ‘w’模式会在打开时清空文件内容。如果此文件不存在,它会被创建。此行代码被放置在外部循环之外,确保输出文件只被打开和清空一次,从而所有单词都能被写入,而不是每次处理一行时都被覆盖。

逐行读取 (for line in f_in):

立即学习“Python免费学习笔记(深入)”;

此循环高效地从输入文件中逐行读取内容。

单词分割 (line.split()):

words = line.split(): 这是将一行文本拆分为单词的关键步骤。str.split()方法在不带参数时,会根据任意空白字符(空格、制表符、换行符等)进行分割,并自动处理多个连续空白字符的情况,返回一个包含所有单词的列表。

逐词写入 (f_out.write(word + ‘n’)):

for word in words:: 遍历从当前行中提取出的所有单词。f_out.write(word + ‘n’): 将每个单词写入输出文件。关键在于在单词后添加’n’(换行符),确保每个单词都独占一行。

错误处理 (try-except):

try…except FileNotFoundError: 这是一个最佳实践,用于捕获最常见的错误——文件不存在。当open()函数无法找到指定文件时,会抛出FileNotFoundError。except Exception as e: 捕获其他所有可能发生的异常,提供更健壮的错误处理。

3. 使用示例

假设我们有一个名为 input.txt 的文件,内容如下:

It is asample file.This is another line.

我们可以这样调用函数:

# 创建一个示例输入文件with open("input.txt", "w", encoding='utf-8') as f:    f.write("It is an")    f.write("sample file.n")    f.write("This is another line.n")# 调用函数处理文件words_from_file("input.txt", "output.txt")# 验证输出文件内容print("n--- output.txt 的内容 ---")try:    with open("output.txt", "r", encoding='utf-8') as f_out:        print(f_out.read())except FileNotFoundError:    print("输出文件未生成。")

执行上述代码后,output.txt 文件内容将是:

Itisasamplefile.Thisisanotherline.

4. 注意事项与优化

原始代码的常见错误: 在原始的问题代码中,with open(filename2, ‘w’) as g: 语句被错误地放置在了读取输入文件行的循环内部。这意味着对于输入文件中的每一行,输出文件filename2都会被重新打开(并被清空),导致最终filename2中只包含输入文件中最后一行的单词。正确的做法是,输出文件应该在所有行处理之前只打开一次,如本教程的示例所示。编码: 始终建议在open()函数中明确指定encoding=’utf-8’,以确保能够正确处理各种语言的字符,避免编码错误。标点符号处理: line.split()默认只根据空白字符分割。如果需要更复杂的单词提取(例如,将”file.”视为”file”),则需要在split()之前或之后进行额外的字符串处理,例如使用str.strip()去除标点符号,或使用正则表达式进行更精细的匹配。大小写统一: 如果需要进行不区分大小写的单词处理,可以在写入前使用word.lower()或word.upper()将单词转换为统一大小写。内存效率: 对于非常大的文件,逐行读取是内存效率较高的方法。如果文件特别巨大,甚至无法一次性读入一行,可以考虑更高级的流式处理或分块读取。输出模式: 如果你希望将单词追加到现有文件而不是覆盖,可以将输出文件的打开模式从’w’改为’a’(append,追加模式)。

5. 总结

words_from_file函数提供了一个简洁而高效的方法来处理文本文件,实现单词的提取和逐行写入。通过理解文件操作的正确模式、字符串分割的机制以及适当的错误处理,我们可以构建出健壮且实用的文本处理工具。在实际应用中,可以根据具体需求进一步扩展此函数,例如添加标点符号过滤、大小写转换等功能。

以上就是Python实现文本文件单词逐行写入的函数指南的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1362976.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python文件处理:将文本按词拆分并逐行写入新文件
上一篇 2025年12月14日 03:09:03
Pandas DataFrame向量化查找:高效获取指定行数据
下一篇 2025年12月14日 03:09:12

相关推荐

  • Chrome浏览器怎么卸载不需要的扩展_Chrome浏览器扩展程序卸载与管理方法

    Chrome浏览器怎么卸载不需要的扩展_Chrome浏览器扩展程序卸载与管理方法Chrome浏览器怎么卸载不需要的扩展_Chrome浏览器扩展程序卸载与管理方法Chrome浏览器怎么卸载不需要的扩展_Chrome浏览器扩展程序卸载与管理方法Chrome浏览器怎么卸载不需要的扩展_Chrome浏览器扩展程序卸载与管理方法

    首先打开Chrome浏览器,通过点击右上角三点图标进入“更多工具-扩展程序”页面,或直接在地址栏输入chrome://extensions快速访问;找到目标扩展后点击“移除”按钮即可卸载;若仅需临时停用,可点击扩展右侧开关将其关闭,灰色状态表示已禁用;对于多个扩展,建议定期进入管理页面批量清理不常用…

    2026年9月24日 • 用户投稿
    000
  • AI工具如何整合Notion/ChatGPT打造智能工作流

    AI工具如何整合Notion/ChatGPT打造智能工作流AI工具如何整合Notion/ChatGPT打造智能工作流AI工具如何整合Notion/ChatGPT打造智能工作流AI工具如何整合Notion/ChatGPT打造智能工作流

    notion与chatgpt结合能解决信息过载、内容创作效率低和重复任务自动化三大核心痛点。1)chatgpt可快速摘要冗长文本,将提炼后的精华导入notion形成结构化知识条目;2)chatgpt生成初稿作为内容起点,提升写作效率,再通过notion组织成流程化内容日历;3)ai动态填充模板,实现…

    2026年9月24日 • 用户投稿
    200
  • 公众号如何进行用户画像分析_公众号用户画像分析的实用技巧

    公众号如何进行用户画像分析_公众号用户画像分析的实用技巧公众号如何进行用户画像分析_公众号用户画像分析的实用技巧公众号如何进行用户画像分析_公众号用户画像分析的实用技巧公众号如何进行用户画像分析_公众号用户画像分析的实用技巧

    通过分析用户属性、互动行为、问卷反馈及第三方工具,可构建动态更新的公众号用户画像。首先利用后台数据掌握性别、年龄、地域等基础特征;再结合文章阅读、点赞、分享行为提炼兴趣标签;随后通过问卷收集职业、需求等主观信息,形成典型用户原型;接着运用RFM模型对用户分层,识别高价值群体;最后每月定期更新画像,确…

    2026年9月24日 • 用户投稿
    200
  • 拼多多搜索关键词在哪儿看?如何筛选关键词?拼多多关键词挖掘神器!3步筛选高转化词库,流量翻倍!

    拼多多搜索关键词在哪儿看?如何筛选关键词?拼多多关键词挖掘神器!3步筛选高转化词库,流量翻倍!拼多多搜索关键词在哪儿看?如何筛选关键词?拼多多关键词挖掘神器!3步筛选高转化词库,流量翻倍!拼多多搜索关键词在哪儿看?如何筛选关键词?拼多多关键词挖掘神器!3步筛选高转化词库,流量翻倍!拼多多搜索关键词在哪儿看?如何筛选关键词?拼多多关键词挖掘神器!3步筛选高转化词库,流量翻倍!

    想在拼多多快速提升商品曝光?关键词的选择至关重要!本文将手把手教你如何查找拼多多的搜索关键词,并通过科学的筛选方法,精准锁定高转化词库。从商家后台数据看板到竞品标题拆解,再到搜索下拉框深度挖掘,我们将为你揭秘最有效的关键词获取渠道。同时,分享四步筛选技巧,帮你避开低效词,专注高潜力关键词,让店铺流量…

    2026年9月24日 • 用户投稿
    300
  • Linux回收站能恢复已格式化的文件吗

    在 linux 系统中,没有传统意义上的回收站。当你使用 rm 命令删除文件时,文件会直接从文件系统中删除,而不会经过回收站。因此,已格式化的文件在 linux 中是无法通过回收站恢复的。以下是相关信息的介绍: Linux 删除文件的方式 rm 命令:在 Linux 中,rm 命令用于删除文件。使用…

    2026年9月24日
    100
  • AI开发平台有哪些_好用的AI开发平台大全

    AI开发平台有哪些_好用的AI开发平台大全AI开发平台有哪些_好用的AI开发平台大全AI开发平台有哪些_好用的AI开发平台大全AI开发平台有哪些_好用的AI开发平台大全

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Coze:提供大量AI智能体免费使用,已集成DeepSeek满血版 SiliconFlow:专注于生成式AI计算的基础设施平台 码上飞:支持免费生成小程序/APP/网页,通过一句话快速生成应用 …

    2026年9月24日 • 用户投稿
    100
  • win8系统怎么安装xp虚拟机_Win8 XP虚拟机安装方法

    win8系统怎么安装xp虚拟机_Win8 XP虚拟机安装方法win8系统怎么安装xp虚拟机_Win8 XP虚拟机安装方法win8系统怎么安装xp虚拟机_Win8 XP虚拟机安装方法win8系统怎么安装xp虚拟机_Win8 XP虚拟机安装方法

    首先启用CPU虚拟化功能,进入BIOS开启Intel VT-x或AMD-V;然后安装VMware Player或VirtualBox,创建自定义虚拟机并选择Windows XP系统类型,分配1024MB内存和至少20GB硬盘,设置硬盘控制器为IDE;接着加载XP ISO镜像启动安装,按提示分区并完成…

    2026年9月24日 • 用户投稿
    000
  • Java Optional与可空集合排序:深度解析与高效实践

    Java Optional与可空集合排序:深度解析与高效实践Java Optional与可空集合排序:深度解析与高效实践Java Optional与可空集合排序:深度解析与高效实践Java Optional与可空集合排序:深度解析与高效实践

    本文探讨了在Java中处理嵌套可空对象及列表排序的常见问题,特别是Optional的错误用法。强调了通过良好设计避免可空集合的重要性,并提供了在无法修改现有结构时,利用Stream.ofNullable()和Stream.mapMulti()进行安全高效排序的解决方案。旨在提升代码健壮性和可读性。 …

    2026年9月24日 • 用户投稿
    000
  • 京东商家开放平台如何进入?相关术语有哪些?京东商家开放平台入驻指南:流程解析与核心术语解读!

    京东商家开放平台如何进入?相关术语有哪些?京东商家开放平台入驻指南:流程解析与核心术语解读!京东商家开放平台如何进入?相关术语有哪些?京东商家开放平台入驻指南:流程解析与核心术语解读!京东商家开放平台如何进入?相关术语有哪些?京东商家开放平台入驻指南:流程解析与核心术语解读!京东商家开放平台如何进入?相关术语有哪些?京东商家开放平台入驻指南:流程解析与核心术语解读!

    在电商行业蓬勃发展的今天,京东开放平台已成为品牌商家的核心战场。作为拥有4.7亿活跃用户的超级平台,京东不仅提供流量支持,更构建了完整的商家服务体系。本文将深入解析京东商家开放平台入驻流程,并详解pop模式、spu/sku等专业术语,帮助商家快速掌握平台运营规则。 一、京东商家入驻全流程解析 (一)…

    2026年9月24日 • 用户投稿
    200
  • sublime怎么配置LSP(Language Server Protocol)_sublime语言服务器协议配置方法

    sublime怎么配置LSP(Language Server Protocol)_sublime语言服务器协议配置方法sublime怎么配置LSP(Language Server Protocol)_sublime语言服务器协议配置方法sublime怎么配置LSP(Language Server Protocol)_sublime语言服务器协议配置方法sublime怎么配置LSP(Language Server Protocol)_sublime语言服务器协议配置方法

    首先安装LSP插件,再配置语言服务器;以Python为例,通过pip安装pylsp并在LSP设置中添加客户端配置,保存后打开.py文件即可启用服务。 在 Sublime Text 中配置 LSP(Language Server Protocol)可以大幅提升代码补全、跳转定义、悬停提示等开发体验。下…

    2026年9月24日 • 用户投稿
    000
  • windows怎么安装visual c++运行库_visual c++运行库安装教程

    windows怎么安装visual c++运行库_visual c++运行库安装教程windows怎么安装visual c++运行库_visual c++运行库安装教程windows怎么安装visual c++运行库_visual c++运行库安装教程windows怎么安装visual c++运行库_visual c++运行库安装教程

    首先安装Visual C++运行库可解决“找不到vcruntime140.dll”问题,具体步骤包括:一、从微软官网下载对应系统版本的Visual C++ Redistributable安装包,推荐安装2015-2022版;二、可选使用可信的第三方VC++合集工具快速部署多版本运行库;三、通过Win…

    2026年9月24日 • 用户投稿
    000
  • 哪个淘宝比价软件更靠谱?价格低就有优势吗?价格低真的能捡漏吗?

    哪个淘宝比价软件更靠谱?价格低就有优势吗?价格低真的能捡漏吗?哪个淘宝比价软件更靠谱?价格低就有优势吗?价格低真的能捡漏吗?哪个淘宝比价软件更靠谱?价格低就有优势吗?价格低真的能捡漏吗?哪个淘宝比价软件更靠谱?价格低就有优势吗?价格低真的能捡漏吗?

    在淘宝购物时,比价工具已成为理性消费者的得力助手。然而面对琳琅满目的比价应用,哪一款真正值得信赖?当商品价格不断下调,究竟是实打实的优惠,还是精心设计的营销陷阱?本文将从专业视角深入剖析主流比价软件的选择技巧,并揭示低价背后的四大套路。 一、四款热门淘宝比价工具全面测评 1. 历史价格追踪:识破“先…

    2026年9月24日 • 用户投稿
    300
  • Java中自定义日志器的简化与自动化:避免重复声明

    Java中自定义日志器的简化与自动化:避免重复声明Java中自定义日志器的简化与自动化:避免重复声明Java中自定义日志器的简化与自动化:避免重复声明Java中自定义日志器的简化与自动化:避免重复声明

    本文探讨了在Java应用中,尤其是在不能使用Lombok或Spring等流行框架时,如何简化自定义日志器(如MXLogger)的声明和初始化。我们将介绍通过自定义工厂、基类继承和静态工具方法来减少重复代码,并深入分析在“简单Java”环境下实现纯注解驱动自动注入的复杂性,提供实用的解决方案。 挑战:…

    2026年9月24日 • 用户投稿
    000
  • CAS单点登录证书生成

    CAS单点登录证书生成CAS单点登录证书生成CAS单点登录证书生成CAS单点登录证书生成

    在完成前期准备工作后,接下来将深入讲解证书的具体生成步骤。 1、 在F盘新建一个名为cas的目录,用于存储所有相关证书文件。随后打开命令行工具,并进入该目录,操作界面如下图所示。 2、 开始创建服务器端证书 3、 执行该命令可在当前路径下生成一个别称为 server 的密钥库,完成后会在cas文件夹…

    2026年9月24日 • 用户投稿
    000
  • 如何在Debian上配置MongoDB审计日志

    在debian上配置mongodb审计日志可以帮助你监控和记录数据库的活动,从而提高安全性。以下是详细的步骤来配置mongodb审计日志: 1. 安装MongoDB 首先,确保你已经在Debian上安装了MongoDB。如果没有安装,可以使用以下命令进行安装: sudo apt updatesudo…

    2026年9月24日
    100
  • 轻松截取个性铃声

    轻松截取个性铃声轻松截取个性铃声轻松截取个性铃声轻松截取个性铃声

    手机响起时传来心爱的旋律,是不是让心情瞬间愉悦?想知道怎样设置专属个性铃声吗?只需简单几步,就能从喜欢的歌曲中截取精彩片段,让每一次来电都充满期待与惊喜。 1、 启动酷我音乐,进入工具菜单,找到“铃声剪辑”功能,按照页面提示操作,即可快速开始制作个性化铃声。 2、 点击工具栏,会显示多个实用选项,包…

    2026年9月24日 • 用户投稿
    100
  • Rest Assured JSONPath 泛型值提取:构建可重用工具函数

    Rest Assured JSONPath 泛型值提取:构建可重用工具函数Rest Assured JSONPath 泛型值提取:构建可重用工具函数Rest Assured JSONPath 泛型值提取:构建可重用工具函数Rest Assured JSONPath 泛型值提取:构建可重用工具函数

    本教程探讨如何在Rest Assured中构建一个泛型工具函数,以实现从JSON响应中安全地提取指定类型的值。针对直接使用T.class的常见误区,文章提供了正确的解决方案:通过将Class作为参数传入,从而克服Java泛型类型擦除的限制,确保在运行时提供正确的类型信息,提升代码的灵活性和可重用性。…

    2026年9月24日 • 用户投稿
    000
  • windows提示需要管理员权限怎么办_管理员权限获取与设置

    windows提示需要管理员权限怎么办_管理员权限获取与设置windows提示需要管理员权限怎么办_管理员权限获取与设置windows提示需要管理员权限怎么办_管理员权限获取与设置windows提示需要管理员权限怎么办_管理员权限获取与设置

    右键程序选择以管理员身份运行可临时提权;2. 在兼容性中勾选以管理员身份运行可永久提权;3. 通过命令提示符启用内置管理员账户;4. 使用计算机管理将用户添加至管理员组;5. 在设置中更改账户类型为管理员。 如果您在运行某个程序或执行系统操作时,Windows提示需要管理员权限,则说明当前用户账户没…

    2026年9月24日 • 用户投稿
    200
  • UC浏览器为什么不能复制文字_UC浏览器无法复制文字问题解决方法

    UC浏览器为什么不能复制文字_UC浏览器无法复制文字问题解决方法UC浏览器为什么不能复制文字_UC浏览器无法复制文字问题解决方法UC浏览器为什么不能复制文字_UC浏览器无法复制文字问题解决方法UC浏览器为什么不能复制文字_UC浏览器无法复制文字问题解决方法

    无法复制文字可能是因网页保护或浏览器设置所致。首先检查是否启用内容保护,尝试切换至电脑版浏览;其次关闭UC浏览器的阅读模式以恢复原文选中功能;接着清除浏览器缓存数据,重启后测试复制功能;若仍无效,可开启无障碍服务如屏幕朗读或OCR识别提取文字;最后可通过分享链接到微信等应用,在其他浏览器中打开并复制…

    2026年9月24日 • 用户投稿
    1300
  • windows怎么修改环境变量_环境变量配置教程

    windows怎么修改环境变量_环境变量配置教程windows怎么修改环境变量_环境变量配置教程windows怎么修改环境变量_环境变量配置教程windows怎么修改环境变量_环境变量配置教程

    首先通过系统属性界面修改环境变量,右键“此电脑”→“属性”→“高级系统设置”→“环境变量”,在Path中添加路径并保存;其次可用命令提示符输入set命令临时设置变量;还可通过PowerShell执行[Environment]::SetEnvironmentVariable永久配置;最后高级用户可通过…

    2026年9月24日 • 用户投稿
    100

发表回复

登录后才能评论
关注微信