python如何读取一个txt文件_python读写TXT文件的基本操作

Python读写TXT文件需用open()函数配合with语句确保安全,读取可用read()、readline()或readlines(),写入用write()或writelines(),并指定编码防乱码。

python如何读取一个txt文件_python读写txt文件的基本操作

Python读取TXT文件,核心在于使用内置的

open()

函数来打开文件,然后根据需求选择不同的方法(如

read()

readline()

readlines()

)来获取文件内容。写入文件也同样通过

open()

函数,并利用

write()

writelines()

方法实现。重要的是,始终推荐使用

with

语句来管理文件操作,这能确保文件在操作完成后被正确关闭,即使发生错误也不例外。

解决方案

处理TXT文件,无论是读还是写,其基本骨架都围绕着Python的

open()

函数展开。这个函数返回一个文件对象,我们通过它来与文件交互。

读取TXT文件:

最常见的场景就是把文件内容读出来。这里有几种方式,取决于你希望如何处理文件内容。

立即学习“Python免费学习笔记(深入)”;

一次性读取整个文件:如果你确定文件不大,或者需要一次性处理所有内容,

read()

方法最直接。

try:    with open('my_document.txt', 'r', encoding='utf-8') as file:        content = file.read()        print("文件全部内容:")        print(content)except FileNotFoundError:    print("错误:文件 'my_document.txt' 未找到。")except UnicodeDecodeError:    print("错误:文件编码不匹配,尝试其他编码。")

这里

'r'

表示读取模式,

encoding='utf-8'

则指定了文件编码,这是非常关键的一步,不然很容易遇到乱码问题。

逐行读取文件:对于大多数文本文件处理,逐行读取更为常见,也更节省内存,尤其是在处理大文件时。

try:    with open('my_document.txt', 'r', encoding='utf-8') as file:        print("n逐行读取内容:")        for line_num, line in enumerate(file, 1):            print(f"第 {line_num} 行: {line.strip()}") # .strip() 去除行尾的换行符except FileNotFoundError:    print("错误:文件 'my_document.txt' 未找到。")except UnicodeDecodeError:    print("错误:文件编码不匹配,尝试其他编码。")

直接迭代文件对象是最优雅且高效的逐行读取方式。

读取所有行到一个列表中:如果你需要将文件的所有行作为一个列表来处理,

readlines()

方法会很方便。

try:    with open('my_document.txt', 'r', encoding='utf-8') as file:        lines = file.readlines()        print("n所有行以列表形式:")        for line_num, line in enumerate(lines, 1):            print(f"列表第 {line_num} 项: {line.strip()}")except FileNotFoundError:    print("错误:文件 'my_document.txt' 未找到。")except UnicodeDecodeError:    print("错误:文件编码不匹配,尝试其他编码。")

注意,

readlines()

会把所有行加载到内存中,对超大文件要慎用。

写入TXT文件:

写入文件同样需要选择合适的模式。

写入新内容(覆盖模式):使用

'w'

模式会创建一个新文件,如果文件已存在,则会清空原有内容。

new_content = "这是我写入的第一行内容。n这是第二行,带换行符。n"with open('output.txt', 'w', encoding='utf-8') as file:    file.write(new_content)    file.write("再加一行,不带换行符可能和上一行连起来。n")print("n'output.txt' 已在'w'模式下写入。")

追加内容(追加模式):使用

'a'

模式会在文件末尾添加新内容,而不会覆盖原有内容。如果文件不存在,则会创建新文件。

append_content = "这是追加的新内容。n"with open('output.txt', 'a', encoding='utf-8') as file:    file.write(append_content)print("n'output.txt' 已在'a'模式下追加内容。")

写入多行内容:

writelines()

方法可以写入一个字符串列表。

list_of_lines = ["列表中的第一行。n", "列表中的第二行。n", "列表中的第三行。n"]with open('output_list.txt', 'w', encoding='utf-8') as file:    file.writelines(list_of_lines)print("n'output_list.txt' 已使用writelines写入。")

需要注意的是,

writelines()

不会自动添加换行符,你需要确保列表中的每个字符串都包含

n

处理文件编码问题:为什么我的TXT文件读出来是乱码?

这几乎是Python文件操作中最常见、也最让人头疼的问题之一。当你的TXT文件读出来一堆“锟斤拷”或者莫名其妙的符号时,八成是编码惹的祸。简单来说,文件编码就像是一种语言,你的Python程序需要用正确的“语言”去解读文件。如果文件是UTF-8编码,你却用GBK去读,那肯定就“鸡同鸭讲”了。

Python的

open()

函数默认的编码在不同操作系统上可能不一样(比如Windows上可能是GBK,Linux/macOS上可能是UTF-8),所以,最稳妥的做法是明确指定编码

# 假设文件是GBK编码try:    with open('example_gbk.txt', 'r', encoding='gbk') as file:        content = file.read()        print("成功读取GBK文件:", content)except UnicodeDecodeError:    print("错误:尝试GBK编码失败。")except FileNotFoundError:    print("文件未找到。")# 假设文件是UTF-8编码try:    with open('example_utf8.txt', 'r', encoding='utf-8') as file:        content = file.read()        print("成功读取UTF-8文件:", content)except UnicodeDecodeError:    print("错误:尝试UTF-8编码失败。")except FileNotFoundError:    print("文件未找到。")

如何确定文件的编码?

这其实是个经验活,但也有工具可以帮忙:

文本编辑器查看: 很多高级文本编辑器(如VS Code, Sublime Text, Notepad++)在右下角或状态栏会显示当前文件的编码。

尝试常见的编码: UTF-8是目前最通用的编码,其次是GBK(中文Windows系统常见)、Latin-1(或ISO-8859-1,处理西欧语言)。你可以依次尝试这些编码,直到成功。

使用第三方库:

chardet

这样的Python库可以帮助你猜测文件的编码。

# 需要先安装:pip install chardetimport chardetdef detect_encoding(file_path):    with open(file_path, 'rb') as f: # 以二进制模式读取,因为chardet需要字节流        raw_data = f.read(10000) # 读取文件开头一部分数据进行猜测    result = chardet.detect(raw_data)    return result['encoding']file_path = 'my_document.txt'detected_encoding = detect_encoding(file_path)print(f"猜测文件 '{file_path}' 的编码是: {detected_encoding}")if detected_encoding:    try:        with open(file_path, 'r', encoding=detected_encoding) as file:            content = file.read()            print("使用猜测编码读取成功:", content)    except UnicodeDecodeError:        print("错误:猜测编码未能成功解码。")

即便

chardet

很强大,它也只是“猜测”,并非100%准确,尤其是文件内容较少或编码特征不明显时。但它无疑提供了一个很好的起点。

大型文件读取策略:如何高效处理GB级别的TXT文件?

当你的TXT文件达到GB级别时,直接使用

file.read()

file.readlines()

将整个文件加载到内存中,几乎肯定会导致内存溢出(MemoryError),程序直接崩溃。这种情况下,我们需要更“聪明”的策略,也就是逐行处理

Python的文件对象本身就是一个迭代器。这意味着你可以像遍历列表一样遍历它,每次只加载一行到内存中,这正是处理大文件的关键。

def process_large_file_line_by_line(file_path):    line_count = 0    total_chars = 0    print(f"开始处理大型文件: {file_path}")    try:        with open(file_path, 'r', encoding='utf-8') as file:            for line in file: # 核心:直接迭代文件对象                line_count += 1                total_chars += len(line)                # 在这里对每一行进行你的具体处理                # 例如:解析数据、筛选特定内容、写入另一个文件等                if line_count % 100000 == 0: # 每处理10万行打印一次进度                    print(f"已处理 {line_count} 行...")        print(f"文件处理完成。总行数: {line_count}, 总字符数: {total_chars}")    except FileNotFoundError:        print(f"错误:文件 '{file_path}' 未找到。")    except UnicodeDecodeError:        print(f"错误:文件 '{file_path}' 编码不匹配,请检查。")# 假设有一个非常大的文件 'big_data.txt'# process_large_file_line_by_line('big_data.txt')

这种逐行迭代的方式,无论文件有多大,内存占用都保持在一个较低且稳定的水平,因为它每次只在内存中保留当前处理的这一行数据。

更高级一点的思考:生成器(Generators)

如果你需要对每一行进行一些预处理,并且这些预处理结果需要被后续的多个步骤使用,可以考虑使用生成器函数。生成器提供了一种惰性计算的方式,它不会一次性生成所有结果,而是在每次需要时才计算并返回下一个结果。

def read_lines_as_processed_data(file_path):    """一个生成器函数,用于从文件中逐行读取并进行简单处理"""    try:        with open(file_path, 'r', encoding='utf-8') as file:            for line_num, line in enumerate(file, 1):                # 假设我们只是想把每行数据转为大写,并返回行号和处理后的内容                processed_line = line.strip().upper()                yield line_num, processed_line # 使用yield关键字    except FileNotFoundError:        print(f"错误:文件 '{file_path}' 未找到。")    except UnicodeDecodeError:        print(f"错误:文件 '{file_path}' 编码不匹配。")# 使用生成器# for num, data in read_lines_as_processed_data('big_data.txt'):#     # 对data进行进一步操作#     # print(f"处理后的第 {num} 行: {data}")#     pass

生成器在处理大型数据集时非常有用,它将数据的生成和消费解耦,使得代码更清晰、内存效率更高。

写入文件时如何避免数据丢失或覆盖?

写入文件时最怕的就是不小心把原有数据冲掉,或者在多进程/多线程环境下写入冲突。Python的

open()

函数通过不同的模式来控制这种行为,理解它们是避免数据丢失的关键。

'w'

(write) 模式:这是最需要小心的模式。如果文件存在,它会截断文件(清空所有内容)然后写入;如果文件不存在,它会创建新文件。

何时使用: 当你明确知道要创建一个全新的文件,或者要完全替换现有文件的内容时。风险: 误用会导致原有数据彻底丢失。

# 第一次运行:创建文件并写入with open('safe_write.txt', 'w', encoding='utf-8') as f:    f.write("这是第一次写入的内容。n")print("safe_write.txt (w模式) 第一次写入完成。")# 第二次运行:会覆盖第一次写入的内容with open('safe_write.txt', 'w', encoding='utf-8') as f:    f.write("这是第二次写入的内容,覆盖了第一次。n")print("safe_write.txt (w模式) 第二次写入完成,内容已被覆盖。")

'a'

(append) 模式:这是最安全的写入模式之一。如果文件存在,它会在文件末尾追加内容;如果文件不存在,它会创建新文件。

何时使用: 当你需要向日志文件添加记录、或在现有数据末尾追加新数据时。优点: 不会覆盖原有数据。

# 第一次运行:创建文件并写入with open('safe_append.txt', 'a', encoding='utf-8') as f:    f.write("这是第一次追加的内容。n")print("safe_append.txt (a模式) 第一次追加完成。")# 第二次运行:会在文件末尾添加新内容with open('safe_append.txt', 'a', encoding='utf-8') as f:    f.write("这是第二次追加的内容。n")print("safe_append.txt (a模式) 第二次追加完成,内容已在末尾添加。")

'x'

(exclusive creation) 模式:这个模式是专门为防止覆盖而设计的。它要求文件必须不存在,如果文件已存在,

open()

函数会抛出

FileExistsError

异常。

何时使用: 当你希望确保你正在创建一个全新的文件,并且不希望覆盖任何现有文件时。这在需要原子性操作(要么成功创建,要么失败,但绝不修改现有文件)的场景下非常有用。优点: 提供了最强的数据安全保障,防止意外覆盖。

try:    with open('safe_exclusive.txt', 'x', encoding='utf-8') as f:        f.write("这是通过'x'模式创建并写入的内容。n")    print("safe_exclusive.txt (x模式) 创建并写入成功。")except FileExistsError:    print("错误:文件 'safe_exclusive.txt' 已存在,'x'模式拒绝覆盖。")# 再次尝试运行,会触发FileExistsErrortry:    with open('safe_exclusive.txt', 'x', encoding='utf-8') as f:        f.write("这行内容永远不会被写入,因为文件已存在。n")except FileExistsError:    print("第二次尝试创建'safe_exclusive.txt'失败,因为文件已存在。")

确保数据写入磁盘:

flush()

close()

即便你使用了正确的模式,数据也可能不会立即写入物理磁盘。Python的文件操作通常会有内部缓冲区,数据会先写入缓冲区,达到一定量或文件关闭时才真正写入磁盘。

with

语句会自动处理文件关闭(

close()

),这会触发缓冲区刷新。如果你需要在文件关闭前强制数据写入磁盘,可以使用

file.flush()

方法。

with open('flush_example.txt', 'w', encoding='utf-8') as f:    f.write("这行内容可能还在缓冲区。n")    f.flush() # 强制将缓冲区内容写入磁盘    print("数据已强制刷新到磁盘。")    # 即使程序此时崩溃,这行内容也应该已经写入了。    f.write("这行内容在flush之后写入。n")# 文件退出with块时会自动关闭和刷新。

理解这些模式和机制,能让你在Python中进行文件操作时更加从容和安全。

以上就是python如何读取一个txt文件_python读写TXT文件的基本操作的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373049.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
python如何从网页上下载图片_python爬虫下载网页图片实战方法
上一篇 2025年12月14日 12:51:07
Python 内存映射文件优化 mmap
下一篇 2025年12月14日 12:51:21

相关推荐

  • PHP 中如何将 JSON 数组值声明为变量

    本文介绍了如何在 PHP 中从数据库获取数据并将其编码为 JSON 格式,然后通过 AJAX 请求传递到另一个页面。重点讲解了如何在接收页面解析 JSON 数据,并将 JSON 数组中的特定值提取并赋值给变量,以便在后续的 PHP 函数中使用。 从数据库获取数据并编码为 JSON 首先,我们需要从数…

    2026年9月24日
    000
  • 如何列出DEB包内容 dpkg -L查看文件清单

    如何列出DEB包内容 dpkg -L查看文件清单如何列出DEB包内容 dpkg -L查看文件清单如何列出DEB包内容 dpkg -L查看文件清单如何列出DEB包内容 dpkg -L查看文件清单

    要查看已安装 deb 包所包含的文件列表,可使用命令 dpkg -l 包名,例如 dpkg -l nginx 会列出 nginx 安装的所有文件路径;该命令适用于 debian 及其衍生系统如 ubuntu,仅能查询已安装的包,且常用于查找配置文件、排查冲突或学习软件结构;为方便查看,可通过管道配合…

    2026年9月24日 用户投稿
    000
  • VSCode如何调试React前端应用 VSCode调试React组件的完整教程

    要调试react前端应用,首先需安装vscode的浏览器调试插件并配置launch.json文件,1. 安装“debugger for chrome”或对应浏览器的插件;2. 在项目根目录的.vscode文件夹中创建launch.json,配置type为chrome、request为launch、n…

    2026年9月24日
    100
  • 360浏览器怎么升级到最新版本 360浏览器版本更新升级操作指南

    建议及时升级360浏览器至最新版本以确保安全与性能,可通过浏览器内置更新、官网手动下载或应用商店三种方式完成升级操作。 如果您发现当前使用的360浏览器功能受限或存在兼容性问题,可能是由于版本过旧导致。为确保浏览安全与性能稳定,建议及时将浏览器升级至最新版本。 本文运行环境:华为Mate 60 Pr…

    2026年9月24日
    100
  • Linux中如何安装Git工具_Linux安装Git工具的详细教程

    在Linux系统中安装Git工具是进行版本控制的第一步,尤其对于开发者来说非常关键。不同Linux发行版使用不同的包管理器,因此安装方式略有差异。下面将介绍在主流Linux系统中安装Git的详细步骤。 1. 在Ubuntu/Debian系统中安装Git Ubuntu和Debian系统使用apt作为包…

    2026年9月24日
    100
  • win11网络连接图标一直转圈显示正在识别怎么办_win11网络图标转圈解决方法

    重启网络服务、重置适配器、更改DNS及命令提示符重置网络组件可解决Windows 11网络图标转圈问题。 如果您在使用Windows 11时发现网络连接图标持续转圈,显示“正在识别”或无法正常获取网络连接状态,这通常意味着系统在尝试获取网络配置信息时遇到了阻碍。以下是多种可行的解决方法: 本文运行环…

    2026年9月24日
    100
  • 5118如何优化站内搜索排名_5118站内SEO的实用技巧

    5118是SEO辅助工具,通过挖掘长尾词、分析竞争对手和需求图谱来指导内容优化。利用其数据优化标题、布局关键词,并持续监控排名与流量,以数据驱动迭代策略,提升搜索引擎排名。 5118 不是直接优化你网站站内搜索排名的工具,它是一款专业的SEO辅助平台,核心功能是帮你挖掘关键词、分析数据,从而指导你进…

    2026年9月24日
    100
  • 抖音1000粉丝价格明细,认准官方巨量千川合作模式

    粉丝是我们开展抖音业务的入场券,更多的粉丝数量意味着更多的商业机会,粉丝数量也决定了我们在抖音生态中的主动权力,熟话说“短期靠爆文涨粉,中期靠人设留粉,长期靠价值变现”,按照平台的算法规则和流量分配机制,一定数量的粉丝基础,能保障我们账号基本推流,而抖音1000粉丝是一个分水岭,为了帮助大家更快速更…

    2026年9月24日
    100
  • gpt-realtime— OpenAI最新推出的语音模型

    gpt-realtime— OpenAI最新推出的语音模型gpt-realtime— OpenAI最新推出的语音模型gpt-realtime— OpenAI最新推出的语音模型gpt-realtime— OpenAI最新推出的语音模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ OpenAI Codex 可以生成十多种编程语言的工作代码,基于 OpenAI GPT-3 的自然语言处理模型 57 查看详情 gpt-realtime 是什么 gpt-realtime 是 o…

    2026年9月24日 用户投稿
    100
  • iPhone13ProMax微信收款语音无法设置怎么办?解决语音功能的教程

    iPhone13ProMax微信收款语音无法设置怎么办?解决语音功能的教程iPhone13ProMax微信收款语音无法设置怎么办?解决语音功能的教程iPhone13ProMax微信收款语音无法设置怎么办?解决语音功能的教程iPhone13ProMax微信收款语音无法设置怎么办?解决语音功能的教程

    iPhone 13 Pro Max微信收款语音无法设置,通常非硬件问题,而是微信或系统设置不当所致。2. 需检查微信内“收款到账语音提醒”是否开启,并确认系统通知权限、声音设置、静音模式、勿扰模式及网络连接正常。3. 可尝试重启手机、更新微信或iOS系统,必要时重置所有设置或重装微信。4. 若问题依…

    2026年9月24日 用户投稿
    200
  • VSCode如何通过Dev Containers开发 VSCode开发容器环境的搭建与使用

    vscode通过dev containers提供容器化开发环境,解决了“在我的机器上能运行”的问题。1. 安装docker并配置vscode访问;2. 安装remote – containers扩展;3. 创建.devcontainer文件夹和devcontainer.json文件;4.…

    2026年9月24日
    100
  • MACA: 一款自动注释细胞类型的工具

    前言 设计的初衷在目前的细胞类型鉴定工具中,支持向量机(SVM)的准确性超过了大多数监督注释方法。然而,由于监督注释方法在大多数单细胞数据中缺乏真实参照,因此其易用性不如非监督方法,这也是非监督方法占主流的原因之一。使用非监督方法时,需要人工介入,调整分群的分辨率,并提供标记基因,这会导致选择标记基…

    2026年9月24日
    000
  • 如何通过压力测试判断电源的峰值输出可靠性?

    答案是判断电源峰值输出可靠性需通过动态负载测试。使用可编程电子负载模拟瞬时功耗变化,配合高带宽示波器监测电压跌落、恢复时间与纹波噪声,同时用热成像仪评估关键元件温度,若在快速负载切换下电压稳定、纹波低、温升可控,则电源峰值性能可靠。 判断电源的峰值输出可靠性,说白了,就是看它在最极端、最苛刻的瞬间,…

    2026年9月24日
    300
  • 美图秀秀网页版登录入口 美图秀秀在线使用官网

    美图秀秀网页版登录入口为http://xiuxiu.web.meitu.com/,提供调色、美化、抠图、拼图、GIF制作等功能,支持在线编辑与素材模板使用。 美图秀秀网页版登录入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来美图秀秀网页版在线使用官网地址,以及其主要功能特点,感兴趣的网…

    2026年9月24日
    100
  • 别在做无用功了,抖音1000粉丝现在可以花钱涨了

    花钱买粉丝是不被允许的,是自欺欺人的吗?这种老观点在如今的抖音流量生态体系中已经不在适合,不管是从用户需求角度,还是从官方盈利视角出发,付费投流,花钱涨粉都是市场正常需求,也是关系到账号生存发展,如果我们尝试了很多自然流量的方式,粉丝数量还是迟迟上不去,那完全可以选择付费涨粉,这里可不是说让大家花钱…

    2026年9月24日
    100
  • VSCode如何分屏和布局管理 VSCode多窗口编辑的高效方式

    vscode多窗口编辑的快捷键和技巧包括:1. 垂直分屏使用 ctrl+(macos为 cmd+);2. 水平分屏使用 ctrl+k v(macos为 cmd+k v)或通过菜单选择上下拆分;3. 拖拽文件标签或从侧边栏拖文件至边缘可智能创建新分屏;4. 右键“在新组中打开”可快速并排查看文件;5.…

    2026年9月24日
    100
  • 深入理解 javac 命令中的 ‘当前目录’ 与类路径

    在使用 javac 命令进行 Java 编译时,’当前目录’ 指的是执行该命令时所在的目录,而非源代码文件或 Java 安装路径所在的目录。这对于默认类路径(.)的解析至关重要,影响编译器查找依赖类文件的位置。理解这一概念有助于避免编译错误,并正确配置类路径。 什么是“当前目…

    2026年9月24日
    100
  • win10管理员账户被禁用了怎么办_win10管理员账户恢复教程

    1、通过计算机管理可直接启用禁用的管理员账户;2、使用命令提示符输入net user administrator /active:yes激活账户;3、进入安全模式执行相同命令修复登录问题;4、利用组策略编辑器更改管理员账户状态为启用,适用于专业版系统。 如果您尝试登录Windows 10系统时发现管…

    2026年9月24日
    100
  • 如何监控Linux进程内存泄漏 pmap与valgrind工具使用

    如何监控Linux进程内存泄漏 pmap与valgrind工具使用如何监控Linux进程内存泄漏 pmap与valgrind工具使用如何监控Linux进程内存泄漏 pmap与valgrind工具使用如何监控Linux进程内存泄漏 pmap与valgrind工具使用

    要监控linux进程的内存泄漏,首先使用pmap观察内存增长趋势,再用valgrind定位具体泄漏点。一、使用pmap -x 查看进程内存映射,重点关注anon列和总内存变化,通过定期刷新判断是否存在异常增长;二、利用valgrind –leak-check=full启动程序,分析报告中…

    2026年9月24日 用户投稿
    100
  • Laravel 表单多动作处理:区分同一路由下的提交操作

    本教程将详细介绍如何在 laravel 应用中,通过一个 html 表单的多个提交按钮触发不同的后端操作,而无需为每个操作创建单独的表单或路由。核心方法是为提交按钮添加 `name` 和 `value` 属性,然后在控制器中根据这些属性的值来判断执行哪种业务逻辑,从而实现如更新用户角色和删除用户等多…

    2026年9月24日
    000

发表回复

登录后才能评论
关注微信