Pandas DataFrame长文本按句切分与定长处理教程

pandas dataframe长文本按句切分与定长处理教程

本教程旨在解决Pandas DataFrame中长文本列的处理难题,特别是如何将超过预设长度的文本按完整句子进行智能切分,并分配到新的多列中。通过结合nltk库进行句子级分词和自定义函数实现长度限制,文章详细阐述了如何优雅地将冗长描述转换为结构化、易于导入和分析的短文本片段,确保每个片段都以完整的句子结束,并避免单个长句子被截断。

引言:长文本数据处理的挑战

在数据分析和处理中,我们经常会遇到包含长文本描述的DataFrame,例如产品详情、用户评论或文档内容。这些文本有时可能非常冗长,长度可能超过数千字符。当需要将这些数据导入到具有字符限制的数据库字段,或者为了后续的文本分析(如生成嵌入、关键词提取)而进行预处理时,直接处理这些长文本会带来挑战。常见的需求是将长文本列拆分成多个较短的列,同时确保拆分后的每个片段都具有语义完整性,即每个片段都以一个完整的句子结束,而不是在句子中间被截断。

本教程将提供一个结合了长度限制和句子完整性要求的解决方案,利用Python的pandas库和自然语言处理工具nltk来实现这一目标。

解决方案概述

核心思路是首先使用nltk库将长文本分解成独立的句子,然后通过一个自定义函数,将这些句子智能地组合成符合最大长度限制的文本块。每个文本块将作为DataFrame中的一个新列。

前提条件

在开始之前,请确保您的环境中已安装以下库:

pandas:用于数据处理和DataFrame操作。nltk:用于自然语言处理,特别是句子分词。

如果尚未安装,可以通过pip进行安装:

pip install pandas nltk

此外,nltk的句子分词器需要下载其punkt模型:

import nltknltk.download('punkt')

实现步骤

我们将通过一个具体的Python函数来演示如何实现文本的按句定长切分。

1. 导入必要的库

首先,导入pandas和nltk库。

import pandas as pdimport nltk

2. 定义自定义切分函数

接下来,定义一个名为split_sentences_by_length的函数。该函数接收文本字符串、最大长度限制和新列的前缀作为参数。

def split_sentences_by_length(text, max_len=300, prefix='col'):    """    将长文本按句子切分,并组合成不超过max_len的文本块。    每个文本块都以完整的句子结束。    Args:        text (str): 待切分的原始文本。        max_len (int): 每个文本块的最大字符长度。        prefix (str): 生成新列的名称前缀。    Returns:        pd.Series: 包含切分后文本块的Pandas Series,列名带有前缀和序号。    """    out = []  # 存储最终的文本块    current_chunk_sentences = []  # 存储当前文本块中的句子    current_chunk_length = 0  # 存储当前文本块的长度    # 使用nltk进行句子分词    sentences = nltk.sent_tokenize(text)    for sentence in sentences:        sentence_len = len(sentence)        # 计算将当前句子添加到当前文本块后的潜在长度        # 如果当前文本块非空,则需要加上一个空格的长度        potential_new_length = current_chunk_length + sentence_len + (1 if current_chunk_length > 0 else 0)        # 检查是否满足以下条件之一以开始一个新的文本块:        # 1. 添加当前句子会使总长度超过max_len,且当前文本块中已有句子。        #    在这种情况下,我们保存当前文本块,然后用当前句子开始新的文本块。        # 2. 当前句子本身就超过了max_len。        #    在这种情况下,我们将其作为一个独立的文本块(不拆分句子),        #    并清空当前文本块以准备下一个。        if potential_new_length > max_len and current_chunk_length > 0:            out.append(' '.join(current_chunk_sentences))            current_chunk_sentences = [sentence]            current_chunk_length = sentence_len        elif sentence_len > max_len:            # 如果句子本身就太长,将其作为一个单独的块。            # 先保存之前累积的任何句子(如果存在)。            if current_chunk_sentences:                out.append(' '.join(current_chunk_sentences))            out.append(sentence) # 将过长的句子作为独立的块            current_chunk_sentences = [] # 重置,为下一个块做准备            current_chunk_length = 0        else:            # 否则,将句子添加到当前文本块            current_chunk_sentences.append(sentence)            current_chunk_length = potential_new_length    # 添加循环结束后剩余的任何句子作为最后一个文本块    if current_chunk_sentences:        out.append(' '.join(current_chunk_sentences))    # 将结果转换为Pandas Series,并使用前缀命名列    return pd.Series(out).rename(lambda x: f'{prefix}_{x+1}')

函数逻辑详解:

初始化: out列表用于存储最终切分出的所有文本块。current_chunk_sentences存储正在构建的当前文本块中的句子,current_chunk_length记录其当前长度。句子分词: nltk.sent_tokenize(text)将输入文本分解成一个句子列表。迭代句子: 遍历每个句子:计算将当前句子添加到current_chunk_sentences后,潜在的文本块总长度。这里会考虑句子之间添加的空格(1 if current_chunk_length > 0 else 0)。条件判断:如果potential_new_length超过max_len,并且current_chunk_sentences中已经有句子(即current_chunk_length > 0),则表示当前文本块已满。此时,将current_chunk_sentences中的句子合并成一个字符串,添加到out中。然后,用当前句子开始一个新的文本块。如果当前句子sentence_len本身就超过了max_len,为了保证句子完整性,我们将其作为一个独立的文本块。如果current_chunk_sentences中还有未保存的句子,先保存它们。否则,当前句子可以安全地添加到current_chunk_sentences中,并更新current_chunk_length。**处理

以上就是Pandas DataFrame长文本按句切分与定长处理教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373981.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python f-string高级格式化:数字对齐、千位分隔符与小数精度控制
上一篇 2025年12月14日 13:45:12
Python JSON美化:UTF-8字符编码与VS Code控制台显示指南
下一篇 2025年12月14日 13:45:19

相关推荐

  • edge提示“由你的组织管理”怎么解除_edge解除“由你的组织管理”提示的方法

    edge提示“由你的组织管理”怎么解除_edge解除“由你的组织管理”提示的方法edge提示“由你的组织管理”怎么解除_edge解除“由你的组织管理”提示的方法edge提示“由你的组织管理”怎么解除_edge解除“由你的组织管理”提示的方法edge提示“由你的组织管理”怎么解除_edge解除“由你的组织管理”提示的方法

    首先删除注册表中HKEY_LOCAL_MACHINE和HKEY_CURRENT_USER下的Edge策略项,再通过gpedit.msc禁用组策略设置,接着重置Edge浏览器,排查卸载第三方管理软件,最后手动清除Local State文件中的管理配置。 如果您在使用 Microsoft Edge 浏览…

    2026年9月27日 • 用户投稿
    000
  • 显卡散热风扇的轴承技术如何影响噪音与寿命?

    显卡风扇的噪音和寿命主要由轴承类型决定,含油轴承成本低但寿命短、易变吵;滚珠轴承寿命长、稳定性好,但可能有轻微机械噪音;流体动压轴承(FDB/HDB)静音效果最佳、寿命最长,是高端显卡首选。此外,风扇叶片设计、电机品质、散热结构、安装方式及线圈啸叫等也影响整体噪音。通过定期除尘、优化风道、自定义风扇…

    2026年9月27日
    000
  • VSCode如何优化文件搜索速度 VSCode全局搜索的性能优化建议

    vscode文件搜索慢的核心原因是未合理排除无关文件及系统环境限制,解决方法是一套组合拳:1. 配置search.exclude在settings.json中排除node_modules、dist等无关文件夹;2. 确保使用.gitignore并开启search.useignorefiles;3. …

    2026年9月27日
    000
  • 【Linux/C++】Linux下C++命令行编译示例

    本文是关于c++++编程语言基础和linux系统操作基础的系列文章的第二部分。我们将详细介绍在linux环境下如何编译c++代码,并展示相关的编译示例和技巧。 文章目录 准备源代码编译实战引入目录进行编译使用-Wall、-std 参数进行编译生成库文件链接静态库生成可执行文件链接动态库生成可执行文件…

    2026年9月27日
    100
  • linux脚本怎么写

    linux脚本怎么写linux脚本怎么写linux脚本怎么写linux脚本怎么写

    编写 Linux 脚本涉及以下步骤:选择脚本语言(例如 Bash、Python)创建脚本文件并添加 Shebang 行(例如,#!/bin/bash)编写脚本内容,包括变量、命令、循环和条件语句赋予执行权限(chmod +x script.sh)运行脚本(./script.sh)脚本结构通常包括:S…

    2026年9月27日 • 用户投稿
    000
  • Gemini移动端如何节省流量 Gemini数据压缩与缓存设置指南

    Gemini移动端如何节省流量 Gemini数据压缩与缓存设置指南Gemini移动端如何节省流量 Gemini数据压缩与缓存设置指南Gemini移动端如何节省流量 Gemini数据压缩与缓存设置指南Gemini移动端如何节省流量 Gemini数据压缩与缓存设置指南

    gemini移动端节省流量的核心方法包括:1.开启应用内的数据压缩模式,选择低分辨率加载图片和视频;2.关闭自动播放功能,防止后台流量浪费;3.限制或关闭后台刷新与预加载,减少无谓的数据更新;4.定期清理缓存或设置缓存上限,避免过期数据重复下载;5.启用系统级低数据模式,限制后台流量使用;6.关闭g…

    2026年9月27日 • 用户投稿
    100
  • 星巴克点单抖音怎么弄的?快速了解方法与实用技巧

    星巴克点单抖音怎么弄的?快速了解方法与实用技巧星巴克点单抖音怎么弄的?快速了解方法与实用技巧星巴克点单抖音怎么弄的?快速了解方法与实用技巧星巴克点单抖音怎么弄的?快速了解方法与实用技巧

    引言: 在移动互联网高速发展的今天,抖音已成为大众记录生活、分享日常的重要社交平台。不少用户开始关注:是否可以直接在抖音上点星巴克咖啡?答案是肯定的!本文将为您详细介绍如何通过抖音轻松完成星巴克点单,并提供实用操作技巧与相关知识,助您畅享便捷又有趣的消费体验。 一、星巴克为何选择抖音点单?背后趋势解…

    2026年9月27日 • 用户投稿
    000
  • sublime怎么配置java语法检查_sublime Java语法检查配置

    sublime怎么配置java语法检查_sublime Java语法检查配置sublime怎么配置java语法检查_sublime Java语法检查配置sublime怎么配置java语法检查_sublime Java语法检查配置sublime怎么配置java语法检查_sublime Java语法检查配置

    首先安装Package Control,再通过它安装SublimeLinter和SublimeLinter-javac插件,确保系统已配置JDK并能全局运行javac,最后在SublimeLinter设置中启用javac,即可实现Java语法检查。 Sublime Text 本身不自带 Java 语…

    2026年9月27日 • 用户投稿
    1000
  • sublime怎么配置git_Sublime Text集成Git版本控制教程

    sublime怎么配置git_Sublime Text集成Git版本控制教程sublime怎么配置git_Sublime Text集成Git版本控制教程sublime怎么配置git_Sublime Text集成Git版本控制教程sublime怎么配置git_Sublime Text集成Git版本控制教程

    Sublime Text 本身不内置 Git 功能,但可以通过插件和外部 Git 环境实现集成。以下是配置 Sublime Text 使用 Git 的完整方法,帮助你在编辑器中便捷地进行版本控制操作。 1. 安装并配置 Git 环境 确保你的系统已安装 Git,并能通过命令行使用: Windows:…

    2026年9月27日 • 用户投稿
    100
  • win8如何分区硬盘_Win8硬盘分区教程

    win8如何分区硬盘_Win8硬盘分区教程win8如何分区硬盘_Win8硬盘分区教程win8如何分区硬盘_Win8硬盘分区教程win8如何分区硬盘_Win8硬盘分区教程

    首先打开磁盘管理工具,通过压缩卷释放未分配空间或删除分区清空区域,再利用新建简单卷向导设置大小、分配盘符并格式化为NTFS,从而完成分区创建或重组。 如果您希望在Windows 8系统中对硬盘进行重新规划,以便更好地管理文件或安装多个操作系统,则可以通过系统自带的磁盘管理工具来创建、调整或删除分区。…

    2026年9月27日 • 用户投稿
    100
  • 库迪咖啡的抖音优惠券:小程序核销操作步骤

    库迪咖啡的抖音优惠券:小程序核销操作步骤库迪咖啡的抖音优惠券:小程序核销操作步骤库迪咖啡的抖音优惠券:小程序核销操作步骤库迪咖啡的抖音优惠券:小程序核销操作步骤

    如今,抖音已成为社交平台中的热门应用,而库迪咖啡作为深受大众喜爱的连锁咖啡品牌,近期在抖音上线了多项吸引人的优惠券活动,引发众多咖啡爱好者争相参与。如果你也想获取并使用这些超值福利,却还不清楚具体如何操作,接下来将为你详细解析通过抖音小程序领取及核销优惠券的完整流程。 1. 启动抖音App 请确认你…

    2026年9月27日 • 用户投稿
    100
  • 怎样让 AI 模型持续改进工具与豆包配合进行改进?全流程指南​

    怎样让 AI 模型持续改进工具与豆包配合进行改进?全流程指南​怎样让 AI 模型持续改进工具与豆包配合进行改进?全流程指南​怎样让 AI 模型持续改进工具与豆包配合进行改进?全流程指南​怎样让 AI 模型持续改进工具与豆包配合进行改进?全流程指南​

    要让ai模型与豆包配合更好,需通过持续反馈、调优和迭代实现。1. 明确使用场景并设定目标,记录问题并打标签以指导优化方向;2. 善用豆包反馈机制,具体描述问题并定期分析反馈记录;3. 进阶用户可结合结构化外部数据进行微调并通过a/b测试验证效果;4. 优化提示词设计,明确角色、格式和逻辑顺序,提升交…

    2026年9月27日 • 用户投稿
    000
  • Sublime运行Python代码中文乱码_修改默认编码格式解决方案

    Sublime运行Python代码中文乱码_修改默认编码格式解决方案Sublime运行Python代码中文乱码_修改默认编码格式解决方案Sublime运行Python代码中文乱码_修改默认编码格式解决方案Sublime运行Python代码中文乱码_修改默认编码格式解决方案

    答案是修改文件编码声明、配置Sublime构建系统、更改系统区域设置或输出到文件。首先在Python文件首行添加# — coding: utf-8 –,然后在Sublime中创建自定义构建系统并设置环境变量PYTHONIOENCODING为utf-8,接着可调整Windows…

    2026年9月27日 • 用户投稿
    000
  • Java在Windows CMD终端实现ANSI颜色输出的策略与实践

    Java在Windows CMD终端实现ANSI颜色输出的策略与实践Java在Windows CMD终端实现ANSI颜色输出的策略与实践Java在Windows CMD终端实现ANSI颜色输出的策略与实践Java在Windows CMD终端实现ANSI颜色输出的策略与实践

    本文深入探讨了Java程序在Windows CMD终端中无法正确显示ANSI颜色代码的问题,并提供了两种有效的解决方案。针对不同Java版本和需求,我们介绍了通过外部命令(如echo)代理输出的兼容性方法,以及利用Java 22+ Foreign Function & Memory API直…

    2026年9月27日 • 用户投稿
    000
  • 夸克AI搜索和普通搜索的区别_夸克新旧搜索模式对比分析

    夸克AI搜索和普通搜索的区别_夸克新旧搜索模式对比分析夸克AI搜索和普通搜索的区别_夸克新旧搜索模式对比分析夸克AI搜索和普通搜索的区别_夸克新旧搜索模式对比分析夸克AI搜索和普通搜索的区别_夸克新旧搜索模式对比分析

    AI搜索通过理解意图生成直接答案,如夸克采用“先思考后搜索”策略,整合多源信息提供结构化回答。1、与传统关键词匹配不同,AI搜索输出分点建议等归纳内容。2、支持多轮对话与上下文追溯,可连续追问并准确识别指代对象。3、集成AI写作、文件总结等功能,实现从检索到任务解决的跃迁。4、在个性化推荐中强化隐私…

    2026年9月27日 • 用户投稿
    200
  • sublime怎么关联文件类型_Sublime Text设置特定文件扩展名的默认语法

    sublime怎么关联文件类型_Sublime Text设置特定文件扩展名的默认语法sublime怎么关联文件类型_Sublime Text设置特定文件扩展名的默认语法sublime怎么关联文件类型_Sublime Text设置特定文件扩展名的默认语法sublime怎么关联文件类型_Sublime Text设置特定文件扩展名的默认语法

    在Sublime Text中设置特定文件扩展名的默认语法:打开文件后点击右下角语法名称,选择所需模式并设为该扩展名默认;2. 可通过编辑Packages/User/Preferences.sublime-settings文件添加extensions映射,指定.log用Plain Text、.myco…

    2026年9月27日 • 用户投稿
    100
  • 豆包AI如何实现自动化部署?CI/CD流程优化方案

    豆包AI如何实现自动化部署?CI/CD流程优化方案豆包AI如何实现自动化部署?CI/CD流程优化方案豆包AI如何实现自动化部署?CI/CD流程优化方案豆包AI如何实现自动化部署?CI/CD流程优化方案

    豆包ai的自动化部署通过标准化流程和工具链整合实现,其核心是利用ci/cd机制打通开发、测试、构建、发布等环节。1. ci/cd是指持续集成与持续交付/部署,确保代码提交后自动构建、测试并部署到相应环境,提升效率并减少人为错误。2. 关键步骤包括:代码提交触发ci、自动构建镜像、运行测试、部署至目标…

    2026年9月27日 • 用户投稿
    100
  • 解决Spring Boot与React应用在AWS部署中CORS错误的终极指南

    解决Spring Boot与React应用在AWS部署中CORS错误的终极指南解决Spring Boot与React应用在AWS部署中CORS错误的终极指南解决Spring Boot与React应用在AWS部署中CORS错误的终极指南解决Spring Boot与React应用在AWS部署中CORS错误的终极指南

    本文旨在解决在Spring Boot后端(AWS EC2)和React前端(AWS S3)部署时,即使服务器端已配置宽松的CORS策略,仍出现跨域资源共享(CORS)错误的问题。我们将深入探讨常见误区,并提供一个将CORS配置与Spring Security有效整合的专业解决方案,同时强调处理wit…

    2026年9月27日 • 用户投稿
    100
  • 电脑内存超过 4GB,安装 32 位系统和 64 位系统有什么区别?

    电脑内存超过 4GB,安装 32 位系统和 64 位系统有什么区别?电脑内存超过 4GB,安装 32 位系统和 64 位系统有什么区别?电脑内存超过 4GB,安装 32 位系统和 64 位系统有什么区别?电脑内存超过 4GB,安装 32 位系统和 64 位系统有什么区别?

    64位系统能充分利用大内存并提升性能与安全性。当内存超过4GB时,32位系统受限于4GB寻址上限,仅能使用约3.5GB,造成资源浪费;而64位系统可完全利用8GB、16GB等大内存,显著提升多任务处理和运行效率。此外,64位架构支持更宽数据总线、更多寄存器及SSE/AVX指令集,增强计算能力,尤其利…

    2026年9月27日 • 用户投稿
    000
  • 铁路12306怎么激活会员_铁路12306会员激活方式

    铁路12306怎么激活会员_铁路12306会员激活方式铁路12306怎么激活会员_铁路12306会员激活方式铁路12306怎么激活会员_铁路12306会员激活方式铁路12306怎么激活会员_铁路12306会员激活方式

    先激活铁路畅行会员账户才能享受购票优惠或兑换车票。可通过12306 App在线激活,进入“铁路会员”页面,选择“在线激活”,完成人脸识别和协议确认;若失败,可持身份证至车站自助机或服务窗口,选择“会员激活”,输入交易密码完成激活。 如果您想通过积分累积来享受购票优惠或免费兑换车票,但尚未开通相关权益…

    2026年9月27日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信