使用Java和Apache PDFBox实现PDF文本搜索与文件操作

使用Java和Apache PDFBox实现PDF文本搜索与文件操作

本教程详细介绍了如何使用java编程语言结合apache pdfbox库,高效且准确地在pdf文件中搜索指定文本。文章将指导读者完成pdf内容的提取、文本搜索逻辑的实现,并根据搜索结果进行文件复制或移动等操作,确保pdf文件的完整性,避免直接将pdf作为普通文本文件处理可能导致的问题。

1. 理解PDF文件与文本搜索的挑战

PDF(Portable Document Format)文件是一种复杂的二进制格式,它不仅包含文本信息,还包含字体、图像、布局、元数据等多种元素。因此,直接使用Java的 FileReader 或 BufferedReader 对PDF文件进行逐行读取,并尝试使用 String.contains() 进行文本搜索是不可行的。这种方法会将PDF文件的二进制内容当作普通文本来处理,导致读取到的内容是乱码,无法进行有效搜索,甚至可能在后续的文件操作中破坏PDF文件的结构。

为了准确地从PDF文件中提取可读文本并进行搜索,我们需要借助专门的PDF处理库来解析PDF文件的内部结构。

2. 引入Apache PDFBox库

Apache PDFBox是一个开源的Java库,用于处理PDF文档。它提供了丰富的功能,包括创建新PDF文档、修改现有文档、从PDF中提取文本、渲染PDF页面为图像等。对于从PDF中提取文本的需求,PDFBox是业界标准且高效的选择。

要在项目中引入PDFBox,如果您使用Maven,可以在 pom.xml 文件中添加以下依赖:

立即学习“Java免费学习笔记(深入)”;

    org.apache.pdfbox    pdfbox    2.0.29 

如果您使用Gradle,可以在 build.gradle 文件中添加:

implementation 'org.apache.pdfbox:pdfbox:2.0.29' // 请使用最新稳定版本

3. 从PDF文件中提取文本

使用PDFBox从PDF文件中提取文本的基本步骤如下:

加载PDF文档: 使用 PDDocument.load() 方法加载一个PDF文件。创建文本提取器: 实例化 PDFTextStripper 类,它是PDFBox中用于提取文本的核心组件。提取文本: 调用 PDFTextStripper 对象的 getText() 方法,传入加载的 PDDocument 对象,即可获取PDF文档的全部文本内容。关闭文档: 务必调用 PDDocument.close() 方法来释放资源,特别是在处理大量PDF文件时,这可以避免内存泄漏。

以下是一个简单的示例代码,演示如何从PDF文件中提取所有文本并打印到控制台:

稿定抠图 稿定抠图

AI自动消除图片背景

稿定抠图 76 查看详情 稿定抠图

import java.io.File;import java.io.IOException;import org.apache.pdfbox.pdmodel.PDDocument;import org.apache.pdfbox.text.PDFTextStripper;public class PdfTextExtractor {    /**     * 从指定的PDF文件中提取所有文本内容。     * @param pdfFilePath PDF文件的路径     * @return 提取到的文本内容     * @throws IOException 如果文件操作失败     */    public static String extractTextFromPdf(String pdfFilePath) throws IOException {        File file = new File(pdfFilePath);        // 使用 try-with-resources 确保 PDDocument 资源被正确关闭        try (PDDocument document = PDDocument.load(file)) {            PDFTextStripper pdfStripper = new PDFTextStripper();            return pdfStripper.getText(document);        }    }    public static void main(String[] args) {        String pdfPath = "D:Sample.pdf"; // 替换为您的PDF文件路径        try {            String text = extractTextFromPdf(pdfPath);            System.out.println("从PDF中提取的文本内容:" + text.substring(0, Math.min(text.length(), 500)) + "..."); // 打印部分内容        } catch (IOException e) {            System.err.println("读取PDF文件时发生错误:" + e.getMessage());            e.printStackTrace();        }    }}

4. 实现PDF文本搜索逻辑

一旦我们能够从PDF文件中提取出完整的文本内容,接下来的文本搜索就变得和处理普通字符串一样简单了。我们可以使用 String.contains() 方法来检查提取出的文本是否包含目标关键词。

为了使搜索功能更灵活,我们可以:

忽略大小写: 将提取出的文本和搜索关键词都转换为小写或大写进行比较。支持多词搜索: 循环处理多个关键词,或者使用正则表达式进行更复杂的匹配。

以下代码片段展示了如何结合用户输入和 String.contains() 进行文本搜索:

import java.io.File;import java.io.IOException;import java.util.Scanner;import org.apache.pdfbox.pdmodel.PDDocument;import org.apache.pdfbox.text.PDFTextStripper;public class PdfSearcher {    /**     * 检查PDF文件是否包含指定的关键词。     * @param pdfFilePath PDF文件的路径     * @param searchTerm 要搜索的关键词     * @param ignoreCase 是否忽略大小写     * @return 如果找到关键词则返回 true,否则返回 false     * @throws IOException 如果文件操作失败     */    public static boolean searchWordInPdf(String pdfFilePath, String searchTerm, boolean ignoreCase) throws IOException {        String pdfText = PdfTextExtractor.extractTextFromPdf(pdfFilePath);        if (pdfText == null || pdfText.isEmpty()) {            return false;        }        if (ignoreCase) {            return pdfText.toLowerCase().contains(searchTerm.toLowerCase());        } else {            return pdfText.contains(searchTerm);        }    }    public static void main(String[] args) {        Scanner scanner = new Scanner(System.in);        String pdfPath = "C:Usersuser012DesktopEvalution.pdf"; // 替换为您的PDF文件路径        System.out.println("请输入您要搜索的词语 (输入'Exit'退出):");        while (scanner.hasNextLine()) {            String searchTerm = scanner.nextLine();            if (searchTerm.equalsIgnoreCase("Exit")) {                break;            }            try {                boolean found = searchWordInPdf(pdfPath, searchTerm, true); // 忽略大小写搜索                if (found) {                    System.out.println("是的,'" + searchTerm + "' 在文件中找到了。");                    // 在这里可以添加文件操作逻辑                } else {                    System.out.println("没有,'" + searchTerm + "' 在文件中未找到。");                }            } catch (IOException e) {                System.err.println("搜索PDF文件时发生错误:" + e.getMessage());                e.printStackTrace();            }            System.out.println("请输入您要搜索的词语 (输入'Exit'退出):");        }        scanner.close();        System.out.println("程序结束。");    }}

5. 根据搜索结果执行文件操作

在确认PDF文件包含目标关键词后,我们可以执行相应的文件操作,例如将文件复制或移动到指定目录。Java 7 引入的 java.nio.file.Files 类提供了强大而灵活的文件系统操作功能,是进行文件复制和移动的首选。

Files.copy(source, target, options): 复制文件。Files.move(source, target, options): 移动文件(可以理解为复制后删除源文件)。

这些方法可以指定 StandardCopyOption 来控制复制或移动的行为,例如 REPLACE_EXISTING(如果目标文件已存在则替换)或 ATOMIC_MOVE(原子性移动,保证要么成功要么失败,不会出现部分移动的情况)。

import java.io.File;import java.io.IOException;import java.nio.file.Files;import java.nio.file.Path;import java.nio.file.Paths;import java.nio.file.StandardCopyOption;import java.util.Scanner;import org.apache.pdfbox.pdmodel.PDDocument;import org.apache.pdfbox.text.PDFTextStripper;public class PdfSearchAndMove {    /**     * 从指定的PDF文件中提取所有文本内容。     * @param pdfFilePath PDF文件的路径     * @return 提取到的文本内容     * @throws IOException 如果文件操作失败     */    public static String extractTextFromPdf(String pdfFilePath) throws IOException {        File file = new File(pdfFilePath);        try (PDDocument document = PDDocument.load(file)) {            PDFTextStripper pdfStripper = new PDFTextStripper();            return pdfStripper.getText(document);        }    }    /**     * 检查PDF文件是否包含指定的关键词。     * @param pdfFilePath PDF文件的路径     * @param searchTerm 要搜索的关键词     * @param ignoreCase 是否忽略大小写     * @return 如果找到关键词则返回 true,否则返回 false     * @throws IOException 如果文件操作失败     */    public static boolean searchWordInPdf(String pdfFilePath, String searchTerm, boolean ignoreCase) throws IOException {        String pdfText = extractTextFromPdf(pdfFilePath);        if (pdfText == null || pdfText.isEmpty()) {            return false;        }        if (ignoreCase) {            return pdfText.toLowerCase().contains(searchTerm.toLowerCase());        } else {            return pdfText.contains(searchTerm);        }    }    /**     * 将文件移动到目标目录。     * @param sourcePath 源文件路径     * @param targetDirectory 目标目录路径     * @param fileName 目标文件名     * @throws IOException 如果文件移动失败     */    public static void moveFile(String sourcePath, String targetDirectory, String fileName) throws IOException {        Path source = Paths.get(sourcePath);        Path targetDir = Paths.get(targetDirectory);        if (!Files.exists(targetDir)) {            Files.createDirectories(targetDir); // 如果目标目录不存在则创建        }        Path target = targetDir.resolve(fileName); // 目标文件路径        Files.move(source, target, StandardCopyOption.REPLACE_EXISTING); // 移动文件,如果目标存在则替换        System.out.println("文件 '" + source.getFileName() + "' 已成功移动到 '" + targetDirectory + "'。");    }    public static void main(String[] args) {        Scanner scanner = new Scanner(System.in);        String sourcePdfPath = "C:Usersuser012DesktopEvalution.pdf"; // 源PDF文件路径        String targetDirectory = "C:Usersuser012DesktopSearch"; // 目标目录        String targetFileName = "Evalution2.pdf"; // 移动后的文件名        System.out.println("请输入您要搜索的词语 (输入'Exit'退出):");        while (scanner.hasNextLine()) {            String searchTerm = scanner.nextLine();            if (searchTerm.equalsIgnoreCase("Exit")) {                break;            }            try {                boolean found = searchWordInPdf(sourcePdfPath, searchTerm, true); // 忽略大小写搜索                if (found) {                    System.out.println("是的,'" + searchTerm + "' 在文件中找到了。");                    // 执行文件移动操作                    moveFile(sourcePdfPath, targetDirectory, targetFileName);                } else {                    System.out.println("没有,'" + searchTerm + "' 在文件中未找到。");                }            } catch (IOException e) {                System.err.println("处理PDF文件或执行文件操作时发生错误:" + e.getMessage());                e.printStackTrace();            }            System.out.println("请输入您要搜索的词语 (输入'Exit'退出):");        }        scanner.close();        System.out.println("程序结束。");    }}

6. 注意事项与最佳实践

资源管理: 始终使用 try-with-resources 语句来加载 PDDocument 对象,确保在操作完成后能够自动关闭文档并释放系统资源,避免内存泄漏。错误处理: 在文件操作和PDF处理过程中,IOException 是常见的异常。应捕获并妥善处理这些异常,例如打印错误信息、记录日志或向用户提供友好的提示。文件路径: 确保提供的文件路径是正确的,并且程序有权限访问这些文件和目录。在Windows系统中,路径分隔符可以使用 或 /。目标目录创建: 在移动或复制文件之前,最好检查目标目录是否存在,如果不存在则创建它,以避免 NoSuchFileException。性能考虑: 对于非常大的PDF文件,提取文本可能会消耗较多的内存和时间。如果只需要搜索PDF的特定页面或区域,可以优化 PDFTextStripper 的配置。多词搜索与正则表达式: 如果需要搜索多个关键词或更复杂的模式,可以考虑使用Java的正则表达式(java.util.regex.Pattern 和 Matcher 类)来增强搜索功能。并发处理: 如果需要同时处理大量PDF文件,可以考虑使用Java的并发API(如 ExecutorService)来并行处理,提高效率。

7. 总结

本教程详细阐述了如何使用Java和Apache PDFBox库来解决PDF文件中的文本搜索问题。通过引入专业的PDF处理库,我们能够准确地从PDF文件中提取文本内容,并在此基础上实现可靠的文本搜索逻辑。结合 java.nio.file.Files 进行文件操作,我们可以在搜索成功后,安全、高效地对PDF文件进行复制或移动。这种方法避免了直接将PDF作为普通文本文件处理所带来的问题,确保了文件内容的完整性和操作的正确性。掌握这些技术,将使您在Java项目中处理PDF文件时更加得心应手。

以上就是使用Java和Apache PDFBox实现PDF文本搜索与文件操作的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1081591.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
谷歌学术搜索引擎官网 谷歌学术搜索镜像入口永久直达
上一篇 2025年12月2日 07:48:34
如何用css浮动实现图片瀑布流效果
下一篇 2025年12月2日 07:48:36

相关推荐

  • win11保存Hosts文件时提示权限不足怎么办_win11Hosts文件权限不足解决方法

    首先通过修改文件属性安全权限或以管理员身份运行编辑器解决Hosts文件保存权限问题,具体可选择:1、调整Hosts文件安全选项卡中的用户权限;2、右键以管理员身份运行记事本后打开并修改;3、通过管理员命令提示符执行notepad命令直接编辑并保存。 如果您尝试修改 Windows 11 系统中的 H…

    2026年9月22日
    000
  • Java类中Jackson @JsonNaming策略的运行时内省

    本文介绍如何在运行时动态内省Java类上通过@JsonNaming注解配置的Jackson PropertyNamingStrategy。通过利用ObjectMapper的SerializationConfig和JacksonAnnotationIntrospector,开发者可以编程方式获取类的命…

    2026年9月22日
    200
  • 解决PHP扩展缺失错误:phpinfo验证与服务重启指南

    本文旨在解决%ignore_a_1%脚本运行时提示特定扩展(如json、mbstring)缺失的问题,即便用户已在php配置中手动启用。核心解决方案是利用`phpinfo()`函数验证扩展的实际加载状态,并强调在修改php配置后,必须重启相关的web服务器或php-fpm服务,以确保新的配置生效。 …

    2026年9月22日
    100
  • windows怎么恢复已删除的输入法_已卸载输入法恢复技巧

    首先通过语言设置重新添加输入法,进入设置→时间和语言→语言和区域→语言选项→键盘→添加所需输入法;若无效可使用控制面板,在区域和语言中更改键盘设置并添加;还可从其他设备导出注册表中Keyboard Layout与InputMethod相关项导入本机;最后可通过系统还原点恢复删除前的输入法配置。 如果…

    2026年9月22日
    300
  • VSCode安装C/C++文档查看 提升开发效率的VSCode技巧

    答案是利用C/C++扩展和cppreference插件实现高效文档查阅。首先安装微软官方C/C++扩展,启用智能感知与悬停提示;再安装cppreference扩展,通过命令面板直接搜索标准库函数,实现离线在线无缝查阅;结合Doxygen生成项目文档,使用“转到定义”功能快速跳转源码;同时借助Inte…

    2026年9月22日
    000
  • 高效利用 PriorityQueue 合并并排序多个列表

    本教程详细阐述了如何使用 Java 的 PriorityQueue 高效地合并并排序多个整数列表。文章首先指出将列表作为元素放入 PriorityQueue 的常见误区,进而纠正为应将单个整数元素放入队列。接着,它演示了如何正确声明、填充 PriorityQueue,并强调了通过循环调用 poll(…

    2026年9月22日
    300
  • 如何配置Android开发环境 Android Studio安装与JDK配置方法

    答案:配置Android开发环境需先安装JDK并设置环境变量,再下载安装Android Studio,配置SDK及虚拟设备,最后创建项目测试。具体步骤包括:1. 安装JDK 17并配置JAVA_HOME和Path;2. 从官网下载Android Studio并安装,自动集成SDK;3. 通过SDK …

    2026年9月22日
    100
  • ClipStudioPaintPro如何导出AI漫画图片?保存图像的详细指南

    导出AI漫画图片需通过Clip Studio Paint Pro的“文件”菜单选择“导出”,根据用途选单页、多页或Webtoon导出,推荐PNG用于高质量或透明背景需求,JPG用于网络分享以平衡文件大小与画质,设置300dpi以上分辨率确保清晰度,色彩配置选用sRGB保障跨平台一致性,批量导出时利用…

    2026年9月22日
    100
  • 谷歌浏览器官网直接进入 Chrome浏览器官方登录入口

    谷歌浏览器官网直接进入方式为访问https://www.google.com/chrome/,该网站是Chrome官方登录入口,提供跨平台同步、V8引擎加速、地址栏集成搜索、自动填充表单等核心功能,支持极简界面、深色模式、自定义新标签页及侧边栏服务,具备安全浏览、隐私沙盒、密码检查和无痕模式等安全机…

    2026年9月22日
    100
  • Laravel 8 注册成功但登录失败的解决方案

    本文针对 Laravel 8 中使用 php artisan ui:auth 生成的认证系统,注册功能正常但登录功能失效的问题,提供了一种解决方案。通过重写 LoginController 中的 username() 方法,将认证字段从默认的 email 修改为 username,从而解决登录失败的…

    2026年9月22日
    000
  • 如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧

    如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧

    Gravit Designer没有内置AI智能抠图功能,但通过形状裁剪(剪切蒙版)、路径编辑和布尔运算等工具组合,可实现高精度、非破坏性的精细化裁剪。其“智能”体现在非破坏性编辑、矢量级精度和工具协同的灵活性,虽需手动操作,却能完全掌控裁剪过程,适合追求专业输出的设计师。 ☞☞☞AI 智能聊天, 问…

    2026年9月22日 用户投稿
    100
  • 虎卫战神AI巡航玩法指南

    虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南

    在《虎卫战神》中,战力的提升始终是每位玩家的核心目标。无论是装备强化、任务奖励、主公升阶,还是转生炼体,各类成长系统都离不开关键材料的支持。而这些材料大多需通过挑战BOSS获取,主线任务推进同样依赖击败指定数量的BOSS。 频繁切换地图、升级效率低下是否让你倍感疲惫?别担心!2025年必备的AI巡航…

    2026年9月22日 用户投稿
    000
  • MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

    MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

    mysql跨数据库查询的核心方法是在sql语句中通过“数据库名.表名”方式指定不同数据库的表,实现数据联动。1.在同一个mysql实例内,直接使用数据库名加表名进行关联查询,如db_user.users和db_order.orders,前提是用户需具备相应权限且建议对关联字段建立索引以提升性能;2.…

    2026年9月22日 用户投稿
    400
  • Procreate的AI混合工具怎么用?提升数字绘画效率的实用教程

    Procreate虽无直接名为“AI混合工具”的功能,但其图层混合模式、涂抹工具、Alpha锁定与剪裁蒙版等设计,共同构成了智能化的色彩混合体系。通过正片叠底、滤色等模式可实现自然光影叠加,涂抹工具结合纹理笔刷能模拟真实颜料融合,Alpha锁定和剪裁蒙版则确保混合精准可控。分层渐变、低不透明度叠加及…

    2026年9月22日
    700
  • windows怎么设置自动清理回收站_windows自动清理回收站的设置步骤

    可通过存储感知、组策略或任务计划程序设置回收站自动清理。首先启用存储感知并配置回收站文件保留时间;其次专业版用户可使用组策略编辑器精细管理回收站容量与清理周期;最后通过任务计划程序创建定时任务,运行PowerShell命令“Clear-RecycleBin -Force”实现自动化清理。 如果您发现…

    2026年9月22日
    000
  • VSCode高效配置Node.js:npm集成、中文报错、断点调试

    答案:高效配置VSCode与Node.js需确保Node.js和npm为最新版,利用集成终端运行命令,通过jsconfig.json或tsconfig.json优化项目配置,解决中文乱码需设置终端编码为UTF-8并选择支持中文的字体,调试核心是正确配置launch.json文件,使用pwa-node…

    2026年9月22日
    400
  • unix怎么安装php_unix系统安装php环境指南

    首先确认系统环境并检查是否已安装相关软件,然后选择包管理器或源码编译方式安装PHP;推荐使用包管理器快速安装,如Debian/Ubuntu用apt,CentOS/RHEL/Fedora用yum或dnf,FreeBSD用pkg;安装后配置Web服务器,Apache需加载mod_php或集成PHP-FP…

    2026年9月22日
    300
  • windows8桌面图标有蓝色阴影怎么去掉_windows8取消桌面图标蓝色底纹的方法

    1、调整视觉效果设置,取消“在桌面上为图标标签使用阴影”可消除蓝色背景;2、解除桌面Web项目锁定并清除Web内容;3、专业版用户可通过组策略禁用Active Desktop功能以彻底解决问题。 如果您发现Windows 8系统中的桌面图标带有蓝色阴影或底纹,这通常是由于系统视觉效果设置或桌面项目锁…

    2026年9月22日
    100
  • 如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

    如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

    答案是优化数据管道、采用分布式训练、应用内存优化技术、精细调参。具体包括:使用RecordIO格式和DataLoader多进程预取提升数据加载效率;通过KVStore选择device或dist_sync/dist_async实现单机或多机分布式训练;利用混合精度训练、梯度累积和模型符号化降低显存占用…

    2026年9月22日 用户投稿
    000
  • itextpdf freemarker渲染

    关于打印pdf操作的需求,经过研究,发现以下两种方法: 在现有的模板上进行编辑,这种方法操作难度较大。而通过FreeMarker生成静态页面,然后转换为HTML,操作更为顺畅。动态生成PDF的方法在网上参考较多,经过对比,我认为使用FreeMarker结合IText生成PDF最为简单。参考链接为ht…

    2026年9月22日
    300

发表回复

登录后才能评论
关注微信