Java中利用正则表达式统计HashMap值中特定单词出现频率并重复记录关联键

Java中利用正则表达式统计HashMap值中特定单词出现频率并重复记录关联键

本文详细介绍了如何在Java中高效地统计HashMap中每个键所对应字符串值内特定单词的出现次数,并根据出现次数重复记录对应的键。针对传统字符串方法无法准确计数的问题,教程核心阐述了如何利用java.util.regex包中的Pattern和Matcher类,结合精确的正则表达式模式,实现对单词的精准匹配和计数,最终生成符合期望的重复键列表。

问题阐述

在java开发中,我们有时会遇到这样的场景:有一个hashmap,其中键是整数标识,值是包含文本的字符串(例如句子)。我们的目标是统计某个特定单词(例如”car”)在每个字符串值中出现的频率。更进一步的要求是,如果某个键对应的字符串中目标单词出现了n次,那么这个键就应该在结果列表中被记录n次。

例如,如果键5对应的字符串是”car car car car”,那么在最终结果列表中,5应该出现4次。

初始的尝试可能如下所示,它使用String.contains()方法来检查单词是否存在:

import java.util.ArrayList;import java.util.HashMap;import java.util.Map;public class WordCounterInitial {    public static void main(String[] args) {        Map carHashMap = new HashMap();        ArrayList showCarsInMap = new ArrayList();        carHashMap.put(1, "this car is very fast car");        carHashMap.put(2, "i have a old car");        carHashMap.put(3, "my first car was an mercedes and my second car was an audi");        carHashMap.put(4, "today is a good day");        carHashMap.put(5, "car car car car");        for (Map.Entry entrySection : carHashMap.entrySet()) {            if (entrySection.getValue().contains("car")) {                showCarsInMap.add(entrySection.getKey());            }        }        System.out.println("Car : " + showCarsInMap);        // 实际输出: Car : [1, 2, 3, 5]        // 期望输出: Car : [1, 1, 2, 3, 3, 5, 5, 5, 5]    }}

上述代码的局限性在于contains()方法只能判断字符串是否包含某个子串,而无法统计其出现的次数。因此,无论”car”在一个字符串中出现一次还是多次,对应的键都只会被添加一次,这不符合我们的需求。

解决方案:利用正则表达式

为了精确统计单词的出现次数,并处理单词边界(例如”cars”中的”car”不应被计入),我们可以利用Java的java.util.regex包,它提供了强大的正则表达式匹配功能。

立即学习“Java免费学习笔记(深入)”;

核心思路是:

定义一个正则表达式模式,该模式能精确匹配整个目标单词。对HashMap中的每个字符串值,创建一个Matcher对象。使用Matcher.find()方法循环查找所有匹配项,每找到一个匹配项,就将当前键添加到结果列表中。

核心代码片段

import java.util.ArrayList;import java.util.HashMap;import java.util.Map;import java.util.regex.Matcher;import java.util.regex.Pattern;public class WordCounterRegex {    public static void main(String[] args) {        Map carHashMap = new HashMap();        ArrayList showCarsInMap = new ArrayList();        carHashMap.put(1, "this car is very fast car");        carHashMap.put(2, "i have a old car");        carHashMap.put(3, "my first car was an mercedes and my second car was an audi");        carHashMap.put(4, "today is a good day");        carHashMap.put(5, "car car car car");        // 遍历HashMap的每一个条目        for (Map.Entry entrySection : carHashMap.entrySet()) {            // 定义正则表达式模式,用于精确匹配整个单词"car"            // (?:^|W) 匹配字符串开头或非单词字符(如空格、标点符号)            // car 匹配目标单词            // (?:$|W) 匹配字符串结尾或非单词字符            Pattern p = Pattern.compile("(?:^|W)car(?:$|W)");             Matcher m = p.matcher(entrySection.getValue());            // 循环查找所有匹配项            while (m.find()) {                // 每找到一个匹配,就将当前键添加到列表中                showCarsInMap.add(entrySection.getKey());            }        }        System.out.println("Car : " + showCarsInMap);        // 预期输出: Car : [1, 1, 2, 3, 3, 5, 5, 5, 5]    }}

正则表达式解析

Pattern.compile(“(?:^|W)car(?:$|W)”) 是实现精确匹配的关键:

car: 这是我们要查找的目标单词。(?:…): 这是一个非捕获组。它将括号内的模式作为一个整体进行匹配,但不会将匹配到的内容存储起来供后续引用,从而提高效率。^: 匹配字符串的开头。$: 匹配字符串的结尾。W: 匹配任何非单词字符。单词字符包括字母、数字和下划线 ([a-zA-Z0-9_])。因此,W 会匹配空格、标点符号等。|: 逻辑或操作符,表示匹配|左边或右边的任何一个模式。

结合起来:

(?:^|W):表示单词”car”的前面必须是字符串的开头或者一个非单词字符。这确保了我们不会匹配到像”cars”、”racingcar”等单词中的”car”部分。(?:$|W):表示单词”car”的后面必须是字符串的结尾或者一个非单词字符。这同样确保了只匹配独立的”car”单词。

通过这种方式,我们可以确保只有完整的、独立的”car”单词才会被计数。

注意事项与扩展

大小写不敏感匹配: 如果需要进行大小写不敏感的匹配,可以在编译Pattern时添加Pattern.CASE_INSENSITIVE标志:

Pattern p = Pattern.compile("(?:^|W)car(?:$|W)", Pattern.CASE_INSENSITIVE);

这样,”Car”、”car”、”CAR”等都会被匹配。

匹配多个单词: 如果需要统计多个目标单词,可以修改正则表达式,或者对每个目标单词重复上述逻辑。例如,要匹配”car”或”truck”,可以使用:

Pattern p = Pattern.compile("(?:^|W)(car|truck)(?:$|W)", Pattern.CASE_INSENSITIVE);

性能考量: 对于非常大的数据集和极长的字符串,正则表达式的性能可能需要关注。然而,对于大多数常见用例,java.util.regex提供了非常高效的实现。如果性能成为瓶颈,可以考虑更底层的字符串解析方法,但这通常会增加代码的复杂性。

单词边界: 另一种更简洁的表示单词边界的正则表达式是。代表单词边界,即一个单词字符与一个非单词字符之间的位置,或者字符串的开头/结尾。因此,car通常也能达到相同的效果,并且更易读。

Pattern p = Pattern.compile("bcarb");// 或者大小写不敏感:// Pattern p = Pattern.compile("bcarb", Pattern.CASE_INSENSITIVE);

在大多数情况下, 是更推荐的单词边界匹配方式。然而,本教程沿用了问题答案中提供的(?:W|^)word(?:W|$)形式,因为它在某些特定边缘情况下可能提供更精细的控制(尽管对于简单的单词匹配,通常足够)。

总结

通过利用java.util.regex包中的Pattern和Matcher类,我们可以高效且准确地统计HashMap中字符串值内特定单词的出现频率,并根据需求重复记录关联的键。正则表达式提供了强大的模式匹配能力,是处理此类文本分析任务的理想工具。理解并灵活运用正则表达式,将极大地提升Java程序处理字符串的效率和精确度。

以上就是Java中利用正则表达式统计HashMap值中特定单词出现频率并重复记录关联键的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/119628.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Linux命令行中jobs与bg、fg命令详解
上一篇 2025年11月25日 18:47:19
qq浏览器怎么查看网页加载时间_qq浏览器开发者工具查看网页加载耗时方法
下一篇 2025年11月25日 18:49:22

相关推荐

  • 谷歌浏览器官网直接进入 Chrome浏览器官方登录入口

    谷歌浏览器官网直接进入方式为访问https://www.google.com/chrome/,该网站是Chrome官方登录入口,提供跨平台同步、V8引擎加速、地址栏集成搜索、自动填充表单等核心功能,支持极简界面、深色模式、自定义新标签页及侧边栏服务,具备安全浏览、隐私沙盒、密码检查和无痕模式等安全机…

    2026年9月22日
    100
  • Linux命令行中last命令的实用技巧

    last命令用于查看Linux用户登录历史,读取/var/log/wtmp文件。1. 查看指定用户登录记录:执行last username(如last alice)可审计特定账户活动;2. 限制输出行数:使用last -n 10或last -10避免刷屏,便于脚本处理;3. 识别远程登录来源:pts…

    2026年9月22日
    000
  • 拼多多商家版怎么赚钱?拼多多商家版怎么赚钱提现

    答案:通过拼多多商家版开设虚拟资料店铺,缴纳500元保证金注册个人店,选品如PPT模板、教程等高需求低风险商品,利用阿奇索等工具设置自动发货,结合低价引流和付费推广提升销量,订单完成后资金在T+1或T+7结算周期后提现至银行卡。 如果您想通过拼多多商家版实现盈利并完成资金提现,需要了解其核心的运营模…

    2026年9月22日
    400
  • 如何在mysql中实现热备份

    最推荐的MySQL热备份方案是结合Percona XtraBackup全量备份与binlog增量备份,并通过主从复制实现高可用。首先使用XtraBackup对InnoDB引擎进行在线全量备份,无需锁表;备份后执行–prepare确保数据一致性,恢复时用–copy-back还原…

    2026年9月22日
    000
  • Laravel 8 注册成功但登录失败的解决方案

    本文针对 Laravel 8 中使用 php artisan ui:auth 生成的认证系统,注册功能正常但登录功能失效的问题,提供了一种解决方案。通过重写 LoginController 中的 username() 方法,将认证字段从默认的 email 修改为 username,从而解决登录失败的…

    2026年9月22日
    000
  • 如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧

    如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧如何在GravitDesigner中使用AI裁剪图片?快速掌握裁剪技巧

    Gravit Designer没有内置AI智能抠图功能,但通过形状裁剪(剪切蒙版)、路径编辑和布尔运算等工具组合,可实现高精度、非破坏性的精细化裁剪。其“智能”体现在非破坏性编辑、矢量级精度和工具协同的灵活性,虽需手动操作,却能完全掌控裁剪过程,适合追求专业输出的设计师。 ☞☞☞AI 智能聊天, 问…

    2026年9月22日 用户投稿
    100
  • VSCode搭建Vivado开发环境(详细配置指南,FPGA开发必备)

    答案:通过安装Verilog/SystemVerilog和Tcl扩展、配置Linter进行语法检查,并在tasks.json中定义调用Vivado命令行的任务,可在VSCode中实现RTL开发、语法高亮、智能提示及综合仿真等自动化流程,提升FPGA开发效率。 将VSCode作为Vivado的开发前端…

    2026年9月22日
    000
  • 虎卫战神AI巡航玩法指南

    虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南虎卫战神AI巡航玩法指南

    在《虎卫战神》中,战力的提升始终是每位玩家的核心目标。无论是装备强化、任务奖励、主公升阶,还是转生炼体,各类成长系统都离不开关键材料的支持。而这些材料大多需通过挑战BOSS获取,主线任务推进同样依赖击败指定数量的BOSS。 频繁切换地图、升级效率低下是否让你倍感疲惫?别担心!2025年必备的AI巡航…

    2026年9月22日 用户投稿
    000
  • iPhone如何进行批量修图

    利用相册内置编辑功能 打开 iPhone 相册,选择你希望批量处理的多张图片。点击任意一张进入编辑模式,进行基础调整,例如亮度、对比度、饱和度或色调等。完成单张编辑后,切勿点击“完成”,而是点击左上角的“全选”选项,此时系统会将你刚才的编辑参数同步应用到所有已选照片上,从而实现快速批量修图。 借助第…

    2026年9月22日
    000
  • rm -rf 误删文件?别急,或许有救!

    rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!rm -rf 误删文件?别急,或许有救!

    立即采取行动! 在生产环境中,我们应尽量避免进行风险操作。但如果不慎犯错,如何挽救呢?让我分享一个故事:上周我为了打包一个应用,需要整理Ubuntu 16.04上的线上数据,不小心删除了一个数据文件,幸而最终有惊无险,现记录如下。 extundelete 我的恢复计划主要依赖于一个工具——extun…

    2026年9月22日 用户投稿
    000
  • MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

    MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作MySQL跨数据库查询技巧_实现不同数据库间的数据联动操作

    mysql跨数据库查询的核心方法是在sql语句中通过“数据库名.表名”方式指定不同数据库的表,实现数据联动。1.在同一个mysql实例内,直接使用数据库名加表名进行关联查询,如db_user.users和db_order.orders,前提是用户需具备相应权限且建议对关联字段建立索引以提升性能;2.…

    2026年9月22日 用户投稿
    400
  • Procreate的AI混合工具怎么用?提升数字绘画效率的实用教程

    Procreate虽无直接名为“AI混合工具”的功能,但其图层混合模式、涂抹工具、Alpha锁定与剪裁蒙版等设计,共同构成了智能化的色彩混合体系。通过正片叠底、滤色等模式可实现自然光影叠加,涂抹工具结合纹理笔刷能模拟真实颜料融合,Alpha锁定和剪裁蒙版则确保混合精准可控。分层渐变、低不透明度叠加及…

    2026年9月22日
    700
  • 不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法

    不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法不露脸也能赚钱:蝴蝶号适合懒人操作的无声视频变现方法

    蝴蝶号是通过无声视频形式吸引观众实现流量变现的一种创作策略。它适合零基础小白,因不露脸、无需口才或专业设备,仅需手机、剪辑软件和创意即可操作。制作关键在于视觉冲击力与情感共鸣,包括优质素材、节奏感剪辑、契合音乐、点睛文字。实用工具如剪映、capcut、达芬奇或adobe premiere pro。其…

    2026年9月22日 用户投稿
    100
  • VSCode高效配置Node.js:npm集成、中文报错、断点调试

    答案:高效配置VSCode与Node.js需确保Node.js和npm为最新版,利用集成终端运行命令,通过jsconfig.json或tsconfig.json优化项目配置,解决中文乱码需设置终端编码为UTF-8并选择支持中文的字体,调试核心是正确配置launch.json文件,使用pwa-node…

    2026年9月22日
    400
  • MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑

    MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑MySQL复杂查询语句写作技巧_Sublime环境中编写多表关联逻辑

    提升mysql多表查询性能与可读性的方法包括:1. 优化索引,确保join和where字段有合适索引,理解复合索引左前缀原则;2. 使用cte分解逻辑,使结构清晰易维护;3. 利用sublime text插件如sqltools、sublimelinter提升编写效率;4. 拆解复杂逻辑,逐步构建查询…

    2026年9月22日 用户投稿
    100
  • 如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

    如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤如何在MXNet中训练AI大模型?高效构建深度学习的详细步骤

    答案是优化数据管道、采用分布式训练、应用内存优化技术、精细调参。具体包括:使用RecordIO格式和DataLoader多进程预取提升数据加载效率;通过KVStore选择device或dist_sync/dist_async实现单机或多机分布式训练;利用混合精度训练、梯度累积和模型符号化降低显存占用…

    2026年9月22日 用户投稿
    000
  • itextpdf freemarker渲染

    关于打印pdf操作的需求,经过研究,发现以下两种方法: 在现有的模板上进行编辑,这种方法操作难度较大。而通过FreeMarker生成静态页面,然后转换为HTML,操作更为顺畅。动态生成PDF的方法在网上参考较多,经过对比,我认为使用FreeMarker结合IText生成PDF最为简单。参考链接为ht…

    2026年9月22日
    300
  • Java多线程并发控制:告别线程优先级,拥抱锁机制

    本文深入探讨了在Java多线程环境中如何有效解决并发操作中断问题,特别是当多个线程尝试同时执行非原子性操作(如打印)时。文章指出,单纯依赖线程优先级并不可靠,并详细介绍了使用synchronized关键字配合共享锁对象实现互斥访问的关键技术,确保关键代码块的原子性执行,从而避免数据混乱和逻辑错误。 …

    2026年9月22日
    700
  • 使用空值合并运算符为数组元素设置默认值

    本文将介绍如何使用 PHP 的空值合并运算符 (??) 为数组元素设置默认值,尤其是在处理用户输入时。 通过该运算符,可以在变量值为 null 或不存在时,提供一个备选值,从而简化代码并提高可读性。我们将通过一个实际的 Laravel 邮件发送示例,演示如何在请求参数中缺失主题时,设置默认主题。 空…

    2026年9月22日
    600
  • VSCode精简配置Git:中文提交记录、分支可视化、冲突解决

    首先解决中文乱码需配置Git和VSCode编码为UTF-8,其次通过GitLens或Git Graph实现分支可视化,最后利用VSCode内置的冲突解决工具高效处理合并冲突,全面提升Git使用体验。 在VSCode里用Git,我总觉得能再顺手点。特别是处理中文提交信息、想直观看看分支图,或者面对恼人…

    2026年9月22日
    500

发表回复

登录后才能评论
关注微信