Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉_创想鸟

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

行业首个具备 ” 高刷 ” 视频理解能力的多模态模型minicpm-v 4.5的技术报告正式发布!

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

报告提出统一的 3D-Resampler 架构实现高密度视频压缩、面向文档的统一 OCR 和知识学习范式、可控混合快速 / 深度思考的多模态强化学习三大技术。

基于这些关键技术,MiniCPM-V 4.5 在视频理解、图像理解、OCR、文档解析等多项任务上达到同级 SOTA 水平,不仅以 8B 的参数规模超越 GPT-4o-latest 和 Qwen2.5-VL-72B,更在推理速度上具有显著优势。

模型一经开源,就广受社区好评,并直接登上 HuggingFace Trending TOP2。

接下来,就和我们一起看看报告里讲了什么。

研究背景

随着多模态大模型的迅速发展,其在模型架构、数据工程和训练方法上的高昂成本和效率瓶颈,正成为其广泛应用和技术迭代的核心障碍。

而在移动设备和边缘计算场景中,如何在保持出色性能的同时实现高效推理,给多模态模型研究和应用提出了更加严峻的挑战。

总的来说,MiniCPM-V 4.5 通过系统性的技术创新攻克三大效率难题:

针对模型架构:为解决处理图像与视频时产生的海量视觉 Token,团队采用了统一 3D-Resampler 架构,大幅降低了视觉编码的 Token 开销,实现最高96 倍的压缩率。在 VideoMME 上,团队以相比 Qwen2.5-VL7B 仅46.7%的显存和8.7%的时间开销,获得了 30B 以下参数量模型的最优性能。

针对训练数据:为解决多模态文档处理中对不可靠外部解析工具的依赖和 OCR 数据工程设计难题,团队提出了统一文档 OCR 与知识学习的新范式,使模型能直接从复杂文档图像中学习,显著降低了数据噪声和数据工程复杂度。最终在 OmniDocBench 上取得了通用 MLLM 中的最好表现。

针对训练方法:为平衡深度思考与日常即时使用两种需求,团队使用了混合强化学习策略。该策略在节省 30% 训练开销的同时实现了强大的思考能力,并且推理耗时仅为同规格深度思考模型的42.9%-68.2%,在快速响应与全面分析间取得了可控平衡。

统一的 3D-Resampler 架构实现高密度视频压缩

Takeawys:

时间 – 空间 统一联合压缩可充分挖掘多模态数据的冗余性,实现更的高视觉压缩率。

统一的视觉架构可促进感知能力从图像到视频的无缝迁移。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

传统多模态模型在处理视频时面临的核心挑战是性能与效率的权衡。

为突破这一困境,MiniCPM-V 4.5 引入了创新的3D-Resampler 架构。它不再将视频视为独立的静态帧序列,而是同时在时空方向上压缩,利用连续帧间的高度冗余信息,实现了革命性的效率提升。

该架构能将 6 个连续的视频帧(448 × 448 分辨率)高效压缩为仅 64 个视觉 Token,实现了惊人的96 倍视觉压缩率,而多数主流模型处理同等数据需消耗 1,536Token。这一设计让模型在不增加语言模型计算成本的前提下,能够感知和处理更多视频帧,且能获得更好的视频理解能力。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

更重要的是,3D-Resampler 实现了图像与视频处理的统一编码,确保了知识和能力的无缝迁移。

一个有力的证明是,尽管没有经过专门的视频 OCR 数据训练,模型依然展现出良好的视频 OCR 能力。

同时,由于统一的架构设计和参数共享,从 2D 扩展至 3D-Resampler 仅需一个轻量化的 SFT 阶段,极大地降低了训练成本。

高效知识学习:面向文档的统一 OCR 和知识学习范式

Takeawys:

对文档图像文本进行不同程度的可见性扰动,即可将知识学习、OCR 能力高效地统一到单个学习目标中。

多模态模型在处理文档时,普遍采用两种独立的低效方法。

一方面,文档知识学习高度依赖脆弱的外部解析工具,不仅效率低下,解析错误还常常引入噪声,需要大量数据工程进行修复。

另一方面,OCR 能力学习虽受益于数据增强,但过度的图像扰动又会导致文字无法辨认,反而诱发模型产生幻觉。

对于以上困难,团队提出一条核心洞察:

文档知识获取和文字识别的关键区别,仅在于图像中文字的可见度。

基于此,MiniCPM-V 4.5 使用了一种统一的 OCR 和知识学习范式:对文档图像中的文字区域施加不同程度的损坏,利用 ” 从损坏图像中重建原文 ” 这一学习目标同时学习两种任务。如下图所示,通过控制损坏程度,团队创造了三种任务:

轻微损坏 ( 可靠 OCR 训练 ) :文字尚可辨认,模型专注于学习准确、鲁棒的文字识别。

中度损坏 ( 综合推理 ) :字符变得模糊,模型可以结合框内视觉线索和上下文进行综合推理和重建原文。

高度损坏 ( 知识学习 ) :文字被完全抹除,模型被强制依赖上下文图表和文字以及模型内部知识来重建原文,从而实现真正的文档级理解。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

这一方法彻底摆脱了对外部解析器的依赖,杜绝了其引入的噪声和工程负担。

同时,它智能地将知识学习和 OCR 目标无缝融合在同一训练批次中,极大地提升了数据利用率和训练效率。

团队在轻量训练设置下对该学习范式进行了消融验证,结果说明面向文档的统一 OCR 和知识学习范式有效提升了模型在文档理解、知识推理、文字识别上的能力:

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

高效强化学习:可控混合快速 / 深度思考的多模态强化学习

MiniCPM-V 4.5 通过混合强化学习方法,实现了快速思考和深度思考两种模式的平衡优化。

快速思考模式面向高频日常使用场景,提供高效的推理体验;深度思考模式则专注于复杂任务的深入分析。

模型通过少量高难度、高质量的推理样本进行冷启动,快速掌握深度思考所必需的反思与回溯能力。

进入强化学习阶段,两种模式被同时优化,不仅显著增强了深度思考模式的性能,更实现了两种模式间推理能力的交叉泛化。模型在节省约 30% 采样开销的前提下,仍能达到和仅深思考强化学习的模型相当的表现。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

同时,团队引入了 RLPR 与 RLAIF-V 两项技术:

RLPR 解决了通用域问题的开放式回答(如答案表述相对复杂、含物理单位等)难以获得可靠奖励信号的痛点,从模型生成正确答案的概率中获得奖励信号(probability-based reward, PR)。

随着训练步数增加,结合 PR 训练相比常规训练方法的优势会逐渐扩大 .

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

RLAIF-V 有效抑制了模型的幻觉现象,通过逐个检验模型输出答案中事实陈述的可靠度并构建偏好数据用于 DPO,提升了多种多模态理解任务的可靠性。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

评测结果

MiniCPM-V 4.5 在 OpenCompass 综合评测中取得了 77.0 的平均分。该评测涵盖了 8 个主流多模态基准的综合指标。

尽管仅有 8B 参数规模,模型在视觉语言能力上超越了 GPT-4o-latest 等广泛使用的专有模型,以及 Qwen2.5-VL72B 等强大的开源模型,成为 30B 参数以下性能最佳的开源多模态大模型。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

MiniCPM-V 4.5 在提供 SOTA 级多模态表现的同时,具有最佳的推理效率和最低的推理开销。

在混合思考模式下,MiniCPM-V 4.5 在推理耗时仅为同规格深度思考模型的 42.9%-68.2% 的同时获得了更好的 OpenCompass 分数。

同时,得益于高密度视频压缩技术,在覆盖短、中、长三种类型的视频理解评测集 Video-MME 上,MiniCPM-V 4.5 时间开销(未计算模型抽帧时间)仅为同级模型的 1/10。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

模型实测效果展示

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

One more thing

作为 MiniCPM-V 系列的最新成果,MiniCPM-V 4.5 系统性地从架构、数据和训练三大维度为解决多模态大模型的效率瓶颈提供了一条可行路径。

HuggingFace 大佬表示,仅有 8B 参数的模型也能擅长事实纠正和思考,确实值得更多的关注。

8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉

作为清华大学自然语言处理实验室和面壁智能联合开发的系列模型,MiniCPM-V 和 MiniCPM-o 系列已经获得了广泛的学术和产业认可。

技术报告地址:https://github.com/OpenBMB/MiniCPM-V/blob/main/docs/MiniCPM_V_4_5_Technical_Report.pdf

GitHub:https://github.com/OpenBMB/MiniCPM-o

HuggingFace:https://huggingface.co/openbmb/MiniCPM-V-4_5

ModelScope:https://www.modelscope.cn/models/OpenBMB/MiniCPM-V-4_5

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

点亮星标

科技前沿进展每日见

以上就是8B 硬刚 72B!MiniCPM-V 4.5 技术报告正式出炉的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/72562.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
JavaScript 查找距离给定点最近的 N 个点
上一篇 2025年11月13日 17:09:14
windows8如何查看端口占用情况_windows8端口占用查询方法
下一篇 2025年11月13日 17:11:16

相关推荐

  • Java JUnit assertThrows 与异常消息比对:避免常见陷阱

    本教程深入探讨在 Java JUnit 中使用 assertThrows 进行异常测试时常见的 assertEquals 误用问题。它详细解释了为何不能直接将期望的字符串消息与捕获到的异常对象进行比对,并提供了正确的解决方案:通过 e.getMessage() 获取异常消息进行精确断言,确保测试的准…

    2026年9月23日
    000
  • win11怎么看电脑配置信息_win11查看电脑配置信息操作教程

    通过系统设置可快速查看处理器、内存等核心配置;使用“msinfo32”获取BIOS、主板等详细信息;运行“systeminfo”命令导出完整配置清单;借助设备管理器检查硬件设备及驱动状态。 如果您想了解自己电脑的硬件和系统详情,Windows 11 提供了多种内置方法来查看配置信息,无需安装额外软件…

    2026年9月23日
    000
  • 为什么iPhoneSE2022收款语音不响?教你配置微信语音播报的方法

    最常见的原因是iPhone系统或微信设置问题,如静音、勿扰模式开启或通知权限关闭。需检查手机音量、专注模式,并确保微信通知和收款语音提醒已开启。 最常见的原因是iPhone的系统通知设置、微信应用内部设置,或简单地开启了“勿扰模式”或“专注模式”导致。这通常不是手机硬件故障,而是软件配置上的疏忽。 …

    2026年9月23日
    200
  • safari浏览器如何导入Netscape格式的书签文件_safari浏览器导入Netscape书签方法

    Safari无法直接读取Netscape格式书签时,可通过HTML文件转换、第三方工具修复或借助Chrome/Firefox中转导入。首先确认书签文件含标准结构,尝试直接导入Safari;若失败,使用Linkman Lite等工具修复格式后导入;或通过Chrome先行导入再导出标准HTML文件,最后…

    2026年9月23日
    000
  • VSCode如何通过AI优化内存使用 VSCode智能内存分析调试插件

    ai并不能直接优化vscode的内存占用,而是通过赋能智能化的内存分析调试插件,间接提升vscode的运行效率和开发体验;2. 这类插件通过采集堆快照、cpu性能数据、gc日志和扩展资源消耗等运行时信息,结合ai的模式识别与异常检测能力,精准识别内存泄漏、未清理的事件监听器、循环引用等问题;3. a…

    2026年9月23日
    200
  • PHP容器与依赖注入怎么理解_PHP中DI容器概念与Pimple等库应用

    依赖注入通过外部传入依赖解耦代码,容器如Pimple集中管理对象创建与依赖解析,提升可测试性与维护性,适用于中小型项目。 PHP中的容器和依赖注入(Dependency Injection,简称DI)是现代开发中解耦代码、提升可测试性和可维护性的核心技术。理解它们的关键在于掌握“控制反转”(Inve…

    2026年9月23日
    100
  • 如何在iPhone13设置密码?为你的手机添加安全保护的实用方法

    设置iPhone 13密码需进入“设置”→“面容ID与密码”,选择六位或自定义字母数字密码,配合面容ID实现双重安全;推荐使用复杂密码或密码管理器提升安全性,同时开启“查找我的iPhone”和数据加密功能,防止信息泄露;若忘记密码,可通过恢复模式或iCloud远程抹除并从备份恢复数据,前提是提前开启…

    2026年9月23日
    900
  • VS Code算法实战:竞赛编程与调试环境搭建

    首先安装编程语言环境及VS Code扩展,如C/C++、Code Runner和LeetCode;接着配置Code Runner支持编译运行与输入重定向;最后通过代码片段提升编码速度,形成高效竞赛开发环境。 在竞赛编程中,高效的开发环境能大幅提升编码速度与调试效率。VS Code凭借轻量、可扩展和强…

    2026年9月23日
    000
  • win8任务计划程序怎么用_Win8任务计划程序使用教程

    win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程

    答案:可通过任务计划程序实现。在Windows 8中,使用任务计划程序可创建基本或高级任务,设置触发器(如定时或开机启动)并指定操作(如运行程序、脚本或显示消息),通过向导或高级配置完成自动化。 如果您需要在Windows 8系统中自动执行特定程序、脚本或操作,可以通过任务计划程序来实现定时或触发式…

    2026年9月23日 用户投稿
    100
  • 字节入局,AR眼镜掀起新“风口”?

    近日,关于老凤祥与字节跳动合作推出AI眼镜的消息在网络上引发热议。据相关媒体报道,老凤祥计划联合字节跳动旗下的火山引擎共同开发多款AI眼镜,并由豆包大模型提供技术支持,预计将在今年7月正式发布。 对此,6月12日,火山引擎方面进行了澄清。其负责人表示,并未有与老凤祥合作研发AI智能眼镜的计划。而豆包…

    2026年9月23日
    000
  • 在无Maven或Eclipse环境下手动构建Java Web应用WAR包的教程

    本教程详细介绍了如何在不依赖Maven或Eclipse等集成开发环境的情况下,为Java Web应用程序手动生成WAR(Web Application Archive)文件。文章首先阐述了WAR文件的基本结构,随后通过一个Ant构建脚本的实例,指导读者完成从源代码编译、文件组织到最终WAR包生成的全…

    2026年9月23日
    000
  • AdobePhotoshop的AI混合工具怎么用?掌握智能图像编辑的教程

    Photoshop的AI混合工具以生成式填充和神经网络滤镜为代表,通过语义理解实现智能图像融合。生成式填充可依据文本提示添加、移除或扩展内容,自动匹配光影与纹理;神经网络滤镜如和谐化则优化颜色与光照匹配。与传统基于像素计算的混合模式不同,AI工具理解图像内容,实现“生成并融合”。使用时需精准输入英文…

    2026年9月23日
    100
  • windows10怎么把任务栏设置成透明_windows10任务栏透明效果设置方法

    可通过系统设置、注册表或第三方工具实现Windows 10任务栏透明。一、在“个性化-颜色”中开启“透明效果”;二、在注册表新建TaskbarAcrylicOpacity值并设为0-100调节透明度,重启生效;三、使用TranslucentTB软件实现多模式透明控制,支持常透明或悬停显示。 如果您希…

    2026年9月23日
    000
  • 解决 Conda 环境中 Java 版本冲突的策略

    本文旨在解决 Conda 环境中 Java 版本激活不正确的问题。当用户尝试在 Conda 环境中指定特定 Java 版本(如 OpenJDK 8)时,系统可能仍激活旧的或错误的 Java 版本。教程将详细分析问题根源,并提供一种通过精确指定 Java 包名来确保 Conda 环境正确管理 Java…

    2026年9月23日
    000
  • Windows安装过程中蓝屏INACCESSIBLE_BOOT_DEVICE怎么办?

    1、蓝屏“INACCESSIBLE_BOOT_DEVICE”通常因SATA模式不匹配或驱动缺失导致;2、进入BIOS将SATA模式从RAID改为AHCI可解决兼容性问题;3、安装时加载主板存储控制器驱动以识别NVMe或RAID磁盘;4、使用diskpart命令清理磁盘并转换为GPT(UEFI)或MB…

    2026年9月23日
    000
  • Linux安装Redis数据库,无需公网IP实现远程连接

    Linux安装Redis数据库,无需公网IP实现远程连接Linux安装Redis数据库,无需公网IP实现远程连接Linux安装Redis数据库,无需公网IP实现远程连接Linux安装Redis数据库,无需公网IP实现远程连接

    redis作为一种高效的key-value数据库,因其将数据存储在内存中而具备极高的读写速度,广泛应用于多种场景中。以下将详细介绍如何在centos 8的linux虚拟机上搭建redis数据库,并利用cpolar实现内网穿透以便通过公网访问。 在Linux(CentOS 8)上安装Redis数据库 …

    2026年9月23日 用户投稿
    100
  • 谷歌为 Gemini CLI 带来扩展功能

    谷歌旗下的 AI 编程助手 Gemini CLI 最近推出了名为“扩展”的全新功能。官方表示,这一更新让用户能够“接入常用工具,并定制属于自己的 AI 命令行体验”。现在,任何开发者都可以发布扩展程序,无需经过谷歌的审核批准即可上线使用。 目前扩展库中已提供超过 50 款扩展,涵盖多种实用场景。例如…

    2026年9月23日
    000
  • VSCode文件编码识别错误怎么办?VSCode编码设置调整方法

    VSCode文件编码识别错误怎么办?VSCode编码设置调整方法VSCode文件编码识别错误怎么办?VSCode编码设置调整方法VSCode文件编码识别错误怎么办?VSCode编码设置调整方法VSCode文件编码识别错误怎么办?VSCode编码设置调整方法

    vscode文件编码识别错误导致乱码问题可通过调整编码设置解决。1.查看右下角编码显示,若不对则点击选择“通过编码重新打开”,尝试utf-8、gbk等常见编码直至显示正常;2.如手动无效可启用“自动检测”功能;3.修改vscode默认编码(设置中搜索“files.encoding”并设为常用格式如u…

    2026年9月23日 用户投稿
    100
  • 如何恢复未保存的WPS格式文档_WPS未保存文档恢复操作技巧

    首先尝试WPS自动恢复功能,重新打开软件后查看“文档恢复”面板;若无效,可手动查找C:Users当前用户名AppDataLocalKingsoftWPS Officecache目录下的临时文件;若启用云端同步,可通过“备份与恢复”中的历史版本找回;还可使用系统搜索*.asd文件定位自动保存的副本。 …

    2026年9月23日
    100
  • 递归方法中静态变量状态管理与重置策略

    本教程探讨了在递归方法中使用静态(全局)变量时,如何正确管理和重置其状态,以避免多次调用时出现累积错误。核心问题在于静态变量在方法调用之间保留其值,导致后续调用基于旧状态进行计算。解决方案是在递归的基准情况(base case)中,在完成当前调用的计算后,立即将静态变量重置为初始值,从而确保每次独立…

    2026年9月23日
    200

发表回复

登录后才能评论
关注微信