港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

当前,多模态大模型 (mllm)在多项视觉任务上展现出了强大的认知理解能力。

然而大部分多模态大模型局限于单向的图像理解,难以将理解的内容映射回图像上。

比如,模型能轻易说出图中有哪些物体,但无法将物体在图中准确标识出来。

定位能力的缺失直接限制了多模态大模型在图像编辑,自动驾驶,机器人控制等下游领域的应用。

针对这一问题,港大和字节跳动商业化团队的研究人员提出了一种新范式Groma——

立即进入“豆包AI人工智官网入口”;

立即学习“豆包AI人工智能在线问答入口”;

通过区域性图像编码来提升多模态大模型的感知定位能力。

在融入定位后,Groma可以将文本内容和图片区域直接关联起来,从而显著提升对话的交互性和指向性。这种方式不会改变原有的意思,只是微调了表达方式。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体
港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

核心思路

如何赋予多模态大模型定位物体的能力,即将文字内容和图像区域关联起来,做到“言之有物”,是当前一大研究热点。多模态大模型的目标是在给定一张图像和相应的文字描述时,能够找到图像中与描述相对应的区域。此任务被称为图像和文本对齐(image-text alignment)问题。为了解决这个问题,

常见的做法是微调大语言模型使其直接输出物体坐标。然而这种方法却有着诸多限制:

1、在文本上预训练的大语言模型本身不具备空间理解能力,仅依靠少量数据微调很难精准定位物体。

2、定位任务对输入图像的分辨率有较高要求,但提高分辨率会显著增加多模态大模型的计算量。

3、大语言模型的输出形式不适合处理精细的定位任务,比如分割。

基于这些考虑,Groma提出将定位转移到多模态大模型的vision tokenizer中,由vision tokenizer发现并定位潜在的物体,再交给大语言模型识别。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

同时,这样的设计也充分利用了vision tokenizer本身的空间理解能力,而无需外接专家模型(比如SAM)来辅助定位,从而避免了外接模型的冗余。

具体而言,Groma在全局图像编码的基础上,引入了区域编码来实现定位功能——如下图所示,Groma先利用Region Proposer定位潜在的物体,再通过Region Encoder将定位到的区域逐一编码成region token。

INFINITE ALBUM INFINITE ALBUM

面向游戏玩家的生成式AI音乐

INFINITE ALBUM 144 查看详情 INFINITE ALBUM

而大语言模型则可以根据region token的语意判断其对应的区域,并通过在输出中插入region token来达成类似超链接的效果,实现visually grounded conversation。

同样地,用户指定的区域也可以通过Region Encoder编码成相应的region token,并插入到用户指令中,从而让多模态模型能关注到指定的区域并产生指向性的回答。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

为了提升定位的鲁棒性和准确性,Groma采用了超过8M的数据(包括SA1B)来预训练Region Proposer。因此其产生的proposal不仅包括常见的物体,也涵盖了物体的组成部分以及更广阔的背景等要素。

此外,得益于分离式的设计,Groma可以采用高分辨率特征图用于Region Proposer/Encoder的输入,并采用低分辨率的特征图用于大模型输入,从而在降低计算量的同时又不损失定位性能。

实验结果

Groma在传统的Grounding Benchmarks上表现出了超越MiniGPT-v2和Qwen-VL的性能。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

同时,Groma在多模态大模型通用的VQA Benchmark (LLaVA-COCO)验证了其对话和推理能力。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

在可视化的对比中,Groma也表现出了更高的recall和更少的幻觉。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

此外,Groma还支持融合对话能力和定位能力的referential dialogue以及grounded chat。

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体

得益于大语言模型强大的认知推理能力,多模态大模型在视觉理解任务上表现突出。

然而一些传统的视觉任务,如检测分割、深度估计等,更多依赖视觉感知能力,这恰恰是大语言模型所缺乏的。

Groma在这个问题上提供了一种新的解决思路,即把感知和认知解耦开来,由vision tokenizer负责感知,大语言模型负责认知。

这种先感知后认知的形式除了更符合人类的视觉过程,也避免了重新训练大语言模型的计算开销。

5月15日,字节跳动刚刚公布了自研的豆包大模型,提供多模态能力,下游支持豆包APP、扣子、即梦等50+业务,并通过火山引擎开放给企业客户,助力企业提升效率、加速智能化创新。目前,豆包APP已成为中国市场用户量最大的AIGC应用。字节跳动正持续加大对顶尖人才和前沿技术的投入力度,参与行业顶尖的技术挑战和攻坚。

项目网站:
https://www.php.cn/link/24e23677d6722931c4fe84d781e8e32b
论文链接:
https://www.php.cn/link/52c8b8d56837155b4870fc2658b676f0
开源代码:
https://www.php.cn/link/f7bbcc6ef14fd79655f09efb14b99316

以上就是港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/795323.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
傻瓜式编程软件app开发工具让创意成真
上一篇 2025年11月26日 15:43:54
vivo云服务电脑版入口 怎么在电脑上登录vivo云服务
下一篇 2025年11月26日 15:43:54

相关推荐

  • Valkey 9.0.0 正式 GA,Linux 基金会维护的 Redis 分支

    由 linux 基金会主导维护的 redis 分支——开源内存数据库 valkey 9.0.0 正式发布,现已进入通用可用(ga)阶段。本次版本带来了多项关键性的性能提升与功能增强,重点聚焦于更高效的集群数据迁移、精细化的哈希字段管理能力,以及对大规模分布式部署场景的深度优化。 原子化槽位迁移(At…

    2026年9月21日
    100
  • 怎么在VSCode里配置Go语言环境?

    安装Go并配置环境变量后,在VSCode中安装官方Go扩展,通过命令面板安装gopls、delve等必要工具,并设置保存时自动格式化与导入,即可实现代码补全、格式化和调试功能。 在 VSCode 中配置 Go 语言开发环境其实不复杂,只要安装好工具链并正确设置,就能获得代码补全、格式化、调试等完整功…

    2026年9月20日
    100
  • Java从文本文件随机读取并打印指定行数内容

    本文旨在指导读者如何使用java程序从文本文件中高效地读取多组固定行数的内容(如诗歌),并随机选择其中一组进行打印。教程将详细介绍如何利用`files.readalllines`、`random`和`list.sublist`等核心api,实现文件的整体读取、随机索引的生成以及特定内容块的提取与输出…

    2026年9月20日
    100
  • 新页软件合并下达生产计划

    新页软件合并下达生产计划新页软件合并下达生产计划新页软件合并下达生产计划新页软件合并下达生产计划

    同一规格的产成品在面向不同客户进行销售时,若每个客户的订单都独立生成生产计划,容易引发生产排程的重复与冲突。这不仅会造成设备、人力等资源的浪费,还会显著增加生产管理的复杂性,削弱生产过程中的统一调度能力,进而影响整体生产效率与计划执行的精准度。 1、 第一步:为提升系统操作的直观性和演示效果,可适当…

    2026年9月20日 用户投稿
    200
  • 如何调整VSCode的设置以获得最佳性能?

    合理配置VSCode可显著提升性能。1. 禁用不必要扩展,减少后台资源占用;2. 在settings.json中设置files.watcherExclude和search.exclude以降低CPU负载;3. 启用editor.renderLineHighlight和largeFileOptimiz…

    2026年9月20日
    500
  • ChatGPT代码会出错吗_AI编程中5个常见错误及解决方法

    AI编程中常见错误包括语法不匹配、逻辑遗漏、API误用、安全漏洞和集成困难,需通过版本明确、测试验证、文档核对、安全扫描和上下文补充等方式解决,结合人工审查与测试才能确保代码质量。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ ChatGP…

    2026年9月20日
    100
  • VSCode的扩展推荐是怎么工作的?

    VSCode的扩展推荐基于用户行为和项目环境智能生成,当你打开.py文件时会推荐Python相关工具,打开.ts、.vue等文件则触发对应语言插件;系统通过分析package.json、requirements.txt等依赖文件识别技术栈,推荐Docker、ESLint等匹配扩展;同时记录常用操作如…

    2026年9月20日
    000
  • 当VSCode启动或运行变慢时,有哪些系统性的排查和优化步骤?

    答案:VSCode变慢主要由扩展、文件监控和设置引起。先以安全模式启动排查扩展影响,使用内置性能工具分析启动耗时,优化工作区的文件监听与搜索范围,调整渲染设置并清理缓存,可显著提升运行效率。 VSCode 启动或运行变慢通常涉及扩展、设置、系统资源或文件索引等问题。以下是系统性的排查与优化步骤,帮助…

    2026年9月20日
    000
  • 如何设置VSCode的默认编码?

    VSCode默认使用UTF-8编码,可通过设置files.encoding指定默认编码如utf8、gbk;2. 启用files.autoGuessEncoding可自动识别文件编码;3. 在settings.json中配置可持久化编码设置,支持手动修改并即时生效。 VSCode 默认使用 UTF-8…

    2026年9月20日
    000
  • 怎样在VSCode中查看Git提交历史?

    VSCode通过内置源代码管理视图查看Git提交历史,点击左侧图标或使用快捷键Ctrl+Shift+G进入;2. 在COMMIT输入框下方点击“…”菜单选择View Commit History可查看完整提交记录;3. 右键文件选择Git: View File History可查看单个文…

    2026年9月20日
    100
  • VSCode怎么查看NPM版本_VSCode NPM版本查询教程

    在VSCode中查看NPM版本,需打开集成终端并输入npm -v或npm –version。1. 使用快捷键Ctrl + (Windows/Linux)或Cmd + (macOS)打开终端;2. 输入命令npm -v执行;3. 终端将显示当前NPM版本号,如8.19.2。该方法可快速验证…

    2026年9月20日
    000
  • VSCode如何与Git Submodules或SVN等非Git版本控制系统协作?

    VSCode原生支持Git,对Submodules需手动初始化并提交指针,协作时推荐结合终端;通过安装svn-scm插件可支持SVN,依赖本地svn工具,混合项目应避免路径冲突,建议明确分工、合理配置忽略规则,使用集成终端处理复杂操作,确保工具链完整与插件更新,以实现多版本控制系统协同。 VSCod…

    2026年9月20日
    100
  • Java中通过PKCS12证书实现OkHttp客户端认证的POST请求

    本教程详细介绍了如何在java应用中,利用okhttp库执行需要客户端证书认证的post请求。我们将重点讲解如何加载pkcs12格式的证书文件,配置keystore和keymanagerfactory,初始化sslcontext,并将其集成到okhttpclient中,以确保请求的安全性和认证的正确…

    2026年9月20日
    000
  • 在Java中高效提取整数的最小与最大数字

    本文详细介绍了在java中如何从一个整数中提取其包含的最小和最大数字。通过采用数学运算(取模和除法)或字符串转换两种方法,实现对整数各位数字的遍历与比较,从而高效地找出并显示这些极值数字。文章提供了具体的代码示例,并探讨了不同方法的适用场景与注意事项。 在Java编程中,我们有时需要从一个给定的整数…

    2026年9月20日
    000
  • VSCode的开发者社区是如何运作的,普通用户可以通过哪些途径参与贡献和反馈?

    VSCode社区开放活跃,用户可通过报告问题、贡献代码、开发扩展、改进文档及参与讨论等多种方式加入。 VSCode 的开发者社区活跃且开放,由微软主导但高度依赖开源协作。项目托管在 GitHub 上,采用透明的开发流程,所有功能讨论、问题追踪和代码提交都公开可见。普通用户无论是否具备编程能力,都可以…

    2026年9月20日
    000
  • VSCode的侧边栏图标代表什么?

    资源管理器(文件夹图标)用于管理项目文件结构,支持新建、重命名、删除和拖拽操作;2. 搜索(放大镜图标)实现全局文本查找与替换,支持正则表达式及范围筛选;3. 源代码管理(分支图标)集成Git功能,可查看变更、提交代码并同步远程仓库;4. 运行和调试(虫子图标)支持断点调试、变量监控及多语言启动配置…

    2026年9月20日
    000
  • 漏洞复现 | DirtyPipe CVE-2022-0847 Linux 内核提权漏洞复现

    漏洞复现 | DirtyPipe CVE-2022-0847 Linux 内核提权漏洞复现漏洞复现 | DirtyPipe CVE-2022-0847 Linux 内核提权漏洞复现漏洞复现 | DirtyPipe CVE-2022-0847 Linux 内核提权漏洞复现漏洞复现 | DirtyPipe CVE-2022-0847 Linux 内核提权漏洞复现

    0x00 前言 CVSS 评分:7.8 影响范围:5.8 通过 CVE-2022-0847,RT 可以覆盖重写任意可读文件中的数据,从而将普通权限的用户提升到特权 root 级别。 这个漏洞被作者命名为 Dirty Pipe,之所以这样命名,是因为其原理与 Dirty Cow 相似,但 Dirty …

    2026年9月20日 用户投稿
    000
  • Linux如何自定义命令别名

    Linux如何自定义命令别名Linux如何自定义命令别名Linux如何自定义命令别名Linux如何自定义命令别名

    自定义Linux命令别名是通过alias命令或配置文件为常用命令设置简短别名,提升效率与个性化。首先使用alias定义临时别名,如alias ll=’ls -alF’;为永久生效需将别名写入~/.bashrc或~/.zshrc,并用source命令加载。避免覆盖原命令、合理添…

    2026年9月20日 用户投稿
    000
  • VSCode的终端集成有哪些技巧?

    掌握VSCode终端技巧可提升开发效率。1. 用Ctrl+`快速打开终端,支持多实例创建与重命名;2. 在设置中自定义默认shell如zsh或Git Bash;3. 优化字体、启用自动换行与智能复制;4. 终端联动编辑器实现一键运行、路径拖拽补全与点击跳转。 VSCode的终端集成非常实用,合理使用…

    2026年9月20日
    000
  • idea恢复初始化

    答案:通过关闭IDEA并删除配置、缓存目录及插件数据,可将其重置为初始状态。具体步骤依次为:彻底退出程序;删除系统中对应的JetBrains文件夹(Windows在AppData,macOS在Library,Linux在.config和.cache);可选删除项目中的.idea和.iml文件;重启后…

    2026年9月20日
    000

发表回复

登录后才能评论
关注微信