Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
清华浙大主导开源视觉模型爆炸, GPT-4V与LLaVA、CogAgent等平台带来革命性变革_创想鸟

清华浙大主导开源视觉模型爆炸, GPT-4V与LLaVA、CogAgent等平台带来革命性变革

目前,GPT-4 Vision在语言理解和视觉处理方面显示出了令人惊叹的能力。

然而,对于那些希望在不影响性能的情况下寻求成本效益替代方案的人来说,开源方案是一个具有无限潜力的选择。

Youssef Hosni是一位国外开发者,他为我们提供了三种可访问性绝对保障的开源替代方案来取代GPT-4V。

三种开源视觉语言模型LLaVa、CogAgent和BakLLaVA在视觉处理领域拥有巨大潜力,值得我们深入了解。这些模型的研究和开发,可以为我们提供更高效、精准的视觉处理解决方案。通过运用这些模型,我们可以提升图像识别、目标检测和图像生成等任务的准确性和效率,为视觉处理领域的研究和应用带

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

LLaVa

LLaVA是一个多模态大模型,由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员合作开发。最初的版本发布于4月份。

它将视觉编码器和Vicuna(用于通用视觉和语言理解)结合在一起,展现了非常出色的聊天能力。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

10月份,经过升级的LLaVA-1.5在性能上已经接近多模态GPT-4,并在Science QA数据集上取得了最先进的结果(SOTA)。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

13B模型的训练,只需要8个A100就可以在1天内完成。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

可以看到,LLaVA能处理各类问题,且生成的回答既全面又富有逻辑。

LLaVA表现出一些接近GPT-4水平的多模态能力,在视觉聊天方面,GPT-4相对评分85%。

而在推理问答方面,LLaVA甚至达到了新SoTA——92.53%,击败多模态思维链。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

在视觉推理上,它的表现十分抢眼。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

提问:「如果有事实性错误,请指出来。如果没有,请告诉我,沙漠中正在发生什么?」

LLaVA还无法完全回答正确。

升级后的LLaVA-1.5给出了完美答案:「图中根本没有沙漠,有的是棕榈树海滩、城市天际线和一大片水域。」

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

另外,LLaVA-1.5还可以从图中提取信息,按照要求的格式进行回答,比如以JSON格式输出。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

给LLaVA-1.5一张满是水果蔬菜的图片,它也能像GPT-4V一样,把图片转化JSON。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

下面这幅图是什么意思?

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

这是一张根据诺兰《盗梦空间》绘制的简化草图,为了提高难度,角色名字被改成了假名。

LLaVA-1.5惊艳答出:「这是一张关于电影《盗梦空间》的图。它显示了梦境世界中的不同层次,每一层次用一条线表示。图写在一张纸上,纸放在一个台面上。」

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

一张食物图直接发给LLaVA-1.5,它火速就给你生成一份菜谱。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

而且,LLaVA-1.5不用「越狱」就可以识别出验证码。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

它还能检测出,图中是哪种硬币。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

尤为令人印象深刻的是,LLaVA-1.5还能告诉你图中的汪星人是什么品种。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

有网友用Bing生成了一张在阳光明媚的夏季海滩上穿着冬季外套的男人的图片,并请LLaVA 1.5指出图中有哪些问题。它的慧眼十分犀利——

这是一张经过处理或PS的照片,照片中一名男子穿着夹克,站在海滩上。该男子敞开外套,阳光照在他身上。这张图片的问题在于,它并非真实的海滩场景。该男子实际上并没有站在沙滩上,阳光也没有照在他身上。这张图是p出来的,营造出了一种海滩场景的假象,但它并没有真实地再现这个场景。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

OCR识别,LLaVA的性能也很强大。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

CogAgent

CogAgent是在CogVLM基础上改进的开源视觉语言模型,来自清华的研究者。

CogAgent-18B有110亿个视觉参数,和70亿个语言参数。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

论文地址:https://arxiv.org/pdf/2312.08914.pdf

在9个经典的跨模态基准(包括VQAv2、OK-VQ、TextVQA、ST-VQA、ChartQA、infoVQA、DocVQA、MM-Vet和POPE)上,CogAgent-18B实现了最先进的通用性能。

在AITW和Mind2Web等图形用户界面操作数据集上,它大大超过了现有模型。

除了CogVLM已有的所有功能(可视化多轮对话、可视化接地)外,CogAgent.NET还提供了更多的功能:

甲骨文AI协同平台 甲骨文AI协同平台

专门用于甲骨文研究的革命性平台

甲骨文AI协同平台 21 查看详情 甲骨文AI协同平台

1.支持更高分辨率的视觉输入和对话答题。支持1120×1120的超高分辨率图像输入。

2.具备可视化代理的能力,能够在任何图形用户界面截图上返回任何给定任务的计划、下⼀步行动和带有坐标的具体操作。

3.增强了与图形用户界面相关的问题解答功能,使其能够处理与网页、PC应用程序、移动应用程序等任何图形用户界面截图相关的问题。

4.通过改进预培训和微调,增强了OCR相关任务的能力。

图形用户界面代理(GUI Agent)

利用CogAgent,它可以帮我们一步步找到CVPR23的最佳论文。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

可以帮我们把手机显示调成明亮模式。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

这条推文有多少转评赞,为什么如此受欢迎,CogAgent都能分析出来,甚至连回复一个“Brilliant”,它都能操作。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

从弗罗里达大学到好莱坞,怎样选择最快的路线?如果从早上8点出发,该如何评估需要花多长时间?CogAgent都可以回答。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

可以设定特定的主题,让CogAgent往指定的邮箱里发邮件。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

想听一首,CogAgent可以一步步列出步骤。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

CogAgent能精准地描述出《原神》中的画面,还能引导你如何走到传送点。

GPT-4V开源平替!清华浙大领衔,LLaVA、CogAgent等开源视觉模型大爆发图片

BakLLaVA

BakLLaVA1是使用LLaVA 1.5架构增强的Mistral 7B基础模型。

在第⼀个版本中,Mistral 7B基础模型在多个基准测试中优于Llama 2 13B。

在他们的repo中,就可以运行BakLLaVA-1了。页面还在不断更新中,以方便微调和推理。(https://github.com/SkunkworksAI/BakLLaVA)

BakLLaVA-1是完全开源的,但在某些数据上进行了训练,其中包括LLaVA的语料库,因此不允许商用。

BakLLaVA 2采用了更大的数据集和更新的架构,超越了当前的LLaVa方法。BakLLaVA摆脱了BakLLaVA-1的限制,可以商用。

参考资料:

https://yousefhosni.medium.com/discover-4-open-source-alternatives-to-gpt-4-vision-82be9519dcc5

以上就是清华浙大主导开源视觉模型爆炸, GPT-4V与LLaVA、CogAgent等平台带来革命性变革的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/448035.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
java怎么过滤数组
上一篇 2025年11月7日 21:45:22
越来越黑暗死亡骑士搭配什么职业-越来越黑暗死亡骑士适合搭配何种职业
下一篇 2025年11月7日 21:45:25

相关推荐

  • deepseek官方社区网址_加入deepseek官方社区官网交流

    deepseek官方社区网址是https://chat.deepseek.com/,该平台提供互动交流、模型更新、技术文档、多语言支持及开源项目协作,同时支持实时对话、多终端同步与API集成。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ …

    2026年9月10日
    600
  • 用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    aixiv专栏:北京交通大学adam团队探索系统2对齐,提升大模型安全性 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 北京交通大学ADaM团队长期关注AI安全领域,此前已开源o1复现项目o1-Coder (https://www.php.…

    2026年9月7日 • 用户投稿
    000
  • Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释

    Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释

    deepseek开源大模型的横空出世,引发美国ai巨头恐慌,meta首当其冲。 近期,Meta员工在Teamblind匿名论坛爆料,DeepSeek一系列低成本高性能的模型发布,让Meta生成式AI团队面临巨大压力,其高昂预算的合理性受到质疑。 爆料帖原文指出,DeepSeek-V3在基准测试中超越…

    2026年9月7日 • 用户投稿
    000
  • DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录

    DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录

    darwin 1.5:一款基于语言接口的材料发现与设计ai模型 材料科学的核心挑战在于高效地寻找理想的材料成分和结构。传统的计算方法,例如高通量筛选和机器学习,通常依赖于复杂的、特定任务的描述符,这些描述符难以泛化,且与真实材料特性存在偏差,限制了实际应用。为了克服这些局限,GreenDynamic…

    2026年9月6日 • 用户投稿
    000
  • Evernote 竞品 Notesnook 正式开源

    出品 | osc开源社区(id:oschina2013) Streetwriters 近日兑现了 8 月初的承诺,正式将其笔记平台 Notesnook 开源。作为一个完全开源的 Evernote 替代品,Notesnook 强调隐私保护,支持端到端加密,旨在杜绝基于服务器的笔记分析与审查。 Note…

    2026年9月6日
    600
  • 蓝桥云课之新手入门指南

    蓝桥云课之新手入门指南蓝桥云课之新手入门指南蓝桥云课之新手入门指南蓝桥云课之新手入门指南

    第一种,就是网页版的linux 蓝桥ROS课程也是这种模式: 蓝桥云课ROS机器人发布5年啦(原实验楼ROS机器人在线云实践课程) 环境是16.04 代码语言:javascript代码运行次数:0运行复制 #includeint main(){ printf(“Hello, Shiyanlou.”)…

    2026年9月5日 • 用户投稿
    100
  • 致敬DeepSeek:以国产GPU为基,燎原中国AI生态之火

    deepseek开源模型(v3、r1系列等)在多语言理解和复杂推理任务中表现出色,极大促进了ai技术发展,为开发者提供了重要资源。deepseek不仅技术领先,更积极回馈开源社区。 摩尔线程高效部署DeepSeek 国产GPU创新企业摩尔线程已高效部署DeepSeek蒸馏模型推理服务,助力开发者基于…

    2026年9月5日
    400
  • 为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    deepseek风靡一时,但并非人人可用。 众多ai云服务商抓住机遇,纷纷上线deepseek模型,并推出优惠活动吸引用户。然而,免费token往往难以顺利调用deepseek-r1,可用性堪忧。 这凸显了选择可靠大厂的重要性。 火山引擎上线DeepSeek-R1模型(含完整版及蒸馏版),并赠送50…

    2026年9月2日 • 用户投稿
    100
  • 苹果选择通义,肯定阿里的同时,也否定了阿里

    苹果ai订单尘埃落定:阿里通义千问胜出,生态安全成关键 历时两年的苹果AI订单争夺战最终以阿里巴巴胜出告终。2月11日消息,苹果已选择阿里巴巴为中国版iPhone开发人工智能功能。 自2023年起,苹果便在测试多家中国AI模型,竞争者包括百度、字节跳动等巨头,以及百川智能、月之暗面和DeepSeek…

    2026年9月1日
    000
  • 撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开

    撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开

    月之暗面发布moba注意力机制,高效处理超长文本!近日,月之暗面团队公开了一种名为moba(mixture of block attention,块注意力混合)的全新注意力机制,该机制巧妙地将混合专家(moe)原理应用于注意力机制,并在长文本处理方面展现出显著优势。这与deepseek同期发布的ns…

    2026年8月31日 • 用户投稿
    200
  • 流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示

    流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示

    fluentread:你的浏览器翻译利器,助你畅享无障碍阅读体验! FluentRead是一款开源浏览器翻译插件,它利用先进的AI技术,旨在为你提供如同母语般流畅的阅读体验。支持多种翻译引擎,包括传统的机器翻译和强大的AI大模型,并且允许你自定义翻译服务。其核心功能包含智能翻译、便捷的双语对照显示以…

    2026年8月29日 • 用户投稿
    200
  • OpenAI等AI公司竞相利用“蒸馏”技术 构建低成本模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 全球领先的人工智能公司,包括OpenAI、微软和Meta,正积极采用“模型蒸馏”技术,致力于打造更经济实惠的AI模型,惠及消费者和企业。 DeepSeek公司在中国利用这项技术,基于Meta和阿…

    2026年8月28日
    100
  • 为什么Qwen能自我改进推理,Llama却不行?斯坦福找到了原理

    为什么Qwen能自我改进推理,Llama却不行?斯坦福找到了原理为什么Qwen能自我改进推理,Llama却不行?斯坦福找到了原理为什么Qwen能自我改进推理,Llama却不行?斯坦福找到了原理为什么Qwen能自我改进推理,Llama却不行?斯坦福找到了原理

    深度解析:大模型的自我改进能力为何参差不齐?斯坦福大学最新研究揭秘 近期,斯坦福大学的一项研究深入探讨了大型语言模型(LLM)自我改进能力背后的机制,解释了为何有些模型能够有效利用额外计算资源提升性能,而另一些则停滞不前。该研究的核心在于模型的初始“认知行为”。 研究人员选取了Qwen-2.5-3B…

    2026年8月27日 • 用户投稿
    200
  • Meta发布AI新模型系列 Llama 4,首次采用“混合专家”架构

    meta发布全新多模态ai模型系列llama 4,引领开源ai发展! 该系列包含llama 4 scout、llama 4 maverick和llama 4 behemoth三个模型,能够处理文本、视频、图像和音频等多种数据类型,并在不同格式间实现内容转换。 ☞☞☞AI 智能聊天, 问答助手, AI…

    2026年8月26日
    000
  • 开源 C++ 框架如何利用社区贡献提升可扩展性和维护性?

    开源 c++++ 框架利用社区贡献增强可扩展性和可维护性:可扩展性:添加新功能模块化设计可插件架构可维护性:改进文档修复错误代码审查实战案例: boost 库通过社区贡献,扩展了新库,持续维护现有库,提供了广泛的文档,提升了可扩展性和可维护性。 开源 C++ 框架を活用:利用社区贡献增强可扩展性和可…

    2025年12月18日
    000
  • 深度了解开源和商业C++框架之间的差异,以做出最佳选择

    在选择 c++++ 框架时,开源和商业选项的区别在于:许可证:开源框架免费且可修改,而商业框架通常受限。支持:开源框架依靠社区支持,而商业框架提供付费专业帮助。特性:开源框架特性广泛,但稳定性各异,而商业框架通常经过维护,功能可靠。成本:开源框架免费,而商业框架需要许可费用,价格可能很高。根据项目需…

    2025年12月18日
    400
  • C++开源框架与商用框架有何异同?

    商用框架需要购买许可证且拥有专业支持,而开源框架免费且可自定义,具备广泛的社区支持。差异还包括:许可证限制:开源框架更宽松,而商用框架更严格。安全性:商用框架通常经过更严格的测试和审核。认证:某些商用框架已通过行业认证。 C++ 开源与商用框架对比 引言 在现代 C++ 开发中,框架已成为必不可少的…

    2025年12月18日
    000
  • 开源 C++ 框架与商业 C++ 框架的最佳实践有何不同?

    开源和商业 c++++ 框架的最佳实践取决于以下关键差异:许可:开源框架使用免费和开源许可证,允许修改和分发,而商业框架受专有许可证限制。支持:开源框架依赖社区支持,而商业框架提供官方支持和服务。定制:开源框架更具可定制性,而商业框架提供预先构建的组件。价格:开源框架免费,而商业框架需要付费许可证。…

    2025年12月18日
    000
  • 开源C++框架与C++库的区别

    框架提供结构和预建组件,加快开发但限制灵活性。库提供特定功能的实现,扩展功能而不影响结构。例如,qt 框架简化了 gui 开发,而 opencv 库提供了计算机视觉功能。 开源 C++ 框架与库的区别 在软件开发中,框架和库是两种不同的概念。两种工具都可以在加快开发时间和提高代码质量方面发挥重要作用…

    2025年12月18日
    100
  • C++框架的开源与商业模式演变趋势如何?

    c++++ 框架开源与商业模式趋势:开源框架兴起,提供免费且强大的工具。商业框架适应竞争,提供附加功能和支持。混合模型流行,结合开源框架和商业附加组件。qt 作为案例,同时提供开源和商业许可选项。应对策略:评估选项、考虑混合模型、与社区互动。 C++ 框架开源与商业模式演变趋势 引言 开源 C++ …

    2025年12月18日
    000

发表回复

登录后才能评论
关注微信