参数量不到10亿的OctopusV3，如何媲美GPT-4V和GPT-4？

程序猿 • 2025年11月7日 09:02:50 • 用户投稿 • 阅读 4

多模态 AI 系统的特点在于能够处理和学习包括自然语言、视觉、音频等各种类型的数据，从而指导其行为决策。近期，将视觉数据纳入大型语言模型（如 GPT-4V）的研究取得了重要进展，但如何有效地将图像信息转化为 AI 系统的可执行操作仍面临挑战。为了实现图像信息的转化，一种常见的方法是将图像数据转化为对应的文本描述，然后由 AI 系统根据描述进行操作。这可以通过在现有的图像数据集上进行监督学习，让 AI 系统自动学习图像到文本的映射关系。此外，还可以利用强化学习方法，通过与环境互动来学习如何根据图像信息进行决策。另一种方法是直接将图像信息与语言模型结合，构建

在最近的一篇论文中，研究者提出了一种专为 ai 应用设计的多模态模型，引入了「functional token」的概念。

论文标题：Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent

论文链接：https://arxiv.org/pdf/2404.11459.pdf

模型权重和推理代码：https://www.nexa4ai.com/apply

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

该模型能完整支持边缘设备，研究者将其参数量优化至10亿以内。与GPT-4类似，该模型能同时处理英文和中文。实验证明，该模型能在包括树莓派等各类资源受限的终端设备上高效运行。

研究背景

人工智能技术的飞速发展彻底改变了人机交互的方式，催生出一批能够根据自然语言、视觉等多种形式的输入执行复杂任务、做出决策的智能 AI 系统。这些系统有望实现从图像识别、语言翻译等简单任务到医疗诊断、自动驾驶等复杂应用的自动化。多模态语言模型是这些智能系统的核心，使其能够通过处理整合文本、图像乃至音视频等多模态数据，理解和生成近乎人类的回复。相较于主要关注文本处理和生成的传统语言模型，多模态语言模型是一大飞跃。通过纳入视觉信息，这些模型能够更好地理解输入数据的语境和语义，从而给出更加准确、相关的输出。处理和整合多模态数据的能力，对于开发多模态 AI 系统至关重要，使其能够同时理解语言和视觉信息的任务，如视觉问答、图像导航、多模态情感分析等。

开发多模态语言模型的一大挑战在于，如何将视觉信息有效地编码为模型可处理的格式。这通常借助神经网络架构，例如视觉变换器（ViT）和卷积神经网络（CNN），从图像中提取层次化特征的能力，在计算机视觉任务中得到广泛应用。使用这些架构作为模型，可以学习从输入数据中提取更加复杂的表征。此外，基于transformer的架构不仅能够捕捉长距离依赖关系，还在理解图像中物体之间关系方面表现出色。近年来备受青睐。这些架构使模型能够从输入图像中提取有意义的特征，并将其转化为可与文本输入相结合的向量表示。

编码视觉信息的另一种方法是图像符号化 (tokenization), 即将图像分割为更小的离散单元或 token。这种方法让模型能以类似处理文本的方式来处理图像，实现两种模态的更无缝融合。图像 token 信息可与文本输入一同送入模型，使其能同时关注两种模态并生成更准确、更契合上下文的输出。例如，OpenAI 开发的 DALL-E 模型采用 VQ-VAE (向量量化变分自编码器) 的变体对图像做符号化，使模型能根据文本描述生成新颖图像。开发出能够根据用户提供的查询和图像采取行动的小型高效模型，对 AI 系统的未来发展影响深远。这些模型可部署于智能手机、物联网设备等资源受限的设备上，扩大其应用范围和场景。借助多模态语言模型的威力，这些小型系统能以更自然、直观的方式理解和回应用户的问询，同时考虑用户提供的视觉语境。这为实现更具吸引力、个性化的人机互动开启了可能，如根据用户喜好提供视觉推荐的虚拟助手，或根据用户面部表情调节设置的智能家居设备。

此外，多模态 AI 系统的发展有望实现人工智能技术的民主化，让更广泛的用户和行业受益。更小巧高效的模型可在算力较弱的硬件上训练，降低部署所需的计算资源和能耗。这可能带来 AI 系统在医疗、教育、娱乐、电商等各个领域的广泛应用，最终改变人们的生活和工作方式。

相关工作

多模态模型由于能够处理和学习文本、图像、音频等多种数据类型而备受关注。这类模型能捕捉不同模态间复杂的交互，并利用它们的互补信息来提升各类任务的性能。视觉 – 语言预训练 (VLP) 模型如 ViLBERT、LXMERT、VisualBERT 等，通过跨模态注意力学习视觉和文本特征的对齐，生成丰富的多模态表征。多模态 transformer 架构如 MMT、ViLT 等则对 transformer 做了改进，以高效处理多种模态。研究者还尝试将音频、面部表情等其他模态纳入模型，如多模态情感分析 (MSA) 模型、多模态情绪识别 (MER) 模型等。通过利用不同模态的互补信息，多模态模型相比单模态方法取得了更优的性能和泛化能力。

终端语言模型定义为参数量少于 70 亿的模型，因为研究者发现即使采用量化，在边缘设备上运行 130 亿参数的模型也非常困难。这一领域近期的进展包括 Google 的 Gemma 2B 和 7B、Stable Diffusion 的 Stable Code 3B 以及 Meta 的 Llama 7B。有趣的是，Meta 的研究表明，与大型语言模型不同，小型语言模型采用深而窄的架构会有更好的表现。其他对终端模型有益的技术还包括 MobileLLM 中提出的 embedding 共享、分组 query 注意力以及即时分块权重共享等。这些发现凸显了在开发终端应用的小型语言模型时，需要考虑不同于大模型的优化方法和设计策略。

Octopus 方法

Octopus v3 模型开发中采用的主要技术。多模态模型开发的两个关键方面是：将图像信息与文本输入相整合，以及优化模型预测动作的能力。

视觉信息编码

图像处理中存在多种视觉信息编码方法，常用隐藏层的 embedding。例如，VGG-16 模型的隐藏层 embedding 被用于风格迁移任务。OpenAI 的 CLIP 模型展示了对齐文本和图像 embedding 的能力，利用其图像编码器来嵌入图像。ViT 等方法则采用了图像 tokenization 等更先进的技术。研究者评估了多种图像编码技术，发现 CLIP 模型的方法最为有效。因此，本文采用基于 CLIP 的模型进行图像编码。

Functional token

与应用于自然语言和图像的 tokenization 类似，特定 function 也可封装为 functional token。研究者为这些 token 引入了一种训练策略，借鉴了自然语言模型处理未见词的技术。这一方法与 word2vec 类似，通过 token 的上下文环境来丰富其语义。例如，高级语言模型最初可能难以应对 PEGylation 和 Endosomal Escape 等复杂化学术语。但通过因果语言建模，尤其是在包含这些术语的数据集上训练，模型能够习得这些术语。类似地，functional token 也可通过并行策略习得，其中 Octopus v2 模型可为此类学习过程提供强大的平台。研究表明，functional token 的定义空间是无限的，从而能够将任意特定 function 表示为 token。

多阶段训练

为开发出高性能的多模态 AI 系统，研究者采用了集成因果语言模型和图像编码器的模型架构。该模型的训练过程分为多个阶段。首先，因果语言模型和图像编码器分别训练，建立基础模型。随后，将这两个部件合并，并进行对齐训练以同步图像和文本处理能力。在此基础上，借鉴 Octopus v2 的方法来促进 functional token 的学习。最后一个训练阶段中，这些能够与环境交互的 functional token 提供反馈，用于进一步优化模型。因此，最后阶段研究者采用强化学习，并选择另一个大型语言模型作为奖励模型。这种迭代训练方式增强了模型处理和整合多模态信息的能力。

模型评估

本节介绍模型的实验结果，并与集成 GPT-4V 和 GPT-4 模型的效果进行对比。在对比实验中，研究者首先采用 GPT-4V (gpt-4-turbo) 处理图像信息。然后将提取的数据输入 GPT-4 框架 (gpt-4-turbo-preview), 将所有 function 描述纳入上下文并应用小样本学习以提升性能。在演示中，研究者将 10 个常用的智能手机 API 转化为 functional token 并评估其表现，详见后续小节。

值得注意的是，虽然本文仅展示了 10 个 functional token, 但该模型可以训练更多 token 以创建更通用的 AI 系统。研究者发现，对于选定的 API, 参数量不到 10 亿的模型作为多模态 AI 表现可与 GPT-4V 和 GPT-4 的组合相媲美。

此外，本文模型的可扩展性允许纳入广泛的 functional token, 从而能够打造高度专业化的 AI 系统，适用于特定领域或场景。这种适应性使本文方法在医疗、金融、客户服务等行业尤为有价值，这些领域中 AI 驱动的解决方案可显著提升效率和用户体验。

GPT Detector

在线检查文本是否由GPT-3或ChatGPT生成

24 查看详情

在下面的所有 function 名称中，Octopus 仅输出 functional token 如 ,…,, 研究者将 functional token 替换为相应的函数名称以便更好地演示。以下所有结果都是直接生成的，无需任何输出解析器。Octopus v3 是一个单一模型，可同时处理中文和英文，这意味着无需专门训练另一个中文模型。

发送邮件

发送短信

Google 搜索

亚马逊购物

智能回收

失物招领

室内设计

Instacart 购物

DoorDash 外卖

宠物护理

社会影响

在 Octopus v2 的基础上，更新后的模型纳入了文本和视觉信息，从其前身纯文本方法迈出了重要一步。这一显著进展实现了视觉和自然语言数据的同步处理，为更广泛的应用铺平了道路。Octopus v2 引入的 functional token 可适应多个领域，如医疗和汽车行业。随着视觉数据的加入，functional token 的潜力进一步扩展到自动驾驶、机器人等领域。此外，本文的多模态模型让树莓派等设备实际转化为 Rabbit R1 、Humane AI Pin 之类的智能硬件成为可能，它采用终端模型而非基于云的方案。

Functional token 目前已获得授权，研究者鼓励开发者参与本文框架，在遵守许可协议的前提下自由创新。在未来的研究中，研究者旨在开发一个能够容纳音频、视频等额外数据模态的训练框架。此外，研究者发现视觉输入可能带来相当大的延迟，目前正在优化推理速度。

以上就是参数量不到10亿的OctopusV3，如何媲美GPT-4V和GPT-4？的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/419837.html

ai agent follow llama opus stable diffusion type 理论

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

震撼现场！联通数科秀具身智能“硬科技”，全面赋能工业智能化升级

上一篇 2025年11月7日 09:02:50

csv怎么转excel_csv如何转excel

下一篇 2025年11月7日 09:02:54

用户投稿

如何用HTML插入标签云组件_HTML CSS3变换与随机颜色生成算法

使用HTML构建标签结构，CSS3添加旋转与过渡效果，JavaScript生成随机HSL颜色并设置字体大小，实现动态交互的标签云组件。要在网页中实现一个动态的标签云组件，结合 HTML、CSS3 变换和随机颜色生成算法，可以按照以下步骤操作。这个组件不仅能提升页面视觉效果，还能通过色彩和旋转增加交…

程序猿
2025年12月23日
0000
用户投稿

如何在Go Gin应用中集成前端JavaScript模块（如Sentry）

本文探讨了在Go Gin框架下，通过HTML模板服务前端页面时，如何有效集成JavaScript模块（如Sentry）。针对浏览器不直接支持Node.js模块导入语法的问题，文章详细阐述了利用CDN引入Sentry SDK的解决方案，并提供了具体的代码示例，帮助开发者实现前端错误监控功能，避免了复杂…

程序猿
2025年12月23日
0000
用户投稿

html官网浏览入口_html网站设计免费平台

html官网浏览入口在https://www.codepen.io，该平台支持实时预览代码、创建Pen项目、Fork开源示例，可添加外部资源，具备点赞评论收藏等社区互动功能，设有挑战活动与作品集分类，开放API接口，界面简洁适合初学者，在线编写无需配置环境，支持多种预处理器和响应式测试。 html官…

程序猿
2025年12月23日
0000
用户投稿

html如何修改日期样式

在html中，可以使用“::-webkit-datetime-edit”伪元素选择器来修改日期格式，只需要用该选择器选中元素，在设置具体样式即可，具体语法为“::-webkit-datetime-edit{属性:属性值}”。本教程操作环境：windows7系统、CSS3&&HTML…

程序猿
2025年12月21日
1000
用户投稿

单选框的type属性值为什么

单选框的type属性值为“radio”。html type属性可以规定要显示的输入框“”元素的类型；值为“radio”时显示为单选框、“checkbox”时显示为复选框、“select”时显示为下拉式选框等等。本教程操作环境：windows7系统、HTML5版、Dell G3电脑。在HTML中，…

程序猿
2025年12月21日
0000
用户投稿

HTML中type是什么意思

在HTML中，type是类型的意思，是一个标签属性，主要用于定义标签元素的类型或文档（脚本）的MIME类型；例在input标签中type属性可以规定input元素的类型，在script标签中type属性可以规定脚本的MIME类型。本教程操作环境：windows7系统、html5版、Dell G3电…

程序猿
2025年12月21日
0000
HTML中ul标签如何去掉点？HTML无序列表的样式实例解析

本篇文章主要讲述的是关于html中的ul标签的默认小点给取消掉，还有关于html的无序列表ul标签的样式解释，给出了ul标签中的type属性三种值的介绍。现在就让我们一起来看本篇文章吧首先这篇文章一开始我们就开始介绍在html中是怎么把ul标签的点给去掉的：大家应该都使用过ul无序列表标签，ul…

程序猿
2025年12月21日 • 用户投稿
1000
html中的ol标签如何去掉标号呢？标签的使用方法总结

本篇文章介绍了html的ol标签是怎么去掉序号标号的，这里还有代码的详细解释，还有介绍了关于html ol有序列表标签如何更改序号，下文介绍了三种序号，大家也可以自己去想填写怎样的序号。现在来看这篇文章吧一、我们先看看html中的ol标签是如何去掉标号的呢：我们都知道html的ol标签是个有序列…

程序猿
2025年12月21日 • 用户投稿
0000
用户投稿

HTML ul标签的什么意思？HTML ul标签的作用详解

本篇文章主要的为大家讲解了关于html ul标签的三种重要的用法，还有关于html ul标签的解释，包含li标签的还有type属性对ul标签的使用情况，好了，下面大家一起来看文章吧首先让我们先来解释一下HTML ul标签的意思： ul标签定义的是表格当中无序列表，表格当中的无序列表都是在标签之中…

程序猿
2025年12月21日
0000
html的基础理论

本篇文章给大家分享的是关于html基础理论知识，内容很不错，有感兴趣的朋友可以看一下 HTML 语义化 HTML标签的语义化是指：通过使用包含语义的标签（如h1-h6）恰当地表示文档结构 css命名的语义化是指：为html标签添加有意义的class 为什么需要语义化：立即学习“前端免费学习笔记（…

程序猿
用户投稿 2025年12月21日
0000
用户投稿

javascript框架和库是什么_如何选择React、Vue或Angular？

JavaScript框架与库分别提供按需调用的功能集合和约束性开发结构；React是UI组件库，生态灵活但需自行整合工具；Vue渐进式易上手，兼顾原型与工程化；Angular是全功能TypeScript框架，适合强规范企业级项目。 JavaScript框架和库是封装好的代码集合，用来简化前端开发——…

程序猿
2025年12月21日
0000
用户投稿

React应用生产环境环境变量配置深度指南

本文针对react应用在生产环境中无法读取`.env`文件配置的环境变量问题，深入剖析其工作原理、常见原因及排查方法。通过详细的步骤和示例代码，指导开发者正确配置和使用环境变量，解决api调用层面的`null`响应问题，确保应用在生产环境下的稳定运行。在React应用开发中，环境变量（如API密钥…

程序猿
2025年12月21日
0000
用户投稿

JS注解怎么实现文档化_ JS注解生成开发文档的流程与工具

JSDoc是一种JavaScript结构化注释规范，通过@param、@returns等标签描述代码元素，并借助工具生成HTML文档，结合IDE支持和CI/CD可提升团队协作效率。 JavaScript本身不支持原生注解（Annotation）像Java那样的语法，但通过约定的注释格式和配套工具，可…

程序猿
2025年12月21日
0000
用户投稿

JS注解怎么标注联合类型_ JS联合类型的注解书写与使用技巧

在JavaScript中可通过JSDoc使用联合类型注解，如string|number表示多类型支持，结合@param、@typedef等标签提升代码可读性与编辑器提示，适用于函数参数、返回值等场景。在JavaScript中，虽然原生不支持类型注解，但在使用JSDoc配合现代编辑器（如VS Cod…

程序猿
2025年12月21日
0000
用户投稿

VS Code主题开发：告别JSON，拥抱脚本化生成

vs code主题扩展最终需json格式定义，但开发者可通过javascript或typescript等脚本语言生成此json文件。这种方法有效解决了大型json文件难以维护、不支持注释等问题，并能实现颜色动态计算，显著提升主题开发的灵活性与效率。为什么选择脚本化生成VS Code主题？在开发V…

程序猿
2025年12月20日
0000
用户投稿

如何用Quasar框架开发一个跨平台应用？

Quasar基于Vue.js用一套代码构建多平台应用，支持响应式网站、PWA、移动App和桌面应用。通过quasar create创建项目，利用模式（SPA、PWA、Electron等）切换目标平台，使用Quasar组件库编写通用UI，配合Pinia管理状态，最后通过不同构建命令发布到各平台，实现高…

程序猿
2025年12月20日
1000
用户投稿

怎么利用JavaScript进行前端代码覆盖率统计？

答案：利用JavaScript进行前端代码覆盖率统计的核心是通过Istanbul/nyc等工具对代码插桩，结合测试框架收集执行数据并生成报告。具体流程包括：在代码执行前通过Babel或Webpack插件（如babel-plugin-istanbul）插入计数器实现插桩；运行测试时记录哪些代码被执行；…

程序猿
2025年12月20日
1000
用户投稿

typescript中的参数分享

TypeScript 中的参数共享允许组件间共享参数，实现跨组件状态维护和数据变更共享。通过 @Input 装饰器传递父组件参数，使用 @Output 装饰器定义子组件事件，以便在子组件状态改变时通知父组件。参数共享提高复用性，简化状态管理，允许子组件向父组件发出通知，但应谨慎使用，避免大量数据共享…

程序猿
2025年12月19日
0000
用户投稿

手机如何运行typescript方法

要在手机上运行 TypeScript 方法，可以使用 TypeScript 编译器或第三方库：TypeScript 编译器：将 TypeScript 代码编译成 JavaScript，然后集成到移动应用程序中。第三方库：如 React Native 或 NativeScript，允许使用 Typ…

程序猿
2025年12月19日
0000
用户投稿

typescript用来干嘛_typescript的作用

TypeScript 是一种用于构建大型复杂应用程序的开源编程语言，它扩展了 JavaScript 的功能，具有以下作用：类型系统：编译时检查类型错误，提高代码可靠性。面向对象编程特性：支持类、接口、抽象类，增强代码组织性和维护性。模块系统：分解程序为可重用模块，提升可维护性和可扩展性。全面的类型推…

程序猿
2025年12月19日
0000

发表回复

登录后才能评论

参数量不到10亿的OctopusV3，如何媲美GPT-4V和GPT-4？

关于作者

相关推荐

发表回复