复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

最近,OpenAI 的视频生成模型 Sora 爆火,生成式 AI 模型在多模态方面的能力再次引起广泛关注。

现实世界本质上是多模态的,生物体通过不同的渠道感知和交换信息,包括视觉、语言、声音和触觉。开发多模态系统的一个有望方向是增强 LLM 的多模态感知能力,主要涉及多模态编码器与语言模型的集成,从而使其能够跨各种模态处理信息,并利用 LLM 的文本处理能力来产生连贯的响应。

然而,这一策略仅仅适用于文本生成,并不涵盖多模态输出。一些开拓性的研究在语言模型中实现了多模态理解和生成,取得了重大进展,但这些模型仅限于单一的非文本模态,比如图像或音频。

为了解决上述问题,复旦大学邱锡鹏团队联合 Multimodal Art Projection(MAP)、上海人工智能实验室的研究者提出了一种名为 AnyGPT 的多模态语言模型,该模型能够以任意的模态组合来理解和推理各种模态的内容。具体来说,AnyGPT 可以理解文本、语音、图像、音乐等多种模态交织的指令,并能熟练地选择合适的多模态组合进行响应。

例如给出一段语音 prompt,AnyGPT 能够生成语音、图像、音乐形式的综合响应:

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

给出文本 + 图像形式的 prompt,AnyGPT 能够按照 prompt 要求生成音乐:

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

论文地址:https://arxiv.org/pdf/2402.12226.pdf项目主页:https://junzhan2000.github.io/AnyGPT.github.io/

方法简介

AnyGPT 利用离散表征来统一处理各种模态,包括语音、文本、图像和音乐。

为了完成任意模态到任意模态的生成任务,该研究提出了一个可以统一训练的综合框架。如下图 1 所示,该框架由三个主要组件组成,包括:

多模态 tokenizer作为主干网络的多模态语言模型多模态 de-tokenizer

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

其中,tokenizer 将连续的非文本模态转换为离散的 token,随后将其排列成多模态交错序列。然后,语言模型使用下一个 token 预测训练目标进行训练。在推理过程中,多模态 token 被相关的 de-tokenizer 解码回其原始表征。为了丰富生成的质量,可以部署多模态增强模块来对生成的结果进行后处理,包括语音克隆或图像超分辨率等应用。

AnyGPT 可以稳定地训练,无需对当前的大型语言模型(LLM)架构或训练范式进行任何改变。相反,它完全依赖于数据级预处理,使得新模态无缝集成到 LLM 中,类似于添加新语言。

这项研究的一个关键挑战是缺乏多模态交错指令跟踪数据。为了完成多模态对齐预训练,研究团队利用生成模型合成了第一个大规模「任意对任意」多模态指令数据集 ——AnyInstruct-108k。它由 108k 多轮对话样本组成,这些对话错综复杂地交织着各种模态,从而使模型能够处理多模态输入和输出的任意组合。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

这些数据通常需要大量比特才能准确表征,从而导致序列较长,这对语言模型的要求特别高,因为计算复杂度随着序列长度呈指数级增加。为了解决这个问题,该研究采用了两阶段的高保真生成框架,包括语义信息建模和感知信息建模。首先,语言模型的任务是生成在语义层面经过融合和对齐的内容。然后,非自回归模型在感知层面将多模态语义 token 转换为高保真多模态内容,在性能和效率之间取得平衡。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

实验

实验结果表明,AnyGPT 能够完成任意模态对任意模态的对话任务,同时在所有模态中实现与专用模型相当的性能,证明离散表征可以有效且方便地统一语言模型中的多种模态。

该研究评估了预训练基础 AnyGPT 的基本功能,涵盖所有模态的多模态理解和生成任务。该评估旨在测试预训练过程中不同模态之间的一致性,具体来说是测试了每种模态的 text-to-X 和 X-to-text 任务,其中 X 分别是图像、音乐和语音。

为了模拟真实场景,所有评估均以零样本模式进行。这意味着 AnyGPT 在评估过程中不会对下游训练样本进行微调或预训练。这种具有挑战性的评估设置要求模型泛化到未知的测试分布。

评估结果表明,AnyGPT 作为一种通用的多模态语言模型,在各种多模态理解和生成任务上取得了令人称赞的性能。

图像

该研究评估了 AnyGPT 在图像描述任务上的图像理解能力,结果如表 2 所示。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

文本到图像生成任务的结果如表 3 所示。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持语音

该研究通过计算 LibriSpeech 数据集的测试子集上的词错误率 (WER) 来评估 AnyGPT 在自动语音识别 (ASR) 任务上的性能,并使用 Wav2vec 2.0 和 Whisper Large V2 作为基线,评估结果如表 5 所示。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

音乐

该研究在 MusicCaps 基准上评估了 AnyGPT 在音乐理解和生成任务方面的表现,采用 CLAP_score 分数作为客观指标,衡量生成的音乐和文本描述之间的相似度,评估结果如表 6 所示。

复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持

感兴趣的读者可以阅读论文原文,了解更多研究内容。

以上就是复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/621156.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
刺客信条影DX12错误怎么办
上一篇 2025年11月11日 06:33:00
Java怎么将两个int数组合并
下一篇 2025年11月11日 06:33:05

相关推荐

  • 豆包语音2.0— 字节跳动推出的升级版AI语音模型

    豆包语音2.0是什么 豆包语音2.0是字节跳动推出的升级版ai语音模型,包含两大核心模型:豆包语音合成模型2.0(doubao-seed-tts 2.0)和豆包声音复刻模型2.0(doubao-seed-icl 2.0)。语音合成模型2.0支持对话式合成,可精准理解语义和情感,实现复杂公式朗读,准确…

    2026年9月21日
    100
  • REDMI有史以来最强手机!K90 Pro Max这次真的强到爆

    REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆

    如果说redmi过去是“性价比之王”,那么这一次,它彻底进化成了“性能怪兽”。10月23日即将登场的redmi k90 pro max,不仅是品牌年度旗舰的压轴大戏,更是其历史上首款冠以“pro max”之名的巅峰之作。 这可以看作是REDMI向高端市场发起冲击的正式宣言。卢伟冰亲自放话:“给4K价…

    2026年9月21日 用户投稿
    300
  • vivo浏览器设置选项在哪里_vivo浏览器系统设置入口位置

    首先打开vivo浏览器,点击右上角三点图标进入设置菜单;也可通过首页滑动侧边栏或搜索框输入“设置”快速跳转,进而调整搜索引擎、隐私权限及清除缓存等配置。 如果您在使用vivo浏览器时需要调整浏览设置,例如更改默认搜索引擎、管理隐私权限或清除缓存数据,可以通过浏览器内置的系统设置入口进行操作。以下是进…

    2026年9月20日
    100
  • mac怎么合并多个PDF文件_Mac合并PDF文件方法

    使用macOS可便捷合并PDF:1. 用预览拖拽缩略图或插入文件;2. 通过访达快速操作批量合并;3. 借助在线工具如iLovePDF处理。 如果您需要将多个PDF文件整合为一个文档以便于分享或管理,macOS系统提供了多种便捷的合并方式。以下是一些有效的操作步骤: 本文运行环境:MacBook P…

    2026年9月20日
    000
  • order by排序在mysql中如何实现

    ORDER BY用于对查询结果排序,支持ASC升序和DESC降序,位于SELECT语句末尾,可按单列或多列排序;MySQL优先利用索引有序性避免排序,若无合适索引则采用filesort在内存或磁盘排序;优化器选择单路或双路排序以提升效率;性能关键包括为排序字段建立索引、避免大结果集无索引排序、减少S…

    2026年9月20日
    000
  • 在Java中如何实现多条件排序

    使用Comparator.thenComparing()可实现多条件排序,如先按年龄升序、再按分数降序、最后按姓名升序排列。 在Java中实现多条件排序,通常可以通过 Comparator 接口来完成。你可以根据多个字段依次比较,优先级从高到低排列。以下是几种常用且清晰的实现方式。 使用 Compa…

    2026年9月20日
    200
  • 企查查如何使用快捷查询栏_企查查查询栏的自定义配置教程

    首先启用快捷查询栏,再添加自定义模板如“高新技术企业_北京”,设置行业、地区等条件并保存,随后调整模板顺序以优化访问效率,最后可编辑或删除不再需要的查询配置。 如果您希望在企查查中快速查找企业信息,但每次手动输入查询条件较为繁琐,可以通过配置快捷查询栏来提升效率。通过自定义查询栏的显示字段和默认筛选…

    2026年9月20日
    000
  • 如何在Laravel中实现数据排序

    在laravel中实现数据排序的核心方法是使用eloquent查询构建器的orderby方法。1. 基础排序可通过orderby指定字段及方向,如按创建时间倒序排列;2. 可使用latest()和oldest()分别实现倒序和正序排列;3. 多字段排序通过链式调用多个orderby方法实现,如先按姓…

    2026年9月20日
    100
  • LongCat-Audio-Codec— 美团开源的语音编解码方案

    LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 依图语音开放平台 依图语音开放平台 6 查看详情 LongCat-Audio-Codec是什么 longcat-audio-codec 是美团 longcat 团队开源的语音编解码方案,专为语音…

    2026年9月20日 用户投稿
    500
  • 蛙漫2(日版)(网页版)在线登录 蛙漫2(日版)入口通道

    蛙漫2(日版)在线登录入口为https://manwa2.com/,该平台汇集日漫、国漫等多类型高清漫画,涵盖校园、恋爱、冒险等题材,支持每日更新、智能推荐、夜间模式及书架同步等功能。 蛙漫2(日版)在线登录入口通道在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来蛙漫2(日版)最新网页版访…

    2026年9月20日
    100
  • Steam商店重磅更新上线!心动游戏发售不错过

    steam平台每日都有大量新游戏上线,这让玩家难以全面关注所有值得关注的作品。为解决这一难题,valve正推出一项全新功能——“个性化推荐日历”,目前该功能已通过steam labs实验项目进入测试阶段。 据Valve介绍,这项日历功能将根据每位用户的兴趣偏好和历史游玩行为,智能筛选并推荐可能感兴趣…

    2026年9月13日
    000
  • Linux如何统计目录大小du命令实例

    Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例

    使用du命令可高效查看Linux目录大小,如du -s显示总占用空间,du -sh以易读格式展示,du -h列出各子目录大小,–max-depth限制层级深度,结合sort -h可排序定位最大目录。 在Linux系统中,du(disk usage)命令用于查看文件和目录的磁盘使用情况。统…

    2026年9月13日 用户投稿
    100
  • 索引如何提升mysql查询效率

    索引通过B+树结构改变数据查找方式,使MySQL无需全表扫描即可快速定位数据。有序存储、多层结构和高扇出性让查询效率大幅提升。例如在age字段建索引后,SELECT * FROM users WHERE age = 25可直接在B+树中查找,避免逐行比对。应为高频查询字段创建索引,优先使用复合索引并…

    2026年9月13日
    200
  • 悟空浏览器网页版主站链接 悟空浏览器官方网站进入

    悟空浏览器官网为https://www.wkbrowser.com,桌面端可直接访问完整版网页,移动端建议进入m.wkbrowser.com使用极简版本,支持多系统设备适配,提供安卓与iOS客户端下载,具备视频、图文、小说、短剧等内容的高效加载与播放功能,界面设计人性化,包含智能导航、历史检索、书签…

    2026年9月13日
    100
  • MySQL GROUP_CONCAT函数实现订单项按日期合并显示

    本教程详细阐述了如何利用MySQL的GROUP_CONCAT函数,将同一日期下的多个订单项合并为一行显示,并以逗号分隔。文章将涵盖从数据库查询优化到PHP数据处理的完整流程,旨在帮助开发者高效地在购物网站等场景中展示分组后的订单信息,提升数据可读性。 在构建在线购物平台时,展示客户订单详情是一个常见…

    2026年9月13日
    100
  • win11怎么查看并结束占用cpu高的进程_Win11CPU占用高进程查看与结束方法

    电脑运行慢或风扇狂转时,可通过任务管理器、资源监视器、命令提示符或PowerShell定位并结束高CPU占用进程。2. 按Ctrl+Shift+Esc打开任务管理器,按CPU排序找出异常进程,右键结束。3. 使用Win+R输入resmon打开资源监视器,查看CPU图表与详细列表,选中高占用进程后点击…

    2026年9月12日
    700
  • 猎豹浏览器官方网址最新入口 猎豹浏览器主页直达访问官方链接

    猎豹浏览器官方网址最新入口是https://www.liebao.cn/,该官网提供界面布局清晰、功能模块明确的主页直达访问,并支持智能搜索、一键清理缓存、网页翻译和夜间模式等核心功能。 猎豹浏览器官方网址最新入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来猎豹浏览器主页直达访问官方链…

    2026年9月12日
    200
  • QQ闪照打不开 QQ临时图片查看技巧

    答案是可通过查找手机缓存找回未查看的QQ闪照。进入tencent/MobileQQ/diskcache文件夹,按修改时间倒序排列,找到接近发送时间的无后缀乱码文件,用图片查看器打开并保存。 QQ闪照打不开,通常是因为发送方设置了查看时限或你错过了有效查看时间。虽然不能真正“解除限制”,但可以通过查找…

    2026年9月12日
    200
  • 打造移动声音标杆! REDMI K90 Pro Max评测:带低音炮的旗舰手机

    一、前言:被遗忘的旗舰音质赛道 如今的智能手机市场,各大厂商纷纷在影像系统、屏幕素质、处理器性能和充电速度上展开激烈竞争——然而,音频体验却仿佛成了无人问津的“冷门领域”。 可事实上,声音才是连接用户情感最直接的桥梁。无论是追剧时的环绕声场、听音乐时的细腻还原,还是游戏中精准的声音定位、通话时的清晰…

    2026年9月12日
    100
  • 京东自营店的苹果手机是正品吗?京东自营店可靠吗?权威解答与避坑指南

    在电商平台选购高端数码产品时,京东自营的apple产品京东自营旗舰店已成为众多消费者的首选。作为苹果官方认证的授权经销商,京东自营凭借其直接采购模式确保了商品来源的可靠性,所售每一台苹果手机均享有与官网同等的全国联保服务。依托平台严格的商家准入审核制度以及假一赔十的服务承诺,京东自营已连续五年位居消…

    2026年9月12日
    500

发表回复

登录后才能评论
关注微信