开源模型、单卡训练,带你了解爆火的文本指导音频生成技术AudioLDM

给出一段文字,人工智能就可以生成音乐,语音,各种音效,甚至是想象的声音,比如黑洞和激光枪。最近由英国萨里大学和帝国理工学院联合推出的AudioLDM,在发布之后迅速火遍国外,一周内在推特上收获了近 300 次的转发和 1500 次的点赞。在模型开源第二天,AudioLDM就冲上了 Hugging Face 热搜榜第一名,并在一周内进入了 Hugging Face 最受喜欢的前 40 名应用榜单(共约 25000),也迅速出现了很多基于 AudioLDM 的衍生工作。

AudioLDM 模型有如下几个亮点:

首个同时可以从文本生成音乐,语音和音效的开源模型。由学术界开发,用更少的数据,单个 GPU,以及更小的模型,实现了目前最好的效果。提出用自监督的方式训练生成模型,使文本指导音频生成不再受限于(文本-音频)数据对缺失的问题。模型在不做额外训练的情况下(zero-shot),可以实现音频风格的迁移,音频缺失填充,和音频超分辨率。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

项目主页:https://audioldm.github.io/ 论文:https://arxiv.org/abs/2301.12503开源代码和模型:https://github.com/haoheliu/AudioLDMHugging Face Space:https://huggingface.co/spaces/haoheliu/audioldm-text-to-audio-generation

作者首先在一月二十七日发布了对模型的预告,展示了非常简单的一个文本:”A music made by []” (一段由【】生成的音乐) 去生成不同声音的效果。视频展示了由不同乐器,甚至是蚊子制作的音乐,在推特上迅速受到了广泛关注,播放次数超过 35.4K 次,被转发了 130 余次。

图片

随后作者公开了论文和一个新的视频。这个视频中作者展示了模型的大部分能力,以及和 ChatGPT 合作去生成声音的效果。AudioLDM 甚至可以生成外太空的声音。

随后作者发布了论文,预训练的模型,和一个可玩的接口,点燃了推特网友们的热情,在第二天就迅速登上了 Hugging Face 热搜榜的第一名:

图片

推特上这篇工作受到了广泛的关注,业内学者们纷纷转发和评价:

图片

网友们使用 AudioLDM 生成了各种各样的声音。

比如有生成二次元猫娘打呼噜的声音:

图片

以及鬼魂的声音:

图片

还有网友合成出了:“木乃伊的声音,低频,有一些痛苦的呻吟声”。

甚至还有网友合成出了:“有旋律的放屁声”。

不得不感叹网友们想象力之丰富。

还有网友直接用 AudioLDM 生成了一系列的音乐专辑,有各种不同的风格,包括爵士,放克,电子和古典等类型。一些音乐颇有创造性。

比如 “以宇宙和月球为主题创作一个氛围音乐”: 

图片

以及 “使用未来的声音创作一个音乐”:

图片

感兴趣的读者可以访问这个音乐专辑网站:https://www.latent.store/albums

也有网友发挥想象力,结合图片生成文字的模型和 AudioLDM,制作了一个图片指导音效生成的应用。

比如说如果给 AudioLDM 这样的文本:”A dog running in the water with a frisbee” (一个在水中奔跑并叼着飞盘的狗狗):

图片

可以生成如下狗狗拍打水面的声音。

甚至可以还原老照片中的声音,比如下边这个图片:

图片

在获得 “A man and a woman sitting at a bar”(一个男人和一个女人坐在酒吧中)的文本后,模型可以生成如下的声音,可以听到模糊的说话声,以及背景酒杯碰撞的声音。

还有网友用 AudioLDM 生成了火焰狗狗的声音,非常有趣。

作者还制作了一个视频来展示模型在音效上的生成能力,展示了 AudioLDM 生成样本接近音效库的效果。

事实上文本生成音频只是 AudioLDM 的能力的一部分,AudioLDM 同样可以实现音色转换、缺失填补和超分辨率。

下边这两张图展示了(1)打击乐到氛围音乐;以及(2)小号到小朋友的歌声的音色转换。

图片

图片

下边是打击乐到氛围音乐(渐进的转换强度)的效果。

小号的声音转化为小朋友唱歌的声音(渐进的转换强度)的效果。

下边我们将会展示模型在音频超分辨率,音频缺失填充和发声材料控制上的效果。由于文章篇幅有限,音频主要用频谱图的方式展示,感兴趣的读者请前往 AudioLDM 的项目主页查看:https://audioldm.github.io/ 

在音频超分上,AudioLDM 的效果也是非常优秀,相比之前的超分辨率模型,AudioLDM 是通用的超分辨率模型,不仅限于处理音乐和语音。

图片

Designs.ai Designs.ai

AI设计工具

Designs.ai 48 查看详情 Designs.ai

在音频缺失填充上,AudioLDM 可以根据给定文本的不同填入不同的音频内容,并且在边界处过渡比较自然。

此外,AudioLDM 还展现出了很强的控制能力,例如对声学环境,音乐的情绪和速度,物体材料,音调高低以及先后顺序等都有很强的控制能力,感兴趣的读者可以到 AudioLDM 的论文或项目主页查看。

作者在文章中对 AudioLDM 模型做了主观打分和客观指标的评测,结果显示都可以明显超过之前最优的模型:

图片

其中 AudioGen 为 Facebook 在 2022 年十月提出的模型,使用了十个数据集,64 块 GPU 和 285 兆的参数量。与之相比,AudioLDM-S 可以用单独一个数据集,1 块 GPU 和 181 兆的参数量达到更好的效果。

图片

主观打分也可以看出 AudioLDM 明显优于之前的方案 DiffSound。那么,AudioLDM 究竟做了哪些改进使得模型有如此优秀的性能呢?

首先,为了解决文本 – 音频数据对数量太少的问题,作者提出了自监督的方式去训练 AudioLDM。

图片

具体来说,在训练核心模块 LDMs 的时候,作者使用音频自身的 embedding 去作为 LDMs 的 condition 信号,整个流程并不涉及文本的使用(如上图所示)。这种方案基于一对预训练好的音频 – 文本对比学习编码器(CLAP),在 CLAP 原文中 CLAP 展示了很好的泛化能力。AudioLDM 利用了 CLAP 优秀的泛化能力,达到了在不需要文本标签情况下在大规模音频数据上的模型训练。

事实上,作者发现单使用音频训练甚至能比使用音频 – 文本数据对更好:

图片

作者分析了两方面原因:(1)文本标注本身难以包括音频的所有信息,比如声学环境,频率分布等,从而导致文本的 embedding 不能很好表征音频,(2)文本本身的质量并不完美,例如这样的一个标注 “Boats: Battleships-5.25 conveyor space”,这种标注即使人类也很难想象具体是什么声音,就会导致模型训练的问题。相比之下,使用音频自身做 LDM 的 condition 可以保证目标音频和 condition 的强关联性,从而达到更好的生成效果。

除此之外,作者采用的 Latent Diffusion 方案使得 Diffusion 模型可以在一个较小的空间中进行计算,从而大大的减少了模型对算力的要求。

在模型训练和结构上的许多细节探索也帮助 AudioLDM 获得了优秀的性能。

作者还画了一个简单的结构图来介绍了两种主要的下游任务:

图片

作者还在不同的模型结构,模型大小,DDIM 采样步数以及不同 Classifier-free Guidance Scale 做了详尽的实验。

在公开模型的同时,作者还公开了他们的生成模型评价体系的代码库,以统一今后学术界在这类问题上的评价方法,从而方便论文之间的比较,代码在如下链接中:https://github.com/haoheliu/audioldm_eval

在这项技术爆火的同时,也有网友对技术的安全性提出了质疑:

图片

图片

作者的团队表示会对模型的使用尤其是商用加以限制,保证模型仅被用来学术交流,并使用合适的 LICENSE 和水印保护,防止 Ethic 方面问题的出现。

作者信息

论文有两位共同一作:刘濠赫(英国萨里大学)和陈泽华(英国帝国理工学院)。

图片

刘濠赫目前博士就读于英国萨里大学,师从 Mark D. Plumbley 教授。其开源项目在 GitHub 上收获了上千star。在各大学术会议上发表论文二十余篇,并在多项世界机器声学大赛中获得前三的名次。在企业界与微软,字节跳动,英国广播公司等有广泛的合作,个人主页: https://www.surrey.ac.uk/people/haohe-liu

图片

陈泽华是英国帝国理工学院在读博士生,师从 Danilo Mandic 教授,曾在微软语音合成研究组及京东人工智能实验室实习,研究兴趣涉及生成模型、语音合成、生物电信号生成。

以上就是开源模型、单卡训练,带你了解爆火的文本指导音频生成技术AudioLDM的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/839304.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
宝可梦集换式卡牌金融属性凸显,官方积极应对黄牛抢购现象
上一篇 2025年11月27日 11:52:43
java框架的落地实践案例:物联网平台的架构设计
下一篇 2025年11月27日 11:52:45

相关推荐

  • ChatGPT代码会出错吗_AI编程中5个常见错误及解决方法

    AI编程中常见错误包括语法不匹配、逻辑遗漏、API误用、安全漏洞和集成困难,需通过版本明确、测试验证、文档核对、安全扫描和上下文补充等方式解决,结合人工审查与测试才能确保代码质量。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ ChatGP…

    2026年9月20日
    100
  • VSCode的悬浮提示信息如何自定义?

    通过JSDoc或docstring添加注释可直接影响VSCode悬浮提示内容,如JavaScript/TypeScript中使用/* /格式、Python中使用三引号文档字符串,配合Pylance等扩展增强显示;安装语言支持扩展可提升提示丰富度;高级场景可通过开发自定义语言服务器,在textDocu…

    2026年9月20日
    500
  • Gemini2.5官方网址平台_Gemini2.5网页端官方入口

    Gemini 2.5官方网址为aistudio.google.com,国内用户可访问该平台使用多语言交互、代码生成、上下文记忆及多模态处理等功能,界面简洁且支持API调用与文件解析。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Gemin…

    2026年9月20日
    000
  • Gemini2.5网页版官方链接_Gemini2.5在线下载网址

    Gemini 2.5网页版官方链接是https://aistudio.google.com,用户可通过此入口在Google AI Studio平台进行交互,或使用镜像站、API及第三方客户端等方式访问。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模…

    2026年9月20日
    000
  • LongCat-Audio-Codec— 美团开源的语音编解码方案

    LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 依图语音开放平台 依图语音开放平台 6 查看详情 LongCat-Audio-Codec是什么 longcat-audio-codec 是美团 longcat 团队开源的语音编解码方案,专为语音…

    2026年9月20日 用户投稿
    500
  • 如何用ChatGPT来重构优化一段旧代码_提升代码质量与性能的步骤

    明确目标并提供上下文,分步引导ChatGPT优化代码结构、算法和语言特性,最后验证建议并本地测试,确保重构有效且安全。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 用ChatGPT来重构和优化旧代码是一种高效提升代码质量与性能的方式。关键…

    2026年9月12日
    100
  • AudioStory— 腾讯ARC推出的音频生成模型

    AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 腾讯混元文生视频 腾讯发布的AI视频生成大模型技术 137 查看详情 AudioStory是什么 audiostory 是由腾讯 arc 实验室推出的一项创新音频生成技术,能够根据自然语言描述自…

    2026年9月12日 用户投稿
    400
  • 超300万用户的AI翻译插件被曝隐私泄露,敏感内容曾网上公开

    近日,AI网页翻译工具“沉浸式翻译”被曝存在隐私泄露隐患。当用户使用其翻译功能并生成分享链接时,相关翻译内容会被存储在公开可访问的服务器上,导致诸如商业合同、保险资料、签证文件等敏感信息可能被搜索引擎收录,从而暴露于互联网之中。尽管该插件已紧急下架涉事功能,但此前已被抓取的数据仍持续在网络中流传。!…

    用户投稿 2026年9月10日
    100
  • 太平洋科技AI产品热度榜(8月):DeepSeek拿下第一,你常用的排第几?

    太平洋科技AI产品热度榜(8月):DeepSeek拿下第一,你常用的排第几?太平洋科技AI产品热度榜(8月):DeepSeek拿下第一,你常用的排第几?太平洋科技AI产品热度榜(8月):DeepSeek拿下第一,你常用的排第几?太平洋科技AI产品热度榜(8月):DeepSeek拿下第一,你常用的排第几?

    2025年8月,ai领域激荡前行。 当大模型价格战的余波渐渐平息,当“一分钱用一天”的宣传语不再令人惊艳,行业的目光正从参数规模的“军备竞赛”悄然转向实际应用的落地成效。技术的喧嚣终将归于价值的本质——究竟哪些产品,正在被最广泛的用户所关注与热议? 为此,PHP中文网正式发布「AI产品热度TOP榜」…

    2026年9月10日 用户投稿
    200
  • AI视频快速生成工具 AI一键生成视频在线平台

    AI一键生成视频在线平台推荐Vidu,其支持文生视频,数秒内生成1080P高清内容,具备高连贯分镜逻辑与自然动作表现,适配多平台比例并提供丰富视觉风格,操作简单高效。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ AI视频快速生成工具AI一…

    2026年9月8日
    300
  • Gemini2.5官方主页链接_Gemini2.5在线体验网址

    Gemini 2.5官方主页链接是https://gemini.google.com,用户可通过该网址进行在线体验,平台提供文本对话、文件上传、跨设备同步等功能,并支持通过Google AI Studio和Vertex AI调用高级模型。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无…

    2026年9月8日
    100
  • 腾讯朱雀大模型入口 朱雀AI检测官网网页版工具

    腾讯朱雀大模型检测入口为https://matrix.tencent.com/ai-detect/,提供文本与图像AI生成内容检测服务,支持主流格式上传与多模型识别,准确率超90%,用于学术、内容审核等场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R…

    2026年9月8日
    000
  • 特斯拉 FSD 加入大量全新渲染模型 玩滑板的人都能识别

    近日,有汽车领域博主爆料,特斯拉的fsd(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。 这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、…

    2026年9月8日
    100
  • OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    openai的智能体时代真的要来了!据可靠消息源透露,openai在mac版chatgpt桌面应用中隐藏了启用/禁用智能体“operator”的选项。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 这一消息得到了多方证实,Operator智…

    2026年9月7日 用户投稿
    100
  • AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    编辑 | scienceai 近年来,AI 技术在蛋白质研究领域发挥了越来越重要的作用。从 AlphaFold2 在结构预测任务上的脱颖而出,到各类蛋白质语言模型(PLMs)在功能预测方面的重大进展,生物研究者们可以利用各式各样的 AI 模型来辅助他们的研究。 然而,随着模型变得越来越复杂,如何训练…

    2026年9月7日 用户投稿
    200
  • 清华大学研究组首次在双重编码量子比特之间实现高保真度量子纠缠门

    清华大学科研团队在双重编码量子比特量子逻辑门研究中取得突破性进展,成功在钡离子超精细能级中实现了双重编码量子比特间的直接纠缠逻辑门。这项研究成果显著降低了量子线路复杂度,为未来量子纠错和离子-光子量子网络应用铺平了道路。 离子阱技术是构建大规模通用量子计算机的热门选择,已成功实现高保真量子比特操作。…

    2026年9月6日
    000
  • Evernote 竞品 Notesnook 正式开源

    出品 | osc开源社区(id:oschina2013) Streetwriters 近日兑现了 8 月初的承诺,正式将其笔记平台 Notesnook 开源。作为一个完全开源的 Evernote 替代品,Notesnook 强调隐私保护,支持端到端加密,旨在杜绝基于服务器的笔记分析与审查。 Note…

    2026年9月6日
    600
  • 雷军千万年薪挖角天才来自DeepSeek

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 国产大模型应用DeepSeek,近日强势登顶苹果中国及美国区应用商店免费下载榜,在美国区甚至超越ChatGPT,引发业界关注。 DeepSeek的成功标志着AI大模型应用正走向普惠化,加速AI应…

    2026年9月5日
    100
  • 蓝桥云课之新手入门指南

    蓝桥云课之新手入门指南蓝桥云课之新手入门指南蓝桥云课之新手入门指南蓝桥云课之新手入门指南

    第一种,就是网页版的linux 蓝桥ROS课程也是这种模式: 蓝桥云课ROS机器人发布5年啦(原实验楼ROS机器人在线云实践课程) 环境是16.04 代码语言:javascript代码运行次数:0运行复制 #includeint main(){ printf(“Hello, Shiyanlou.”)…

    2026年9月5日 用户投稿
    100
  • 实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊

    实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | 萝卜皮 非编码 RNA 在各种生物功能中发挥着调控作用,并且与人类健康、药物设计等领域息息相关。 了解功能的机械机制需要三级结构信息,然而,通过实验确定 RNA 三维结构成本高昂且耗时…

    2026年9月5日 用户投稿
    100

发表回复

登录后才能评论
关注微信