只需3秒就能偷走你的声音！微软发布语音合成模型VALL-E：网友惊呼「电话诈骗」门槛又拉低了

程序猿 • 2025年11月9日 20:59:48 • 用户投稿 • 阅读 1

让ChatGPT帮你写剧本，Stable Diffusion生成插图，做视频就差个配音演员了？它来了！

最近来自微软的研究人员发布了一个全新的文本到语音（text-to-speech, TTS）模型VALL-E，只需要提供三秒的音频样本即可模拟输入人声，并根据输入文本合成出对应的音频，而且还可以保持说话者的情感基调。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文链接：https://www.php.cn/link/402cac3dacf2ef35050ca72743ae6ca7

项目链接：https://valle-demo.github.io/

代码链接：https://github.com/microsoft/unilm

先看看效果：假设你有了一段3秒钟的录音。

diversity_speaker音频：00:0000:03

然后只需要输入文本「Because we do not need it.」，即可获得合成的语音。

diversity_s1音频：00:0000:01

甚至使用不同的随机种子，还能进行个性化的语音合成。

diversity_s2音频：00:0000:02

VALL-E还能保持说话人的环境声，比如输入这段语音。

env_speaker音频：00:0000:03

再根据文本「I think it’s like you know um more convenient too.」，就能输出合成语音的同时保持环境声。

env_vall_e音频：00:0000:02

而且VALL-E也能保持说话人的情绪，比如输入一段愤怒的语音。

anger_pt音频：00:0000:03

再根据文本「We have to reduce the number of plastic bags.」，同样可以表达愤怒的情绪。

anger_ours音频：00:0000:02

在项目网站上还有更多的例子。

从方法上具体来说，研究人员从现成的神经音频编解码器模型中提取的离散编码来训练语言模型VALL-E，并将TTS视为一个条件语言建模任务而非连续信号回归。

在预训练阶段，VALL-E接受的TTS训练数据达到了6万小时的英语语音，比现有系统用到的数据大了几百倍。

并且VALL-E还展现出了语境学习（in-context learning）能力，只需将unseen speaker的3秒注册录音作为声音提示，即可合成高质量的个性化语音。

实验结果表明，VALL-E在语音自然度和说话人相似度方面明显优于最先进的zero-shot TTS系统，还可以在合成中保留说话人的情感和声音提示的声学环境。

Zero-shot语音合成

过去十年，通过神经网络和端到端建模的发展，语音合成取得了巨大突破。

但目前级联的文本到语音（TTS）系统通常利用具有声学模型的pipeline和使用mel谱图作为中间表示的声码器（vocoder）。

虽然一些高性能的TTS系统可以从单个或多个扬声器中合成高质量的语音，但它仍然需要来自录音室的高质量清洁数据，从互联网上抓取的大规模数据无法满足数据要求，而且会导致模型的性能下降。

由于训练数据相对较少，目前的TTS系统仍然存在泛化能力差的问题。

在zero-shot的任务设置下，对于训练数据中没有出现过的的说话人，相似度和语音自然度都会急剧下降。

为了解决zero-shot的TTS问题，现有的工作通常利用说话人适应（speaker adaption）和说话人编码（speaker encoding）等方法，需要额外的微调，复杂的预先设计的特征，或沉重的结构工程。

与其为这个问题设计一个复杂而特殊的网络，鉴于在文本合成领域的成功，研究人员认为最终的解决方案应当是尽可能地用大量不同的数据来训练模型。

VALL-E模型

在文本合成领域，来自互联网的大规模无标记数据直接喂入模型，随着训练数据量的增加，模型性能也在不断提高。

研究人员将这一思路迁移到语音合成领域，VALL-E模型是第一个基于语言模型的TTS框架，利用海量的、多样化的、多speaker的语音数据。

为了合成个性化的语音，VALL-E模型根据3秒enrolled录音的声学token和音素prompt来生成相应的声学token，这些信息可以限制说话人和内容信息。

最后，生成的声学token被用来与相应的神经编解码器合成最终波形。

来自音频编解码器模型的离散声学token使得TTS可以被视为有条件的编解码器语言建模，所以一些先进的基于提示的大模型技术（如GPTs）就可以被用在TTS任务上了。

声学token还可以在推理过程中使用不同的采样策略，在TTS中产生多样化的合成结果。

VALL-E

VALL-E是一种用于文本到语音生成 (TTS) 的语言建模方法

68 查看详情

研究人员利用LibriLight数据集训练VALL-E，该语料库由6万小时的英语语音组成，有7000多个独特的说话人。原始数据是纯音频的，所以只需要使用一个语音识别模型来生成转录即可。

与以前的TTS训练数据集，如LibriTTS相比，论文中提供的新数据集包含更多的噪声语音和不准确的转录，但提供了不同的说话人和语体（prosodies）。

研究人员认为，文章中提出的方法对噪声具有鲁棒性，并可以利用大数据来实现良好的通用性。

值得注意的是，现有的TTS系统总是用几十个小时的单语者数据或几百个小时的多语者数据进行训练，比VALL-E小几百倍以上。

总之，VALL-E是一种全新的、用于TTS的语言模型方法，使用音频编解码代码作为中间表征，利用大量不同的数据，赋予模型强大的语境学习能力。

推理：In-Context Learning via Prompting

语境学习（in-context learning）是基于文本的语言模型的一个令人惊讶的能力，它能够预测未见过的输入的标签而不需要额外的参数更新。

对于TTS来说，如果模型能够在不进行微调的情况下为未见过的说话者合成高质量的语音，那么该模型就被认为具有语境中学习能力。

然而，现有的TTS系统的语境中学习能力并不强，因为它们要么需要额外的微调，要么对未见过的说话者来说会有很大的退化。

对于语言模型来说，prompting是必要的，以便在zero-shot的情况下实现语境学习。

研究人员设计的提示和推理如下：

首先将文本转换为音素序列，并将enrolled录音编码为声学矩阵，形成音素提示和声学提示，这两种提示都用于AR和NAR模型中。

对于AR模型，使用以提示为条件的基于采样的解码，因为beam search可能导致LM进入无限循环；此外，基于抽样的方法可以大大增加输出的多样性。

对于NAR模型，使用贪婪解码来选择具有最高概率的token。

最后，使用神经编解码器来生成以八个编码序列为条件的波形。

声学提示可能与要合成的语音之间不一定存在语义关系，所以可以分为两种情况：

VALL-E：主要目标是为未见过的说话者生成给定的内容。

该模型的输入为一个文本句子、一段enrolled语音及其相应的转录。将enrolled语音的转录音素作为音素提示添加到给定句子的音素序列中，并使用注册语音的第一层声学token作为声学前缀。有了音素提示和声学前缀，VALL-E为给定的文本生成声学token，克隆这个说话人的声音。

VALL-E-continual：使用整个转录和话语的前3秒分别作为音素和声学提示，并要求模型生成连续的内容。

推理过程与设置VALL-E相同，只是enrolled语音和生成的语音在语义上是连续的。

实验部分

研究人员在LibriSpeech和VCTK数据集上评估了VALL-E，其中所有测试的说话人在训练语料库中都没有出现过。

VALL-E在语音自然度和说话人相似度方面明显优于最先进的zero-shot TTS系统，在LibriSpeech上有+0.12的比较平均选项得分（CMOS）和+0.93的相似度平均选项得分（SMOS）。

VALL-E在VCTK上也以+0.11 SMOS和+0.23 CMOS的性能改进超越了基线系统，甚至达到了针对ground truth的+0.04CMOS得分，表明在VCTK上，未见过的说话者的合成语音与人类录音一样自然。

此外，定性分析表明，VALL-E能够用2个相同的文本和目标说话人合成不同的输出，这可能有利于语音识别任务的伪数据创建。

实验中还可以发现，VALL-E能够保持声音环境（如混响）和声音提示的情绪（如愤怒等）。

安全隐患

强大的技术如果被乱用，就可能对社会造成危害，比如电话诈骗的门槛又被拉低了！

由于VALL-E具有潜在的恶作剧和欺骗的能力，微软并没有开放VALL-E的代码或接口以供测试。

有网友分享道：如果你给系统管理员打电话，录下他们说「你好」的几句话，然后根据这几句话重新合成语音「你好，我是系统管理员。我的声音是唯一标识，可以进行安全验证。」我之前一直认为这是不可能的，你不可能用那么少的数据来完成这个任务。现在看来，我可能错了……

在项目最后的道德声明（Ethics Statement）中，研究人员表示「本文的实验是在模型使用者为目标说话人并得到说话人认可的假设下进行的。然而，当该模型推广到看不见的说话人时，相关部分应该伴有语音编辑模型，包括保证说话人同意执行修改的协议和检测被编辑语音的系统。」

作者同时在论文中进行声明，由于 VALL-E 可以合成能够保持说话者身份的语音，它可能会带来误用该模型的潜在风险，例如欺骗声音识别或者模仿特定的说话者。

为了降低这种风险，可以建立一个检测模型来区分音频剪辑是否由 VALL-E 合成。在进一步开发这些模型时，我们还将把微软人工智能原则付诸实践。

参考资料：

https://www.php.cn/link/402cac3dacf2ef35050ca72743ae6ca7

以上就是只需3秒就能偷走你的声音！微软发布语音合成模型VALL-E：网友惊呼「电话诈骗」门槛又拉低了的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/552982.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

如何使用微信电脑截图快捷键：全面指南

上一篇 2025年11月9日 20:59:34

Linux日志中磁盘I/O问题怎样解决

下一篇 2025年11月9日 20:59:48

好文分享

如何添加html运行框_在网页中添加HTML代码运行框【添加】

可实时运行HTML代码的交互式编辑框可通过三种方案实现：一、CodeMirror+iframe动态执行，用document.write渲染；二、JSFiddle风格iframe沙箱，用srcdoc属性加载；三、Monaco Editor+Blob URL，提供专业编辑体验。如果您希望在网页中嵌入一…

程序猿
2025年12月23日
0000
好文分享

优化@font-face配置：确保自定义字体在移动设备上的兼容性与显示

本文深入探讨了自定义字体通过@font-face规则在移动设备上无法正确显示的问题，并提供了详细的解决方案。核心在于优化字体格式的声明顺序，强调优先使用ttf、woff2和woff等广泛支持的字体格式，以提升跨平台兼容性，确保自定义字体在包括各类移动设备在内的所有环境中均能稳定渲染。理解@font…

程序猿
2025年12月23日
0000
好文分享

解决移动设备上 @font-face 字体不显示的兼容性指南

移动设备上 @font-face 字体显示异常，常见原因是字体格式优先级配置不当。本文将深入探讨不同字体格式的兼容性，并提供一套优化后的 @font-face 声明最佳实践，确保自定义字体在各类设备和浏览器上都能稳定加载与显示。在现代网页设计中，自定义字体通过 @font-face 规则提供了丰富…

程序猿
2025年12月23日
0000
好文分享

vs中的html怎么运行环境_vs配置html运行环境步骤【指南】

在 Visual Studio 中运行 HTML 需通过 Web 项目模板并借助 IIS Express 服务。1. 安装 VS 时勾选“ASP.NET 和 Web 开发”工作负载；2. 创建 ASP.NET 项目，添加 HTML 页面；3. 编写代码后设为起始页，点击 IIS Express 运行…

程序猿
2025年12月23日
0000
好文分享

ai做html怎么运行_AI生成html运行步骤【教程】

答案是使用AI生成HTML代码后，将其保存为.html文件并用浏览器打开即可运行。具体步骤为：1. 在AI工具中输入需求生成HTML代码；2. 将代码复制到文本编辑器并另存为index.html，编码选UTF-8，类型选“所有文件”；3. 双击该文件用浏览器打开，若无法正常显示需检查文件后缀、编码及…

程序猿
2025年12月23日
0000
好文分享

HTML文本在span中怎么设置样式_HTML文本在span中如何局部调整字体与颜色

使用span标签结合style属性可对文本局部设置颜色、字体等样式；2. 推荐通过CSS类统一管理多处相同样式，提升可维护性；3. 中文建议设置Microsoft YaHei等常用字体并提供备选，颜色推荐十六进制值；4. 避免过多内联样式，保持结构与表现分离。在HTML中，标签常用于对文本的局部进…

程序猿
2025年12月23日
0000
好文分享

HTML文本与CSS怎么结合使用_HTML文本与CSS怎么结合实现丰富排版效果

HTML提供结构，CSS负责样式，二者结合可实现美观布局。1. 内联样式通过style属性直接设置，适用于单元素调整但难复用；2. 内部样式表置于head中，用style标签定义，适合单页统一排版；3. 外部样式表将CSS独立为文件，通过link引入，利于多页共享与维护，推荐使用；4. 关键CSS属…

程序猿
2025年12月23日
0000
好文分享

网站根目录下的神秘HTML文件：识别与管理域名所有权验证文件

网站根目录下发现的随机命名html文件，通常是用于验证域名或网站所有权的工具。本文将深入探讨这类文件的常见来源、作用及其在google search console等服务中的应用，并提供识别与管理建议，帮助网站管理员理解并妥善处理这些看似“多余”的文件。 1. 这类文件的神秘面纱在维护或更新一个既…

程序猿
2025年12月23日
0000
好文分享

Windows OneDrive同步HTML+CSS项目到多台电脑

使用OneDrive同步HTML+CSS项目可行，需将项目放入OneDrive文件夹并登录同一账号实现多端同步。应采用英文命名、避免特殊字符，使用相对路径引用资源，如href=”css/style.css”。推荐结构：my-website/下分设css、js、images目录…

程序猿
2025年12月23日
0000
好文分享

html代码怎么设置字体_html字体标签与CSS字体样式设置方法

可通过HTML标签或CSS样式自定义网页文字效果：一、使用标签设置字体名称、大小、颜色；二、利用内联style属性设置font-family、font-size、color等；三、在中用定义内部样式表；四、通过link引入外部CSS文件实现样式分离；五、使用@font-face引入Web字体，确保跨…

程序猿
2025年12月23日
0000
好文分享

Windows11 Widgets显示当前HTML使用的CSS文件数

Windows 11 Widgets 不提供网页技术统计功能，无法显示当前HTML使用的CSS文件数，其面板由系统应用渲染，仅支持通过任务栏或快捷键打开、添加组件、调整布局及个性化设置。 Windows 11 Widgets 功能本身是一个操作系统层面的界面组件，它不直接提供“显示当前HTML使用的…

程序猿
2025年12月23日
0000
好文分享

html如何改变字_HTML文字（字体/大小/颜色）修改方法

推荐使用CSS设置文字样式，通过style属性或样式表定义font-family、font-size和color；2. 可在标签内用style直接设置，或在style标签及外部文件中统一管理；3. 避免使用已废弃的font标签。在HTML中修改文字的字体、大小和颜色，主要通过内联样式（style属…

程序猿
2025年12月23日
1000
好文分享

OneDrive跨设备同步，HTML+CSS走到哪写到哪！

OneDrive通过云同步实现HTML和CSS代码跨设备实时协作。将项目存于OneDrive文件夹并登录账户，可自动同步至所有设备；在Surface Pro 9运行Windows 11环境下，使用Visual Studio Code打开OneDrive中的项目目录，保存即触发后台同步；移动端安装On…

程序猿
2025年12月23日
1000
好文分享

HTA中VBScript实现动态图像定位教程

本教程详细讲解如何在HTML应用程序（HTA）中利用VBScript动态控制HTML图像元素的位置。文章将阐述VBScript与DOM（文档对象模型）的交互机制，通过实际代码示例展示如何监听用户输入并实时更新图像的`top`和`left`样式属性，从而实现无需按钮即可响应式调整图像位置的功能。 HT…

程序猿
2025年12月23日
0000
html如何改字体_HTML字体样式（font-family/size）修改方法

通过CSS的font-family和font-size属性可设置网页字体类型与大小，示例包括使用Arial、微软雅黑等字体及px、em等单位，建议结合多个字体备选并用引号包裹中文字体名，推荐在style标签中全局统一设置以保持页面风格一致。在HTML中修改字体样式，主要通过CSS的font-fam…

程序猿
2025年12月23日 • 好文分享
1000
好文分享

html如何加入ppt_HTML内容嵌入PowerPoint演示文稿方法

可通过图片、插件、PDF或OneNote四种方式在PPT中嵌入HTML内容。1. 转为图片插入兼容性好但不可编辑；2. 用Web Viewer插件嵌入实时网页需联网且依赖插件；3. 导出为PDF再插入可保留排版与链接；4. 借助OneNote中转格式还原度高，支持富文本。根据需求选择合适方案即可实现…

程序猿
2025年12月23日
1000
好文分享

网站根目录中神秘HTML文件的真相：域名所有权验证指南

在网站根目录发现一个随机命名且内容单一的`.html`文件，这通常是用于证明域名所有权的验证文件。这类文件由google search console、bing webmaster tools等服务在网站设置时要求创建，以确认您对域名的控制权，是网站管理中的常见实践。理解网站根目录下的未知HTML…

程序猿
2025年12月23日
0000
好文分享

html 如何设置中文_HTML中文编码（UTF-8）与字体设置方法

首先设置HTML字符%ignore_a_1%为UTF-8，在head中添加meta标签；接着通过CSS的font-family指定微软雅黑、宋体等中文字体；若本地无字体则用@font-face引入网络字体；最后配置服务器发送Content-Type头包含charset=UTF-8以确保正确解析。如…

程序猿
2025年12月23日
0000
好文分享

html如何调用vbscript_HTML调用VBScript（脚本嵌入）方法

VBScript通过标签嵌入HTML，仅在IE中支持，现代浏览器已淘汰该技术。在HTML中调用VBScript，是通过将VBScript代码嵌入到HTML页面的标签中实现的。VBScript 是微软开发的一种脚本语言，主要在 Internet Explorer 浏览器中支持，因此该方法仅适用于I…

程序猿
2025年12月23日
0000
好文分享

html如何控制字体_HTML字体（font-family/size）样式控制方法

使用font-family设置字体类型，优先指定常用字体并提供备选；2. 用font-size控制文字大小，推荐px或rem单位；3. 可通过内联style或外部CSS统一管理样式；4. 建议使用系统常见字体、设置回退机制、引入Web字体并保证字号可读性，确保跨设备显示效果。在HTML中控制字体样…

程序猿
2025年12月23日
0000