
StepFun AI 最近推出了其开源音频编辑模型 Step-Audio-EditX,这款拥有30亿参数的创新模型让音频编辑如同文本编辑般直观且高度可控。它通过将音频信号的修改任务转化为逐字令牌操作,显著简化了富有表现力的语音内容调整过程。
当前主流的零样本文本到语音(TTS)系统在情感表达、语调风格、口音特征以及音色控制方面仍存在局限性。虽然能够生成自然流畅的语音,却难以精准满足用户的个性化需求。以往的研究多依赖额外编码模块或复杂网络结构来分离这些因素,而 Step-Audio-EditX 则另辟蹊径,通过优化训练数据和目标函数实现精细控制。
该模型采用双代码本标记机制,将语音信号分解为两个并行的令牌流:一个以16.7Hz 的频率捕捉语言内容信息,另一个以25Hz 的频率记录语义与韵律特征。模型在融合了文本和音频令牌的混合语料库上进行训练,使其具备同时处理文字与声音标记的能力。
其核心技术之一是引入大边距学习策略,在后续训练阶段使用合成的大边距三元组和四元组样本增强模型判别与生成能力。依托来自约6万名说话者的高质量语音数据,Step-Audio-EditX 在情感迁移和风格变换任务中展现出卓越性能。同时,模型还结合人类评分反馈与偏好数据,利用强化学习进一步提升输出语音的自然度与准确性。
模力视频
模力视频 – AIGC视频制作平台 | AI剪辑 | 云剪辑 | 海量模板
51 查看详情

为全面评估模型效果,研究团队构建了名为 Step-Audio-Edit-Test 的评测基准,并采用 Gemini2.5Pro 作为自动评判引擎。实验结果表明,经过多轮迭代编辑后,模型在情感表达和说话风格还原上的准确率显著提高。更值得注意的是,Step-Audio-EditX 还可作为增强工具,有效改善其他闭源 TTS 系统输出的音频质量,为未来音频编辑技术的发展开辟了全新路径。
以上就是StepFun AI 开源音频编辑模型 Step-Audio-EditX的详细内容,更多请关注创想鸟其它相关文章!
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/599155.html
微信扫一扫
支付宝扫一扫