Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话

aniportrait 模型是开源的,可以自由畅玩。

「小破站鬼畜区的新质生产力工具。」
近日,腾讯开源发布的一个新项目在推上获得了如此评价。这个项目是 AniPortrait,其可基于音频和一张参考图像生成高质量动画人像。
话不说多,我们先看看可能会被律师函警告的 demo:Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话
动漫图像也能轻松开口说话:Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话
该项目刚上线几天,就已经收获了广泛好评:GitHub Star 数已经突破 2800。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话

下面我们来看看 AniPortrait 的创新之处。

Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话

论文标题:AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
论文地址:https://arxiv.org/pdf/2403.17694.pdf
代码地址:https://github.com/Zejun-Yang/AniPortrait
AniPortrait
腾讯新提出的 AniPortrait 框架包含两个模块:Audio2Lmk 和 Lmk2Video。
Audio2Lmk 的作用是提取 Landmark 序列,其能从音频输入捕获复杂的面部表情和嘴唇动作。Lmk2Video 是利用这种 Landmark 序列来生成时间上稳定一致的高质量人像视频。
图 1 给出了 AniPortrait 框架的概况。

Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话

腾讯AI 开放平台 腾讯AI 开放平台

腾讯AI开放平台

腾讯AI 开放平台 161 查看详情 腾讯AI 开放平台

Audio2Lmk
对于一段语音片段序列,这里的目标是预测对应的 3D 人脸网格序列和姿势序列。
该团队采用了预训练的 wav2vec 来提取音频特征。该模型具有很好的泛化性能,并且可以准确识别音频中的发音和语调 —— 这对生成具有真实感的人脸动画来说至关重要。通过利用所获得的鲁棒的语音特征,使用一种包含两个 fc 层的简单架构就可以有效地将它们转换成 3D 人脸网格。该团队观察到,这种简单直接的设计不仅能确保准确度,而且还能提升推理过程的效率。
在将音频转换成姿势的任务中,该团队使用的骨干网络依然是同样的 wav2vec。但是,这一个网络的权重不同于音频到网格模块的网络。这是因为:姿势与音频中的节奏和音调的关联更加紧密,而音频到网格任务关注的重点(发音和语调)却不一样。为了将之前状态的影响纳入考量,该团队采用了一个 transformer 解码器来解码姿势序列。在这个过程中,该模块使用交叉注意力机制将音频特征整合进解码器。对于上述两个模块,训练使用的损失函数都是简单的 L1 损失。
在获得了网格和姿势序列之后,再使用透视投影将它们转换为 2D 的人脸 Landmark 序列。这些 Landmark 是下一阶段的输入信号。
Lmk2Video
给定一张参考人像和一个人脸 Landmark 序列,该团队提出的 Lmk2Video 可以创建具有时间一致性的人像动画。这个动画过程是将动作与 Landmark 序列对齐,同时维持与参考图像一致的外观。该团队采取的思路是将人像动画表示成一个人像帧构成的序列。
Lmk2Video 的这种网络结构设计的灵感来自 AnimateAnyone。其中的骨干网络是 SD1.5,其整合了一个时间运动模块,能有效地将多帧噪声输入转换成一个视频帧序列。
另外,他们还使用了一个 ReferenceNet,其同样采用了 SD1.5 的结构,作用是提取参考图像的外观信息并将其整合进骨干网络中。这一策略设计可确保人脸 ID 在整个输出视频中保持一致。
不同于 AnimateAnyone,这里提升了 PoseGuider 的设计的复杂性。原来的版本只是集成了几个卷积层,之后 Landmark 特征与骨干网络的输入层的隐含特征融合。而腾讯的这个团队发现,这种初级设计无法捕获嘴唇的复杂运动。因此,他们采用了 ControlNet 的多尺度策略:将相应尺度的 Landmark 特征整合进骨干网络的不同模块。尽管有这些改进,但最终模型的参数数量依然相当低。
该团队还引入了另一项改进:将参考图像的 Landmark 用作一个额外的输入。PoseGuider 的交叉注意力模块能促进参考 Landmark 和每一帧的目标 Landmark 之间的互动。这一过程能为网络提供额外的线索,使其能够理解人脸 Landmark 和外观之间的关联,由此可帮助人像动画生成更精准的动作。
 
实验
实现细节
Audio2Lmk 阶段使用的骨干网络是 wav2vec2.0。用于提取 3D 网格和 6D 姿势的工具是 MediaPipe。Audio2Mesh 的训练数据来自腾讯的内部数据集,其中包含接近一个小时的来自单个说话人的高质量语音数据。
为了确保 MediaPipe 提取出的 3D 网格的稳定性,在记录期间,表演者头部位置稳定并且面向相机。训练 Audio2Pose 使用的是 HDTF。所有的训练操作都在单台 A100 上执行,使用了 Adam 优化器,学习率设置为 1e-5.
Lmk2Video 过程则采用了一种两步式训练方法。
起始步骤阶段关注的重点是训练骨干网络 ReferenceNet 以及 PoseGuider 的 2D 组件,而不管运动模块。在后续步骤,则会冻结其它所有组件,专注于训练运动模块。为了训练模型,这里使用了两个大规模高质量人脸视频数据集:VFHQ 和 CelebV-HQ。所有数据都经由 MediaPipe 来提取 2D 人脸 Landmark。为了提升网络对嘴唇运动的敏感性,该团队的做法是在根据 2D Landmark 渲染姿势图像时,给上下唇标注不同的颜色。
所有图像的分辨率都重新调整成了 512×512。该模型的训练使用了 4 台 A100 GPU,每一步都耗时 2 天。优化器是 AdamW,学习率固定为 1e-5。
实验结果
如图 2 所示,新方法得到的动画在质量和真实度上都非常出色。

Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话

此外,用户还可以编辑其中间的 3D 表征,从而对最终输出进行修改。举个例子,用户可从某个源提取 Landmark 并修改其 ID 信息,从而实现面部重现效果,如下视频所示:Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话更多细节请参考原论文。 

以上就是Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/617771.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
sql降序索引怎么弄
上一篇 2025年11月11日 04:51:04
Java导出Excel:如何使用GcExcel库添加单元格注释?
下一篇 2025年11月11日 04:51:19

相关推荐

  • 从豆瓣中怎么看纪录片APP_纪录片推荐与跳转方法

    可通过豆瓣App搜索纪录片并进入条目页面查看评分、简介及播放平台,点击“播放”区域的平台图标即可跳转至腾讯视频、爱奇艺或B站等APP观看,未安装时则跳转应用商店下载;同时可使用“想看”功能或创建影单集中管理收藏,便于后续统一查看与跳转播放。 如果您在浏览豆瓣时,希望查找优质的纪录片并了解如何通过相关…

    2026年9月21日
    000
  • iPhone 17 Pro Max如何开启应用分身功能

    iPhone 17 Pro Max不支持原生应用分身,可通过官方企业版应用如“企业微信”或“QQ轻聊版”实现双开,此方法安全稳定且推荐优先使用;部分应用可能提供TestFlight测试版以支持多账号登录,但依赖开发者支持且存在不稳定性;第三方分身工具因企业证书易被吊销及隐私泄露风险,强烈不建议使用。…

    2026年9月21日
    100
  • 腾讯元宝AI便捷体验入口 腾讯元宝网页版在线入口

    腾讯元宝AI便捷体验入口为https://yuanbao.tencent.com,支持网页版、手机APP及微信小程序访问,提供智能问答、文档解析、内容生成等多功能服务。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 腾讯元宝AI便捷体验入口…

    2026年9月20日
    000
  • 用手机打《黑神话:悟空》?实测能玩,但是不推荐

    用手机打《黑神话:悟空》?实测能玩,但是不推荐用手机打《黑神话:悟空》?实测能玩,但是不推荐用手机打《黑神话:悟空》?实测能玩,但是不推荐用手机打《黑神话:悟空》?实测能玩,但是不推荐

    自《黑神话:悟空》上线以来,热度未曾下降,各大平台每天都有好多个热搜。可惜对于手机玩家来说,热闹只属于 pc 玩家、主机玩家和掌机玩家。那怎么行,我们搞手机的不能输。 首先我们排除在手机上运行黑猴的思路,作为一个体积 100 多 GB 的大型 3A 游戏,性能需求是很高的,而且大量的渲染技术都是针对…

    2026年9月20日 用户投稿
    200
  • 腾讯推出景点预约风控反黄牛解决方案 解决 90% 文旅恶意流量

    8 月 22 日,腾讯最近公布了一项针对热门景点公众号预约难、抢票难问题的 ” 风控反黄牛解决方案 “。这项技术主要针对的是景区和博物馆的票务系统,旨在解决由黄牛党造成的恶意流量问题。据了解,这项技术能够帮助博物馆、博物院、公园、景区等解决 90% 的恶意流量问题。在没有接入…

    2026年9月20日
    100
  • 豆包网页版电脑端安装_豆包电脑网页版正版指南

    豆包电脑端可通过网页版直接使用,打开浏览器访问官网登录即可;还可创建桌面快捷方式或下载第三方封装版安装包实现便捷使用。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 如果您尝试在电脑上使用豆包,但无法找到合适的安装方式,可能是因为豆包主要以…

    2026年9月20日
    200
  • 更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活

    更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活

    2025年10月22日,华为正式推出全新操作系统——harmonyos 6(鸿蒙操作系统6)。此次发布不仅是技术体验的全面升级,更标志着鸿蒙生态迈入关键发展阶段。从“可用”到“好用”,鸿蒙正以惊人的速度进化,重新定义万物互联时代的用户体验边界。 作为新一代全场景智能系统,HarmonyOS自2019…

    2026年9月20日 用户投稿
    000
  • VSCode的悬浮提示信息如何自定义?

    通过JSDoc或docstring添加注释可直接影响VSCode悬浮提示内容,如JavaScript/TypeScript中使用/* /格式、Python中使用三引号文档字符串,配合Pylance等扩展增强显示;安装语言支持扩展可提升提示丰富度;高级场景可通过开发自定义语言服务器,在textDocu…

    2026年9月20日
    500
  • Gemini2.5官方网址平台_Gemini2.5网页端官方入口

    Gemini 2.5官方网址为aistudio.google.com,国内用户可访问该平台使用多语言交互、代码生成、上下文记忆及多模态处理等功能,界面简洁且支持API调用与文件解析。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Gemin…

    2026年9月20日
    000
  • Gemini2.5网页版官方链接_Gemini2.5在线下载网址

    Gemini 2.5网页版官方链接是https://aistudio.google.com,用户可通过此入口在Google AI Studio平台进行交互,或使用镜像站、API及第三方客户端等方式访问。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模…

    2026年9月20日
    000
  • LongCat-Audio-Codec— 美团开源的语音编解码方案

    LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案LongCat-Audio-Codec— 美团开源的语音编解码方案

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 依图语音开放平台 依图语音开放平台 6 查看详情 LongCat-Audio-Codec是什么 longcat-audio-codec 是美团 longcat 团队开源的语音编解码方案,专为语音…

    2026年9月20日 用户投稿
    500
  • qq浏览器和搜狗浏览器哪个更安全_qq浏览器与搜狗安全性能对比

    QQ浏览器在安全性能上优于搜狗浏览器。其一,QQ浏览器支持手动导入受信任的根证书,搜狗浏览器则不支持;其二,QQ浏览器可检测第三方安全软件对默认设置的锁定并提供解决方案,搜狗浏览器无此提示;其三,QQ浏览器具备多级网址安全预警系统,对支付、购物网站提供认证标识,搜狗浏览器仅能拦截已知恶意网站;其四,…

    2026年9月13日
    100
  • 端侧AI领袖之声:挚听——重塑助听体验,构建智能助听新生态

    端侧AI领袖之声:挚听——重塑助听体验,构建智能助听新生态端侧AI领袖之声:挚听——重塑助听体验,构建智能助听新生态端侧AI领袖之声:挚听——重塑助听体验,构建智能助听新生态端侧AI领袖之声:挚听——重塑助听体验,构建智能助听新生态

    随着人工智能技术的深度演进,端侧ai作为一种将智能计算能力下沉至终端设备的技术形态,正凭借其低延迟、高隐私性、轻量化部署等特性,在消费电子、医疗健康等诸多领域展现出强劲的应用潜力。 在这一技术浪潮的推动下,传统助听设备也正经历着从单纯的声音放大工具向具备智能感知、精准识别与个性化处理能力的智能终端的…

    2026年9月13日 用户投稿
    200
  • IEEE P3366.1 点云压缩标准正式发布

    来源:https://www.php.cn/link/a65b920e6ce1070509a476e3b48aa56fhttps://www.php.cn/link/c732e4cb57268226f297e389d8382baf ieee p3366.1点云压缩标准已正式发布,成为ieee 336…

    用户投稿 2026年9月12日
    000
  • Unity 中国版“团结引擎” 1.7.3 版本正式发布

    Unity 中国正式推出团结引擎 1.7.3 版本,重磅发布 Unity 生态中首个完整的全局动态实时光照解决方案——TuanjieGI,实现无需预烘焙即可呈现端游级光影表现的技术飞跃。 本次更新围绕核心渲染、跨端部署与 AI 集成三大战略方向全面进化,并携手腾讯游戏,结合腾讯混元大模型能力,联合推…

    2026年9月12日
    100
  • AudioStory— 腾讯ARC推出的音频生成模型

    AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型AudioStory— 腾讯ARC推出的音频生成模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 腾讯混元文生视频 腾讯发布的AI视频生成大模型技术 137 查看详情 AudioStory是什么 audiostory 是由腾讯 arc 实验室推出的一项创新音频生成技术,能够根据自然语言描述自…

    2026年9月12日 用户投稿
    400
  • OPPO A1 Pro怎么投屏电视 OPPO A1 Pro无线投屏方法

    最方便的方法是使用OPPO A1 Pro自带的无线投屏功能,确保手机和电视连接同一Wi-Fi,从控制中心点击“手机投屏”选择电视设备即可完成连接,无需额外APP;观看视频时也可通过腾讯视频、爱奇艺等应用内的投屏按钮直接推送内容至电视;苹果手机用户需下载“乐播投屏”APP并通过AirPlay连接OPP…

    2026年9月12日
    000
  • 腾讯元宝网页登录入口 腾讯元宝官网快速链接

    腾讯元宝官网为https://www.php.cn/link/fbe486dc4c014eb61a0c91e34cc6f301,支持DeepSeek-R1满血版、DeepSeek-V3、腾讯混元T1及Turbo模型,具备文件解析与联网检索功能,建议使用Chrome等主流浏览器在PC端访问以获得最佳体…

    2026年9月12日
    100
  • 腾讯元宝AI智能体验入口 腾讯元宝网页版便捷入口

    腾讯元宝AI智能体验入口为https://yuanbao.tencent.com,用户可通过该网页使用其文档处理、智能创作辅助及多模态交互功能,支持文件上传解析、AI生成PPT与图像、代码运行、拍题答疑等高效便捷服务。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepS…

    2026年9月11日
    100
  • 腾讯元宝在线访问地址 腾讯元宝网页版链接

    腾讯元宝官方网址为https://www.php.cn/link/fbe486dc4c014eb61a0c91e34cc6f301,打开后可直接使用网页版AI功能,支持文字对话、文档解析、深度思考、图表生成,手机端App同步数据并支持语音拍照输入。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索…

    2026年9月11日
    300

发表回复

登录后才能评论
关注微信