全球瞩目的「科目三」：梅西、钢铁侠、二次元小姐姐轻松应对

程序猿 • 2025年11月8日 00:24:00 • 用户投稿 • 阅读 1

最近一段时间，你可能或多或少的听到过「科目三」，摇花手、半崴不崴的脚，配合着节奏鲜明的音乐，这一舞蹈动作遭全网模仿。

如果相似的舞蹈，让 AI 生成会怎样？就像下图所展示的，不管是现代人、还是纸片人，都做着整齐划一的动作。你可能猜不到的是，这是根据一张图片生成的舞蹈视频。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

人物动作难度加大，生成的视频也非常丝滑（最右边）：

让梅西、钢铁侠动起来，也不在话下：

还有各种动漫小姐姐。

这些效果是如何实现的呢？我们继续往下看

角色动画是将原始角色图像按照所需的姿态序列转化为逼真的视频的过程。这项任务有许多潜在的应用领域，比如在线零售、娱乐视频、艺术创作和虚拟角色等等

自 GAN 技术问世以来，研究人员一直在不断深入探索将图像转换为动画以及完成姿态迁移的方法。然而，生成的图像或视频仍然存在一些问题，比如局部失真、细节模糊、语义不一致以及时间不稳定等，这些问题阻碍了这些方法的应用

阿里的研究者提出了一种名为Animate Anybody的方法，可以将角色图像转换为动画视频，并遵循所需的姿态序列。该研究采用了Stable Diffusion网络设计和预训练权重，并对去噪UNet进行了修改以适应多帧输入

论文地址：https://arxiv.org/pdf/2311.17117.pdf项目地址：https://humanaigc.github.io/animate-anyone/

为了让外观保持一致性，该研究引入了ReferenceNet。该网络采用对称的UNet结构，旨在捕捉参考图像的空间细节。在每个相应的UNet块层中，该研究使用空间-注意力机制将ReferenceNet的特征集成到去噪UNet中。这种架构使得模型能够在一致的特征空间中全面地学习与参考图像的关系

为了确保姿态可控性，该研究设计了一种轻量级姿态引导器，以有效地将姿态控制信号集成到去噪过程中。为了实现时间稳定性，本文引入了时间层（ temporal layer）来对多个帧之间的关系进行建模，从而在模拟连续且平滑的时间运动过程的同时保留视觉质量的高分辨率细节。

Animate Anybody 经过在 5K 角色视频剪辑的内部数据集上的训练而得到，如图 1 所示，展示了各种角色的动画结果。与以往的方法相比，本文的方法具有几个明显的优势：

首先，它有效地保持了视频中人物外观的空间和时间一致性。其次，它生成的高清视频不会出现时间抖动或闪烁等问题。第三，它能够将任何角色图像动画化为视频，不受特定领域的限制。

本文在两个特定的人类视频合成基准（UBC 时尚视频数据集和 TikTok 数据集）上进行了评估。结果显示，Animate Anybody 取得了 SOTA 结果。此外，该研究还将 Animate Anybody 方法与在大规模数据上训练的一般图像到视频方法进行了比较，结果显示 Animate Anybody 在角色动画方面展示了卓越的能力。

Animate Anybody 与其他方法的比较：

方法介绍

本文的处理方式如图 2 所示，网络的原始输入由多帧噪声构成。为了实现去噪效果，研究者采用了基于 SD 设计的配置方式，并使用了相同的框架和块单元，并继承了来自 SD 的训练权重。具体来说，这个方法包括三个关键部分，分别是：

ReferenceNet，编码参考图像角色的外观特征；Pose Guider（姿态引导器），编码动作控制信号以实现可控角色运动；Temporal layer（时间层），编码时间关系以确保角色动作的连续性。

ReferenceNet

ReferenceNet 是一个参考图像特征提取网络，它的框架与去噪 UNet 大致相同，仅有时间层不同。因此，ReferenceNet 继承了与去噪 UNet 类似的原始 SD 权重，并且每个权重更新都是独立进行的。研究者解释了将 ReferenceNet 的特征集成到去噪 UNet 的方法。

ReferenceNet 的设计有两个优势。第一，ReferenceNet 可以利用原始 SD 的预训练图像特征建模能力，产生初始化良好的特征。第二，由于 ReferenceNet 与去噪 UNet 本质上具有相同的网络结构和共享初始化权重，因而去噪 UNet 可以选择性地从 ReferenceNet 中学习在同一特征空间关联的特征。

姿态引导器

重写后的内容为：该轻量级姿态引导器采用了四个卷积层（4×4内核，2×2步幅），通道数量分别为16、32、64、128，类似于[56]中的条件编码器，用于对齐分辨率与潜在噪声相同的姿态图像。处理后的姿态图像被添加到潜在噪声中，然后输入到去噪UNet进行处理。姿态引导器使用高斯权重进行初始化，并在最终的映射层中使用了零卷积

时间层

时间层的设计灵感来自 AnimateDiff。对于一个特征图 x∈R^b×t×h×w×c，研究者首先将它变形为 x∈R^(b×h×w)×t×c，然后执行时间注意力，即沿着维度 t 的自注意力。时间层的特征通过残差连接合并到了原始特征中，这种设计与下文的双阶段训练方法相一致。时间层专门在去噪 UNet 的 Res-Trans 块内使用。

训练策略

训练过程分为两个阶段。

重写后的内容：在第一阶段的训练中，使用单个视频帧进行训练。在去噪 UNet 模型中，研究者暂时排除了时间层，将单帧噪声作为输入。同时，还对参考网络和姿态引导器进行了训练。参考图像是从整个视频片段中随机选择的。他们使用了预训练权重来初始化去噪 UNet 和 ReferenceNet 模型。姿态引导器的初始化使用了高斯权重，但最后的投影层除外，该层使用了零卷积。VAE 的编码器和解码器以及 CLIP 图像编码器的权重保持不变。这一阶段的优化目标是在给定参考图像和目标姿态的条件下生成高质量的动画图像

在第二阶段，研究者将时间层引入先前训练好的模型，并使用 AnimateDiff 中预先训练好的权重对其进行初始化。模型的输入包括一个 24 帧的视频片段。在这一阶段，只训练时间层，同时固定网络其他部分的权重。

实验与结果

定性结果：如图 3 显示，本文方法可以制作任意角色的动画，包括全身人像、半身人像、卡通人物和仿人角色。该方法能够生成高清晰度和逼真的人物细节。即使在大幅度运动的情况下，它也能与参考图像保持时间上的一致性，并在帧与帧之间表现出时间上的连续性。

时尚视频合成。时尚视频合成的目的是利用驱动姿态序列将时尚照片转化为逼真的动画视频。实验在 UBC 时尚视频数据集上进行，该数据集由 500 个训练视频和 100 个测试视频组成，每个视频包含约 350 个帧。定量比较见表 1。在结果中可以发现，本文方法优于其他方法，尤其是在视频度量指标方面表现出明显的领先优势。

定性比较如图 4 所示。为了进行公平比较，研究者使用 DreamPose 的开源代码获得了未进行样本微调的结果。在时尚视频领域，对服装细节的要求非常严格。然而，DreamPose 和 BDMM 生成的视频无法保持服装细节的一致性，并在颜色和精细结构元素方面表现出明显的误差。相比之下，本文方法生成的结果能更有效保持服装细节的一致性。

人类舞蹈生成是一项研究，其目标是通过对现实舞蹈场景图像进行动画处理来生成人类舞蹈。研究者们使用了TikTok数据集，其中包括340个训练视频和100个测试视频。他们按照DisCo的数据集划分方法，使用相同的测试集进行了定量比较，其中包含10个TikTok风格的视频。通过表2可以看出，本文的方法取得了最佳结果。为了增强模型的泛化能力，DisCo结合了人类属性预训练，并利用大量图像对进行了模型预训练。相比之下，其他研究者只在TikTok数据集上进行训练，但结果仍然优于DisCo

图 5 中展示了与 DisCo 的定性比较。考虑到场景的复杂性，DisCo 的方法需要额外使用 SAM 来生成人类前景掩码。相反，本文方法表明，即使没有明确的人体掩码学习，模型也能从被摄体的运动中掌握前景与背景的关系，而无需事先进行人体分割。此外，在复杂的舞蹈序列中，该模型在保持整个动作的视觉连续性方面表现突出，并在处理不同的角色外观方面表现出更强的稳健性。

图像 – 视频的通用方法。目前，许多研究都提出了基于大规模训练数据、具有强大生成能力的视频扩散模型。研究者选择了两种最著名、最有效的图像 – 视频方法进行比较：AnimateDiff 和 Gen2。由于这两种方法不进行姿态控制，因此研究者只比较了它们保持参考图像外观保真度的能力。如图 6 所示，当前的图像 – 视频方法在生成大量角色动作方面面临挑战，并且难以在视频中保持长期的外观一致性，从而阻碍了对一致角色动画的有效支持。

请查阅原始论文以获取更多信息

以上就是全球瞩目的「科目三」：梅西、钢铁侠、二次元小姐姐轻松应对的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/453511.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

windows 桌面GUI自动化- 15.pywinauto电脑端微信自动发聊天消息实现

上一篇 2025年11月8日 00:23:58

c盘和d盘有什么区别详解c盘d盘功能区别的3个要点

下一篇 2025年11月8日 00:24:07

Go程序使用gRPC流式调用卡死怎么调试

grpc流式调用卡死问题通常源于客户端或服务端的阻塞，解决方法包括：1. 确认正确处理流关闭和错误；2. 检查网络稳定性；3. 使用pprof进行性能分析；4. 添加详细日志记录；5. 设置send和recv操作的超时机制；6. 采用并发控制避免goroutine泄漏；7. 实现流量控制防止过载；8…

程序猿
2026年5月10日 • 用户投稿
0000
用户投稿

在PHP中如何通过注释提高调试效率

合理使用注释可提升PHP调试效率。1. 用// TODO、// FIXME等标记快速定位问题代码；2. 临时注释代码块进行逻辑对比测试；3. 添加上下文说明避免非常规操作被误删；4. 注释记录变量预期状态辅助排查异常。关键在于在核心位置提供有效信息，让注释成为调试的“便签条”。在PHP开发过程中，…

程序猿
2026年5月10日
0000
用户投稿

Go语言扩展标准库类型：以bufio.Reader为例

本文将介绍如何在不修改标准库源码的情况下，扩展Go语言标准库类型的功能，以bufio.Reader为例，演示如何通过类型嵌入和方法重写或新增方法，实现自定义的读取字节功能，从而满足特定的需求。在Go语言中，我们经常需要使用标准库提供的类型和方法。但有时，标准库提供的功能可能无法完全满足我们的特定需…

程序猿
2026年5月10日
0000
用户投稿

Go Web开发：静态文件服务404问题解析与StripPrefix解决方案

本文详细解析了Go语言net/http包在处理静态文件服务时常见的404错误原因，特别是当http.FileServer与http.Handle结合使用时路径匹配的陷阱。通过引入http.StripPrefix函数，文章提供了简洁有效的解决方案，确保静态资源能够被正确访问，避免了路径重复导致的文件查…

程序猿
2026年5月10日
0000
用户投稿

什么是 Kubernetes 的 Pod 开销概念？

Pod开销指Kubernetes中除容器外Pod运行所需额外资源，由RuntimeClass定义并加入总资源请求，调度时一并计算，需v1.18+且启用PodOverhead特性门控。 Kubernetes 中的 Pod 开销（Pod Overhead）是指在运行 Pod 时，除了容器本身请求的资源外…

程序猿
2026年5月10日
0000
用户投稿

如何在Golang中实现购物车功能

答案：通过定义用户、商品和购物项结构体，使用map管理购物车条目，实现添加、删除、计算总价功能，并结合HTTP接口与读写锁支持并发操作，适合扩展优惠券与库存校验。在Golang中实现购物车功能，关键在于管理用户、商品和购物项之间的关系。通常使用结构体来表示数据模型，结合内存存储或数据库完成增删改查…

程序猿
2026年5月10日
1000
用户投稿

c++如何实现观察者设计模式_c++设计模式之观察者模式实现方法

观察者模式通过抽象基类定义更新接口，被观察者维护观察者列表并通知其状态变化。使用指针管理依赖关系时需注意生命周期，避免悬空指针，推荐结合智能指针提升安全性。观察者模式是一种行为设计模式，用于在对象之间定义一对多的依赖关系，当一个对象的状态发生改变时，所有依赖它的对象都会自动收到通知。在C++中，可…

程序猿
2026年5月10日
0000
用户投稿

如何使用Go语言将字符串分割后作为函数参数传递

本文详细介绍了在Go语言中如何将一个由空格分隔的字符串（如命令行指令）解析成多个独立的参数，并传递给接受可变参数的函数，例如`exec.Command`。核心方法是利用`strings.Fields`函数进行字符串分割，并结合Go语言的可变参数（variadic arguments）语法，通过`&#…

程序猿
2026年5月10日
0000
用户投稿

如何精确控制CSS文本元素底边框的起始与长度

本教程旨在详细阐述如何在CSS中精确控制文本元素（如` `）的底边框起始位置和长度，避免其默认的延伸行为。文章将介绍两种主要方法：通过调整内边距和移除固定宽度使边框适应内容，以及利用CSS伪元素（`::after`）实现像素级的精细定位和宽度控制，从而满足多样化的设计需求。在网页设计中，为标题或文…

程序猿
2026年5月10日
0000
如何为Golang配置实时热加载开发环境使用Air或CompileDaemon工具

air的优势在于配置灵活，支持自定义监听目录、排除文件、构建命令等高级功能，适合结构复杂或需精细控制的项目；劣势是配置较复杂，需.air.toml文件。compiledaemon优势在于简单易用，无需配置文件，适合结构简单的项目；劣势是功能较少，无法精细配置。选择air适用于多包结构和静态资源管理的…

程序猿
2026年5月10日 • 用户投稿
0000
用户投稿

Go反射：使用binary.Read安全地将字节解组到结构体

本教程深入探讨了在Go语言中使用反射将字节数组解组（Unmarshal）到结构体时的常见陷阱与解决方案。重点介绍了reflect.New创建指针类型reflect.Value后，如何通过Elem()方法获取其指向的实际可寻址结构体值，从而避免f.Addr()调用时遇到的“不可寻址”错误，并提供了一个…

程序猿
2026年5月10日
1000
用户投稿

CSS中块级元素水平居中布局指南

本文详细介绍了在CSS中实现块级元素水平居中的核心方法，重点讲解了如何通过设置margin-left: auto;和margin-right: auto;来使具有固定宽度的块级元素在其父容器中居中显示。文章通过具体代码示例，阐明了这一常用技巧的原理与应用，并提供了相关注意事项，帮助开发者有效解决布局…

程序猿
2026年5月10日
1000
如何测试C++异常处理逻辑单元测试中模拟异常抛出

在c++++单元测试中，可通过多种方式验证异常处理逻辑。1. 使用google test的断言宏如assert_throw和expect_throw检查函数是否抛出预期异常；2. 模拟不同异常场景，包括正常路径无异常、标准库异常及自定义异常；3. 利用mock框架控制依赖对象抛出异常以测试上层逻辑；…

程序猿
2026年5月10日 • 用户投稿
0000
结构体与类的区别在哪里 C++中struct和class关键对比分析

c++++中struct和class的核心区别在于默认的成员访问权限和继承方式。1. struct默认成员为public，class默认成员为private；2. struct默认继承方式为public，class默认继承方式为private。除此之外，两者在功能上完全等价，均可支持构造函数、析构函…

程序猿
2026年5月10日 • 用户投稿
0000
用户投稿

Golang测试用例结构与命名规范技巧

Go语言测试强调简洁与可维护性，测试文件需与被测代码同包且以_test.go结尾，如calculator_test.go；测试函数以Test开头，后接驼峰式名称，格式为func TestXxx(t *testing.T)；推荐使用t.Run创建子测试以隔离场景；对于多输入情况，采用表驱动测试，将用例…

程序猿
2026年5月10日
0000
用户投稿

HTMLrev 上的免费 HTML 网站模板

HTMLrev 是唯一的人工策划的库专门专注于免费 HTML 模板，适用于由来自世界各地慷慨的模板创建者制作的网站、登陆页面、投资组合、博客、电子商务和管理仪表板世界。这个人就是我自己 Devluc，我已经工作了 1 年多来构建、改进和更新这个很棒的免费资源。我自己就是一名模板制作者，所以我知道如…

程序猿
2026年5月10日
3000
用户投稿

c++怎么自定义一个模板类_c++模板编程与泛型设计基础

答案：C++模板类通过template定义泛型类，如MyVector，支持类型无关的通用设计，成员函数需在头文件中实现，实例化时指定具体类型，并注意操作合法性与多参数、特化等特性。在C++中，模板类是泛型编程的核心工具之一。它允许你编写与数据类型无关的通用类，从而提升代码复用性和灵活性。下面介绍如…

程序猿
2026年5月10日
0000
用户投稿

在 FastAPI 中实现三层架构处理复杂 Endpoint：服务拆分策略

在 FastAPI 中实现三层架构时，处理需要多个服务支持的复杂 Endpoint 的最佳实践。针对诸如“get_transaction”这类需要聚合用户、产品和销售数据的情况，分析了在应用层直接调用多个服务，还是创建一个专门的聚合服务两种方案的优劣，并提出了基于服务身份和存储的拆分策略建议，以提升…

程序猿
2026年5月10日
0000
用户投稿

Golang性能优化的基本原则是什么解析高效Go代码的核心准则

go程序中常见的内存优化策略包括预分配切片容量、使用strings.builder或bytes.buffer进行字符串拼接、利用sync.pool复用对象以减少gc压力、避免大对象的值传递而改用指针传递、复用缓冲区以减少临时对象分配，以及警惕切片或字符串切片操作导致的底层数组隐式引用内存泄漏，这些策…

程序猿
2026年5月10日
0000
用户投稿

Golang包文档生成与注释规范

Go语言通过源码注释生成文档，推荐在package语句前添加包级别注释说明功能，如“// Package calculator 提供基础数学运算功能”；导出函数需用动词开头的注释描述行为、参数、返回值，如“// Add 计算两个数的和”；导出类型和结构体字段也应注释用途；使用go doc命令或访问p…

程序猿
2026年5月10日
0000

发表回复

登录后才能评论

全球瞩目的「科目三」：梅西、钢铁侠、二次元小姐姐轻松应对

方法介绍

实验与结果

关于作者

相关推荐

发表回复