从U-Net到DiT:Transformer技术在统治扩散模型中的应用

近几年,在 Transformer 的推动下,机器学习正在经历复兴。过去五年中,用于自然语言处理、计算机视觉以及其他领域的神经架构在很大程度上已被 transformer 所占据。

不过还有许多图像级生成模型仍然不受这一趋势的影响,例如过去一年扩散模型在图像生成方面取得了惊人的成果,几乎所有这些模型都使用卷积 U-Net 作为主干。这有点令人惊讶!在过去的几年中,深度学习的大事件一直是跨领域的 Transformer 的主导地位。U-Net 或卷积是否有什么特别之处使它们在扩散模型中表现得如此出色?

将 U-Net 主干网络首次引入扩散模型的研究可追溯到 Ho 等人,这种设计模式继承了自回归生成模型 PixelCNN++,只是稍微进行了一些改动。而 PixelCNN++ 由卷积层组成,其包含许多的 ResNet 块。其与标准的 U-Net 相比,PixelCNN++ 附加的空间自注意力块成为 transformer 中的基本组件。不同于其他人的研究,Dhariwal 和 Nichol 等人消除了 U-Net 的几种架构选择,例如使用自适应归一化层为卷积层注入条件信息和通道计数。

本文中来自 UC 伯克利的 William Peebles 以及纽约大学的谢赛宁撰文《 Scalable Diffusion Models with Transformers 》,目标是揭开扩散模型中架构选择的意义,并为未来的生成模型研究提供经验基线。该研究表明,U-Net 归纳偏置对扩散模型的性能不是至关重要的,并且可以很容易地用标准设计(如 transformer)取代。

这一发现表明,扩散模型可以从架构统一趋势中受益,例如,扩散模型可以继承其他领域的最佳实践和训练方法,保留这些模型的可扩展性、鲁棒性和效率等有利特性。标准化架构也将为跨领域研究开辟新的可能性。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

论文地址:https://arxiv.org/pdf/2212.09748.pdf项目地址:https://github.com/facebookresearch/DiT论文主页:https://www.wpeebles.com/DiT

该研究专注于一类新的基于 Transformer 的扩散模型:Diffusion Transformers(简称 DiTs)。DiTs 遵循 Vision Transformers (ViTs) 的最佳实践,有一些小但重要的调整。DiT 已被证明比传统的卷积网络(例如 ResNet )具有更有效地扩展性。

具体而言,本文研究了 Transformer 在网络复杂度与样本质量方面的扩展行为。研究表明,通过在潜在扩散模型 (LDM) 框架下构建 DiT 设计空间并对其进行基准测试,其中扩散模型在 VAE 的潜在空间内进行训练,可以成功地用 transformer 替换 U-Net 主干。本文进一步表明 DiT 是扩散模型的可扩展架构:网络复杂性(由 Gflops 测量)与样本质量(由 FID 测量)之间存在很强的相关性。通过简单地扩展 DiT 并训练具有高容量主干(118.6 Gflops)的 LDM,可以在类条件 256 × 256 ImageNet 生成基准上实现 2.27 FID 的最新结果。

Diffusion Transformers

DiTs 是一种用于扩散模型的新架构,目标是尽可能忠实于标准 transformer 架构,以保留其可扩展性。DiT 保留了 ViT 的许多最佳实践,图 3 显示了完整 DiT 体系架构。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

DiT 的输入为空间表示 z(对于 256 × 256 × 3 图像,z 的形状为 32 × 32 × 4)。DiT 的第一层是 patchify,该层通过将每个 patch 线性嵌入到输入中,以此将空间输入转换为一个 T token 序列。patchify 之后,本文将标准的基于 ViT 频率的位置嵌入应用于所有输入 token。

patchify 创建的 token T 的数量由 patch 大小超参数 p 决定。如图 4 所示,将 p 减半将使 T 翻四倍,因此至少能使 transformer Gflops 翻四倍。本文将 p = 2,4,8 添加到 DiT 设计空间。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

DiT 块设计:在 patchify 之后,输入 token 由一系列 transformer 块处理。除了噪声图像输入之外,扩散模型有时还会处理额外的条件信息,例如噪声时间步长 t、类标签 c、自然语言等。本文探索了四种以不同方式处理条件输入的 transformer 块变体。这些设计对标准 ViT 块设计进行了微小但重要的修改。所有模块的设计如图 3 所示。

本文尝试了四种因模型深度和宽度而异的配置:DiT-S、DiT-B、DiT-L 和 DiT-XL。这些模型配置范围从 33M 到 675M 参数,Gflops 从 0.4 到 119 。

实验

研究者训练了四个最高 Gflop 的 DiT-XL/2 模型,每个模型使用不同的 block 设计 ——in-context(119.4Gflops)、cross-attention(137.6Gflops)、adaptive layer norm(adaLN,118.6Gflops)或 adaLN-zero(118.6Gflops)。然后在训练过程中测量 FID,图 5 为结果。

扩展模型大小和 patch 大小。图 2(左)给出了每个模型的 Gflops 和它们在 400K 训练迭代时的 FID 概况。可以发现,增加模型大小和减少 patch 大小会对扩散模型产生相当大的改进。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

图 6(顶部)展示了 FID 是如何随着模型大小的增加和 patch 大小保持不变而变化的。在四种设置中,通过使 Transformer 更深、更宽,训练的所有阶段都获得了 FID 的明显提升。同样,图 6(底部)展示了 patch 大小减少和模型大小保持不变时的 FID。研究者再次观察到,在整个训练过程中,通过简单地扩大 DiT 处理的 token 数量,并保持参数的大致固定,FID 会得到相当大的改善。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

图 8 中展示了 FID-50K 在 400K 训练步数下与模型 Gflops 的对比:

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

SOTA 扩散模型 256×256 ImageNet。在对扩展分析之后,研究者继续训练最高 Gflop 模型 DiT-XL/2,步数为 7M。图 1 展示了该模型的样本,并与类别条件生成 SOTA 模型进行比较,表 2 中展示了结果。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

当使用无分类器指导时,DiT-XL/2 优于之前所有的扩散模型,将之前由 LDM 实现的 3.60 的最佳 FID-50K 降至 2.27。如图 2(右)所示,相对于 LDM-4(103.6 Gflops)这样的潜在空间 U-Net 模型来说,DiT-XL/2(118.6 Gflops)计算效率高得多,也比 ADM(1120 Gflops)或 ADM-U(742 Gflops)这样的像素空间 U-Net 模型效率高很多。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

表 3 展示了与 SOTA 方法的比较。XL/2 在这一分辨率下再次胜过之前的所有扩散模型,将 ADM 之前取得的 3.85 的最佳 FID 提高到 3.04。

统治扩散模型的U-Net要被取代了,谢赛宁等引入Transformer提出DiT

更多研究细节,可参考原论文。

以上就是从U-Net到DiT:Transformer技术在统治扩散模型中的应用的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/557025.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
百度怎么搜热点资源视频
上一篇 2025年11月9日 23:00:42
苹果11手机如何调整像素
下一篇 2025年11月9日 23:00:45

相关推荐

  • 敏感数据加密(如AES)与解密实现

    aes算法用于加密和解密敏感数据,支持128位、192位和256位密钥长度。使用时需注意:1. 密钥管理:使用安全的生成和存储机制。2. 初始化向量(iv):使用随机iv增强安全性。3. 模式选择:如cbc、gcm,gcm提供加密和认证。4. 性能考虑:高并发环境下使用并行处理或硬件加速。5. 错误…

    2026年8月26日
    100
  • AbletonMCP— AI音乐制作工具,基于MCP支持音轨创建与修改

    abletonmcp:ai赋能的音乐制作工具 AbletonMCP是一个开源项目,它利用模型上下文协议(MCP)将Ableton Live与Claude AI连接起来,实现AI辅助音乐创作。通过双向通信,用户可以借助Claude AI完成各种音乐制作任务,例如创建和修改MIDI及音频轨道、选择乐器和…

    2026年8月26日
    000
  • 如何解决PHP邮件发送复杂性、可靠性与功能扩展难题,MailerSendPHPSDK助你轻松搞定

    可以通过一下地址学习composer:学习地址 还记得那些年被php mail() 函数支配的恐惧吗?邮件不是进了垃圾箱,就是干脆消失不见;想要追踪邮件是否被打开、链接是否被点击,简直是天方夜谭;更别提复杂的模板、个性化内容、附件,以及那令人头疼的smtp配置和错误处理了。对于一个现代web应用来说…

    用户投稿 2026年8月26日
    000
  • 如何高效管理和调试Laravel队列任务?mxl/laravel-job助你轻松驾驭!

    最近在开发一个 Laravel 后台服务时,我需要频繁地创建和调试各种队列任务,例如发送邮件、处理图片、生成报表等。这些任务的特点是它们通常在后台异步执行,以避免阻塞主请求。然而,在实际开发过程中,我遇到了几个让我头疼的问题: 任务调试效率低下: 每次我想测试一个队列任务时,都需要在代码中手动创建一…

    用户投稿 2026年8月26日
    000
  • 懂车帝如何使用AI智能选车_懂车帝AI选车功能详解

    懂车帝AI智能选车功能可通过自然语言输入需求,快速推荐匹配车型。在iPhone 15 Pro(iOS 18)环境下,打开懂车帝App后点击搜索栏右侧“AI”图标进入助手界面。用户可输入“20万以内适合女生开的纯电SUV”等模糊需求,系统将生成包含多款车型的推荐列表,并附核心参数与价格区间;点击车型可…

    2026年8月26日
    200
  • Meta发布AI新模型系列 Llama 4,首次采用“混合专家”架构

    meta发布全新多模态ai模型系列llama 4,引领开源ai发展! 该系列包含llama 4 scout、llama 4 maverick和llama 4 behemoth三个模型,能够处理文本、视频、图像和音频等多种数据类型,并在不同格式间实现内容转换。 ☞☞☞AI 智能聊天, 问答助手, AI…

    2026年8月26日
    000
  • Java中安全获取浮点数用户输入:异常处理与循环验证

    本教程详细介绍了在java中使用`scanner`类获取用户浮点数输入时,如何通过异常处理机制(`try-catch` `inputmismatchexception`)和循环验证来确保输入数据的有效性。文章将展示如何构建健壮的输入循环,避免程序因无效输入而崩溃,并提供使用`hasnextfloat…

    2026年8月26日
    000
  • 预算5K内折叠屏有推荐吗?适合学生党的小折叠首选看这款

    在智能手机竞争日益激烈的今天,如何用有限的预算买到一台兼具实用性与新潮体验的设备,成为不少学生在暑期换机时最头疼的问题。而“5000元以内能否入手一款值得推荐的小折叠手机?”这个问题,如今终于有了明确的答案。随着技术不断成熟和价格逐步下探,折叠屏已不再是少数人的高端玩具。以联想motorazr 60…

    2026年8月26日
    300
  • 告别回调地狱与阻塞等待:如何使用GuzzlePromises优雅地处理PHP异步操作

    可以通过一下地址学习composer:学习地址 异步处理的痛点:当我们谈论“慢”和“乱”时,我们在谈论什么? 想象一下,你正在开发一个需要从多个第三方api获取数据的php应用。例如,一个用户仪表盘可能需要同时从用户服务获取个人信息、从订单服务获取最新订单列表,再从统计服务获取访问数据。如果这些请求…

    用户投稿 2026年8月26日
    000
  • 释放AI大模型促消费潜力

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 今年《政府工作报告》强调持续推进“人工智能+”行动,充分利用人工智能技术突破,融合我国数字技术和制造优势,推动AI大模型广泛应用,最终惠及各行各业和千家万户。在构建新发展格局的背景下,AI大模型…

    2026年8月26日
    000
  • java是c语言开发的吗 Java语言实现技术揭秘

    java 不是由 c++ 语言开发的,但受到了 c 和 c++ 的影响。java 的实现技术包括:1)虚拟机(jvm),将字节码转换为机器码,支持跨平台运行;2)标准库(java api),提供丰富功能和简洁语法;3)性能优化,如 jit 编译器和内存管理工具。java 是一个庞大而复杂的生态系统,…

    2026年8月26日
    000
  • 《模拟农场25》将于11月4日发布大型内容扩展包

    《模拟农场25》将于11月4日发布大型内容扩展包《模拟农场25》将于11月4日发布大型内容扩展包《模拟农场25》将于11月4日发布大型内容扩展包《模拟农场25》将于11月4日发布大型内容扩展包

    《farming simulator 25》 将于11月4日发布大型内容扩展包“Highlands Fishing” 全新水产养殖玩法即将上线,预购通道已正式开启 全球销量累计突破300万份的《farming simulator 25》,将在2025年11月4日正式推出首个大型DLC扩展包“High…

    2026年8月26日 用户投稿
    000
  • java中的method怎么理解 方法method的3个核心概念

    java中的method怎么理解 方法method的3个核心概念java中的method怎么理解 方法method的3个核心概念java中的method怎么理解 方法method的3个核心概念java中的method怎么理解 方法method的3个核心概念

    java中的方法是面向对象编程中实现代码复用的重要结构,与函数不同之处在于其必须属于类。1. 方法定义包含访问修饰符、返回类型、名称和参数列表;2. 调用时需通过对象或类(静态方法)执行;3. 方法可重载以支持不同参数;4. 静态方法直接通过类调用,适用于工具类操作;5. 访问修饰符控制可见性,如p…

    2026年8月26日 用户投稿
    000
  • 夸克AI怎么处理新闻资讯_夸克AI新闻摘要与趋势分析功能

    夸克AI能帮助用户从海量新闻中快速提炼核心内容并进行深度分析,首先通过AI超级框生成包含关键要素的新闻摘要,接着利用深度搜索开展多角度趋势分析,揭示事件影响与历史规律,最后根据用户偏好定制并主动推送含摘要与解读的个性化资讯简报。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 …

    2026年8月26日
    000
  • 表单数据验证与过滤的最佳实践

    我们需要重视表单数据的验证和过滤,以确保应用的安全性和数据的完整性。1) 结合使用客户端和服务器端验证,客户端提供即时反馈,服务器端确保数据安全。2) 验证不同类型的数据,如字符串、数字、日期,确保格式和业务逻辑正确。3) 处理错误时提供友好的错误信息,并防止泄露敏感信息。4) 使用适当的函数过滤数…

    2026年8月26日
    000
  • Java中静态方法能重写吗 分析Java静态方法隐藏现象的本质

    Java中静态方法能重写吗 分析Java静态方法隐藏现象的本质Java中静态方法能重写吗 分析Java静态方法隐藏现象的本质Java中静态方法能重写吗 分析Java静态方法隐藏现象的本质Java中静态方法能重写吗 分析Java静态方法隐藏现象的本质

    java中的静态方法不能被重写,但可以被隐藏,这是因为在编译时根据引用类型决定调用哪个类的静态方法。1. 静态方法属于类而非实例,因此它们在编译时绑定;2. 子类定义与父类相同的静态方法会隐藏父类方法,而不是实现多态;3. 调用时依据引用类型而非对象实际类型,导致parent.printmessag…

    2026年8月26日 用户投稿
    200
  • 第三方登录(微信、QQ等)集成方法

    集成第三方登录是为了简化用户注册和登录流程,提高用户体验和安全性。具体步骤包括:1)了解oauth 2.0协议;2)在应用中添加第三方登录入口;3)处理授权码和访问令牌;4)获取用户信息;5)处理常见问题和优化性能。 集成第三方登录(如微信、QQ等)是现代应用开发中常见的需求。为什么要集成第三方登录…

    2026年8月26日
    100
  • 如何使用guzzlehttp/promises优雅地解决PHP中的异步操作与并发难题

    Composer在线学习地址:[学习地址](https://pan.quark.cn/s/371f7205c512] 最近在开发一个电商后台服务时,我遇到了一个典型的性能瓶颈。我们的系统需要在一个请求中,同时从用户服务获取用户信息、从商品服务获取商品详情、再从库存服务查询库存量,最终整合数据后返回。…

    用户投稿 2026年8月26日
    000
  • “AI+科研”,科研范式革命真的来了?

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ AlphaFold2的问世,预示着算法驱动科研的时代已经到来。AI智能体日夜不息地运行,优化药物分子结构,分析海量数据,甚至自动生成研究报告,这不再是科幻小说中的场景。 “AI+科研”模式的兴起…

    2026年8月26日
    200
  • 如何举报谷歌邮箱里的诈骗_谷歌邮箱诈骗邮件举报步骤

    首先立即通过Gmail内置功能举报诈骗邮件,点击“报告垃圾邮件”或“举报为钓鱼式攻击”;其次将完整邮件转发至phishing@report.google.com纳入全球反欺诈库;最后同步向国家反诈中心官网或APP提交举报,上传截图并填写发件人、主题等信息,协助执法阻断诈骗链。 如果您在谷歌邮箱(Gm…

    2026年8月26日
    000

发表回复

登录后才能评论
关注微信