手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

在手机等移动端侧运行 Stable Diffusion 等文生图生成式 AI 大模型已经成为业界追逐的热点之一,其中生成速度是主要的制约因素。

近日,来自谷歌的一篇论文「MobileDiffusion: Subsecond Text-to-Image Generation on Mobile Devices」,提出了手机端最快文生图,在 iPhone 15 Pro 上只要 0.2 秒。论文出自 UFOGen 同一团队,在打造超小扩散模型的同时, 采用当前大火的 Diffusion GAN 技术路线做采样加速。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

请点击以下链接查看论文:https://arxiv.org/abs/2311.16567

可图大模型 可图大模型

可图大模型(Kolors)是快手大模型团队自研打造的文生图AI大模型

可图大模型 32 查看详情 可图大模型

下面是 MobileDiffusion 一步生成的结果。

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

那么,MobileDiffusion 是如何优化得到的呢?

首先,让我们从问题出发,探讨为何优化是必要的

目前最热门的文本到图像生成技术都是基于扩散模型实现的。由于其预先训练的模型具有极强的基本图像生成能力和在下游微调任务上的稳健性质,因此我们看到了扩散模型在图像编辑、可控生成、个性化生成以及视频生成等领域的出色表现

然而,作为基础模型,其不足之处也很明显,主要包括两个方面:一是扩散模型的大量参数导致计算速度慢,尤其是在资源有限的情况下;二是扩散模型需要多步才能进行采样,这进一步导致推理速度缓慢。以备受瞩目的 Stable Diffusion 1.5(SD)为例,其基础模型包含近10亿个参数,我们在iPhone 15 Pro上对模型进行量化后进行推理,50步采样需要接近80秒。如此昂贵的资源需求和迟缓的用户体验极大地限制了其在移动端的应用场景

为了解决以上问题,MobileDiffusion 点对点地进行优化。(1) 针对模型体积庞大的问题,我们主要对其核心组件 UNet 进行了大量试验及优化,包括了将计算昂贵的卷积精简和注意力运算放在了较低的层上,以及针对 Mobile Devices 的操作优化,诸如激活函数等。(2)针对扩散模型需要多步采样的问题, MobileDiffusion 探索并实践了像 Progressive Distillation 和当前最先进的 UFOGen 的一步推理技术。

模型优化

MobileDiffusion 基于当下开源社区里最火的 SD 1.5 UNet 进行优化。在每次的优化操作后, 会同时衡量相对于原始 UNet 模型的性能的损失,测量指标包括 FID 和 CLIP 两个常用 metric。

整体规划

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

在图上的左侧是原始 UNet 的设计示意,可以看出它基本上包括了卷积和Transformer,而Transformer又包括了自注意力机制和交叉注意力机制

MobileDiffusion 对 UNet 优化的核心思路分为两点:1)精简 Convolution, 众所周知,在高分辨率的特征空间上进行了 Convolution 是十分耗时的, 而且参数量很大,这里指的是 Full Convolution;2)提高 Attention 效率。和 Convolution 一样,高 Attention 需要对整个特征空间的长度进行运算,Self-Attention 复杂度和特征空间展平后长度成平方关系,Cross-Attention 也要和空间长度成正比。

经过实验证明,将整个UNet的16个Transformer移动到特征分辨率最低的内层,并且每一层都剪掉一个卷积,对性能没有明显影响。所达到的效果是:MobileDiffusion将原本的22个卷积和16个Transformer精简到了只有11个卷积和大约12个Transformer,并且这些注意力都是在低分辨率特征图上进行的。这样做的效率大大提高,带来了40%的效率提升和40%的参数剪切。最终的模型如右图所示。下面是与其他模型的对比:

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

需要进行重新编写的内容是:微观设计

这里将只介绍几种新颖的设计,有兴趣的读者可以阅读正文, 会有更详细的介绍。

解耦自注意力和交叉注意力

传统 UNet 里 Transformer 同时包含 Self-Attention 和 Cross-Attention,MobileDiffusion 将 Self-Attention 全部放在了最低分辨率特征图,但是保留一个 Cross-Attention 在中间层,发现这种设计既提高了运算效率又保证了模型出图质量

Finetune softmax into relu

众所周知,在大部分未优化的情况下,softmax函数很难进行并行处理,效率较低。MobileDiffusion提出了一种新的方法,即将softmax函数直接调整(finetune)为relu函数,因为relu函数对于每个数据点的激活更加高效。令人惊讶的是,仅需大约一万步的微调,模型的度量指标反而提高了,并且生成的图像质量也得到了保证。因此,相比于softmax函数,relu函数的优势显而易见

Separable Convolution (可分离卷积)

MobileDiffuison 精简参数的关键还在采用了 Seprable Convolution。这种技术已经被 MobileNet 等工作证实是极为有效的,特别是移动端,但是一般在生成模型上很少采用。MobileDiffusion 实验发现 Separable Convolution 对减少参数是很有效的,尤其是将其放在 UNet 最内层,模型质量经分析证明是没有损失的。

采样优化

目前最流行的采样优化方法包括渐进蒸馏(Progressive Distillation)和UFOGen,它们分别可以实现8步和1步。为了证明即使在模型经过极致简化后,这些采样方法仍然有效,MobileDiffusion对这两种方法进行了实验验证

优化后的采样与基准模型进行了比较,可以看出采样优化后的 8 步和 1 步模型的指标都有显著的提升

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

实验与应用

移动端基准测试

在 iPhone 15 Pro 上,MobileDiffusion 可以以当前最快的速度进行出图,只需 0.2 秒!

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

下游任务测试

MobileDiffusion 探索了包括 ControlNet/Plugin 和 LoRA Finetune 的下游任务。从下图可以看出,经过模型和采样优化后,MobileDiffusion 依然保持了优秀的模型微调能力。

手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion

总结

MobileDiffusion对多种模型和采样优化方法进行了探索,最终实现了在移动端亚秒级的图像生成能力,同时保证了下游微调应用的稳定性。我们相信这将对未来高效的扩散模型设计产生影响,并拓展移动端应用的实际应用案例

以上就是手机上图像0.2秒即可呈现,谷歌构建最快的移动扩散模型MobileDiffusion的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/453339.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月8日 00:19:00
下一篇 2025年11月8日 00:20:02

相关推荐

  • 谷歌可编程搜索框预填充:利用JavaScript实现动态内容设置

    本教程详细介绍了如何使用javascript为谷歌可编程搜索(programmable google search)的搜索框进行预填充。通过监听window.onload事件,并定位到动态生成的gsc-input输入框,我们可以编程设置其默认值,并解决潜在的样式冲突,从而提升用户体验,提供个性化的初…

    2025年12月12日
    000
  • PHP如何加载图片_PHP加载不同格式图片的方法

    答案:PHP通过设置Content-Type头并输出文件内容来加载图片。具体流程为:验证文件存在且可读,利用getimagesize()获取MIME类型,正确设置Content-Type头,使用readfile()输出图片内容,并推荐添加缓存头以提升性能;处理不同格式时依赖MIME类型自动适配;安全…

    2025年12月12日
    000
  • 什么是Theta Fuel (TFUEL)币?TFUEL代币经济学、未来展望及购买指南

    theta fuel (tfuel) 是 theta 平台上的支付加密货币,theta 是一个基于区块链的视频分享平台。19 日,theta fuel (tfuel) 在 upbit贪婪与恐惧指数中位列第一(贪婪指数) ,得分为 72 分,引起了市场参与者的广泛关注。 Binance币安 欧易OKX…

    2025年12月12日 好文分享
    100
  • 如何从币安交易所提币至imKey?提币操作步骤和注意事项

    从币安提币至imKey需四步:一、在imKey App中选择资产并复制收款地址;二、币安提现页粘贴地址并选对应资产;三、严格匹配提币网络与地址链类型;四、完成多重安全验证后查收到账。 从币安交易所提币至imkey硬件设备,核心是先在imkey应用内获取正确的收款地址,然后在币安平台填写该地址并选择匹…

    2025年12月12日
    000
  • 2025年币安IP限制了怎么办?新手用户注册币安详细教程

    币安IP限制可通过代理工具或远程服务器解决,新用户需用邮箱/手机注册并完成KYC认证及2FA安全设置。 当遇到币安的ip访问限制时,可尝试使用网络工具或配置远程服务器。对于新用户,完成注册需要通过邮箱或手机,并进行必要的身份验证以激活账户功能。 一、使用专业的网络代理工具 此方法通过改变你的网络出口…

    2025年12月12日
    000
  • 币安官网正式入口,交易所最新版安卓客户端下载指南

    作为全球数字资产交易领域的巨头,币安(binance)凭借其强大的功能和卓越的用户体验,成为了无数投资者进入加密世界的首选平台。无论您是初次探索数字货币的新人,还是资深交易者,币安app都能为您提供流畅、安全的资产买卖、充值与提现服务。 币安官网正式入口 为确保您的资产安全,请务必通过官方指定的正式…

    2025年12月12日 好文分享
    000
  • 币安平台安全登录通道,官方2025版手机App获取方式

    在波动的加密市场中,保障您的数字资产安全是第一要务。币安(binance)作为全球顶级的数字资产交易平台,不仅提供卓越的交易深度和丰富的功能,更以其银行级的安全体系,成为亿万用户的信赖之选。本指南将为您提供官方认证的安全入口,助您轻松下载最新版币安app,开启您的加密投资之旅。 币安官方认证访问入口…

    2025年12月12日 好文分享
    000
  • 币安交易所是什么?安全吗?币安来历背景,平台优势与详细使用指南

    币安是全球知名区块链资产交易平台,核心优势在于高流动性、低手续费及丰富资产种类;采用2FA、SAFU基金等多重安全机制;需完成KYC验证以提升权限;现货交易需确认交易对并选择订单类型操作。 币安是全球知名的区块链资产交易平台,它提供多种数字资产的交易服务。平台通过多重安全验证与资产保护基金等措施保障…

    2025年12月12日
    000
  • 币安官网入口及新用户注册指南(Binance) 币安交易所最新版v3.8.2APP下载

    作为全球知名的数字资产服务平台,币安(binance)为新用户提供了清晰、便捷的入门路径。本篇指南将重点围绕币安的官方网站入口、新用户注册流程以及最新版手机应用的下载安装进行全面介绍,旨在帮助您安全、高效地完成所有初始设置,开启您的数字资产之旅。 币安·官网入口与新用户注册流程 1、为确保您访问的是…

    2025年12月12日
    000
  • 币an安交易所全球站官网 币an安binance最新版v3.8.0安卓APP下载及注册

    账户注册步骤 1、访问币安的第一步,也是最关键的一步,是通过本文提供的官方链接进入其全球站官网,这是避免进入不安全网站的最佳途径。 币安(Binance)全球站官方认证入口: 2、在官网首页,您会看到“注册”按钮。平台提供了灵活的注册方式,您可以选择使用电子邮箱或手机号码进行创建。 3、根据页面提示…

    2025年12月12日
    000
  • 欧易OKX交易平台官网注册入口 2026欧易官方手机App下载地址

    作为全球顶级的数字资产服务平台,欧易(okx)为用户提供了安全、稳定的交易环境。寻找一个长期有效且官方认证的注册入口至关重要。本指南旨在为您提供一个面向未来的欧易okx官方渠道指引,确保您在当下乃至未来几年,都能通过最安全的方式访问官网并下载官方正版手机应用。 欧易OKX官网注册:开启您的数字资产之…

    2025年12月12日
    000
  • 币安客户端哪里下载安装?币安官方电脑版 Windows/Mac 安装指南

    币安作为全球领先的交易平台之一,其客户端的下载与安装成为了许多新用户和资深交易者关注的焦点。无论是出于安全性、便捷性还是功能性的考虑,选择官方渠道下载安装币安电脑版客户端都至关重要。本文将为您提供详细的windows和mac版本安装指南,帮助您轻松获取并配置币安客户端,从而更好地管理您的数字资产,享…

    2025年12月12日
    000
  • 2025年币安交易所密码登录错误怎么办?别慌!快速排查与安全解决指南

    %ignore_a_1%密码登录错误时,应先核对输入信息(大小写、空格、输入法),再清理浏览器缓存与Cookies,接着通过安全验证重置密码,最后检查网络和设备状态。 当遇到币安密码登录错误时,可尝试核对输入信息、清理浏览器数据、通过安全验证重设密码或检查网络设备。这些方法能快速排查并解决大部分登录…

    2025年12月12日
    000
  • 币an交易所官方网址入口 币安最新版v3.7.2 APP安卓下载

    作为全球广受欢迎的数字资产服务平台,确保您访问的是%ignore_a_1%(binance)的官方网址并下载其最新版官方app,是保障您账户与资产安全的首要前提。本篇指南将为您提供一个清晰、安全的路径,直达币安官方入口,并详细介绍如何将最新的官方app安装到您的设备上。 如何安全访问币安官方网址 币…

    2025年12月12日
    000
  • 币安Binance官网正确入口是什么?中文用户专属访问信道指南

    对于中文用户而言,了解如何正确访问知名交易平台币安binance的官方网站,以及掌握高效的注册、交易和资产管理方法,是进入加密世界的第一步。本指南将全面解析币安binance的中文用户专属访问信道,提供详细的注册流程、安全设置建议、以及交易策略概览,旨在帮助广大用户轻松入门,畅游数字资产的海洋。 币…

    2025年12月12日
    000
  • 2025年币安Binance、欧易OKX、Gate对比:哪家货币交易所最好?

    币安在主流资产流动性与交易深度上占优,欧易OKX以衍生品和Web3集成见长,Gate.io则凭借丰富早期项目吸引用户;选择需匹配个人交易策略与需求。 币安做好资产深度与多样性占优,欧易okx在衍生品交易和web3集成上表现突出,而gate则做好了丰富的其他类资产吸引用户群体。选择哪家平台,核心在于您…

    2025年12月12日
    000
  • 币安和欧易交易所怎么提现转账?新手教程

    数字资产转出分链上提现和内部转账两种方式:链上提现需核对接收地址与网络一致性,内部转账则通过用户标识完成,两者均须通过安全验证。 从币安或欧易平台将数字资产转出,主要分为链上提现和内部转账方式两种。链上提现需要提供接收方的地址并选择正确的网络,内部转账则通过用户标志完成。操作核心对地址和网络进行核对…

    2025年12月12日
    000
  • 新手用户交易如何把风险降到最低?欧艺OKX交易流程及安全注意事项

    新手降低交易风险需从账户安全、风险策略和基础操作三方面入手:启用2FA、设资金口令、绑手机邮箱、设防钓鱼码;熟悉现货交易流程,首选限价单;善用止盈止损、小额试水、分散投资;警惕钓鱼链接、不泄露敏感信息、远离高回报骗局。 新手降低交易风险需从账户安全、风险策略和基础操作三个方面入手。在okx平台交易,…

    2025年12月12日
    000
  • 欧易(OKX)安卓版官方安装包下载及欧易app完整安装步骤指南

    欧易okx是一款全球领先的数字资产交易平台,致力于为用户提供安全、便捷、专业的数字货币交易服务。本文将为您详细介绍欧易(okx)安卓版官方app的下载和安装流程,帮助您轻松获取并使用这款功能强大的应用。本文提供官方app下载链接,点击本文提供的下载链接即可下载。 欧易okx官网入口: 一、欧易(OK…

    2025年12月12日 好文分享
    000
  • 币安正确入口确认_2025最新官网链接及App安装指南

    在数字资产的世界里,选择一个安全可靠的交易平台是保障资金安全的第一步。币安(binance)作为全球顶级的加密货币交易所,凭借其强大的功能、丰富的币种和顶级的安全系统,成为了无数投资者的首选。本指南将为您确认币安的官方正确入口,并提供2025年最新的app安装与账户注册教程。 币安官方渠道确认 为避…

    2025年12月12日 好文分享
    000

发表回复

登录后才能评论
关注微信