Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs_创想鸟

生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs

为任务选择正确的GenAI模型需要了解每个模型使用的技术及其特定能力,下面请了解VAEs、GANs、Diffusion、Transformers和NerFs五大GenAI模型。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs

以前,大多数人工智能模型都专注于更好地处理、分析和解释数据。直到最近,在所谓的生成神经网络模型方面的突破带来了一系列用于创建各种内容的新工具,从照片和绘画到诗歌、代码、电影剧本和电影。

顶级 AI 生成模型概述

在2010年代中期,研究人员发现了生成人工智能模型的新前景。当时,他们开发了变分自编码器(VAEs)、生成对抗网络(GAN)和扩散模型(Diffusion)。2017年问世的转换器(Transformers)是一种突破性的神经网络,能够大规模分析大型数据集,以自动创建大型语言模型(LLM)。到了2020年,研究人员引入了神经辐射场(NeRF)技术,这种技术可以从三维图像生成二维内容

这些生成模型的快速发展是一项正在进行的工作,因为研究人员的调整通常会带来巨大的进步,并且显著的进展并没有减缓。怀特教授在加州大学伯克利分校表示:“模型架构在不断变化,将继续开发新的模型架构。”

每个模型都有其特殊的能力,目前,扩散模型(Diffusion)在图像和视频合成领域表现异常出色,转换器模型(Transformers)在文本领域表现良好,GAN 擅长用合理的合成样本来扩充小数据集。但是选择最佳模型始终取决于特定的用例。

所有的模型都不相同,人工智能研究人员和ML(机器学习)工程师必须为适当的用例和所需的性能选择合适的一个,并考虑模型在计算、内存和资本方面可能存在的限制。

特别是转换器模型对生成模型的最新进展和激动产生了推动作用。UST数字化转型咨询公司的首席人工智能架构师Adnan Masood表示:“人工智能模型的最新突破来自于对大量数据进行预训练,并使用自我监督学习来训练没有明确标签的模型。”

例如,OpenAI的生成式预训练转换器系列模型是该类别中最大、最强大的模型之一。其中,GPT-3模型就包含了175亿个参数

顶级生成式 AI 模型的主要应用

Masood解释说,顶级生成AI模型使用各种不同的技术和方法来生成全新的数据。这些模型的主要功能和用途包括:

VAE使用编码器-解码器架构来生成新数据,通常用于图像和视频生成,例如生成用于隐私保护的合成人脸。GAN 使用生成器和鉴别器来生成新数据,通常用于视频游戏开发中以创建逼真的游戏角色。Diffusion添加然后消除噪声以生成具有高细节水平的高质量图像,从而创建近乎逼真的自然场景图像。Transformer可以有效地并行处理顺序数据,以进行机器翻译、文本摘要和图像创建。NeRF提供了一种使用神经表示的3D场景重建的新方法。

下面让我们更详细地介绍每种方法。

VAE

VAE是在2014年开发的,其目的是利用神经网络更有效地对数据进行编码

Sisense的AI负责人Yael Lev表示,人工智能分析平台VAE学会了更有效地表达信息。VAE由两部分组成:一个编码器(encoder)将数据压缩,另一个解码器(decoder)将数据恢复到原始形式。它们非常适合从较小的信息中生成新的实例,修复嘈杂的图像或数据,检测数据中的异常内容并填充缺失的信息

然而,根据UST的Masood所说,变分自编码器(VAE)也倾向于生成模糊或低质量的图像。另外一个问题是,用于捕获数据结构的低维潜在空间错综复杂且具有挑战性。这些缺点可能会限制VAE在需要高质量图像或对潜在空间有清晰理解的应用中的有效性。VAE的下一次迭代可能会侧重于提高生成数据的质量、加快训练速度并探索其在序列数据方面的适用性

生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs

GANs

GANs是在2014年开发出来的,它被用于生成逼真的面部和打印数字。GAN将生成真实内容的神经网络与检测虚假内容的神经网络对立起来。普华永道全球人工智能负责人Anand Rao说:“逐步地,这两个网络融合在一起,产生了与原始数据无法区分的生成图像。”

GAN 通常用于图像生成、图像编辑、超分辨率、数据增强、风格传输、音乐生成和深度伪造创建。GAN的一个问题是,它们可能会遭受模式崩溃,其中生成器产生有限和重复的输出,使它们难以训练。Masood说,下一代GAN将专注于提高训练过程的稳定性和融合性,将其适用性扩展到其他领域,并开发更有效的评估指标。GAN也很难优化和稳定,并且对生成的样本没有明确的控制。

生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs

Diffusion

扩散模型由斯坦福大学的一组研究人员于2015年开发,用于模拟和反转熵和噪声。扩散技术提供了一种模拟现象的方法,例如盐等物质如何扩散到液体中,然后逆转它,此相同模型还有助于从空白图像生成新内容。

扩散模型是当前图像生成的首选,它们是流行的图像生成服务的基本模型,例如Dall-E 2,Stable Diffusion,Midjourney和Imagen。它们还用于管道中生成语音、视频和 3D 内容。此外,扩散技术还可用于数据插补,其中预测和生成缺失数据

许多应用将扩散模型与LLM配对,用于文本到图像或文本到视频生成。例如,Stable Diffusion 2 使用对比语言-图像预训练模型作为文本编码器,它还添加了用于深度和升级的模型。

Masood预测,对稳定扩散等模型的进一步改进可能侧重于改进负面提示,增强以特定艺术家风格生成图像的能力,并改善名人图像。

Transformers

转换器模型是由Google Brain的一个团队在2017年开发的,旨在改善语言翻译。这些模型非常适合以不同的顺序处理信息,并且能够并行处理数据,同时还能利用未标记的数据来扩展到大型模型

重写后的内容:这些技术可以应用于文本摘要、聊天机器人、推荐引擎、语言翻译、知识库、个性化推荐(通过偏好模型)、情感分析和命名实体识别,用于识别人物、地点和事物。此外,它们还可以用于语音识别,如OpenAI的耳语技术,以及视频和图像中的对象检测、图像字幕、文本分类和对话生成等领域

尽管Transformers具有多功能性,但它们确实存在局限性。它们的训练成本可能很高,并且需要大型数据集。由此产生的模型也相当大,这使得识别偏差或不准确结果的来源变得具有挑战性。马苏德说:“它们的复杂性也使得解释其内部运作变得困难,阻碍了它们的可解释性和透明度。

生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFsTransformer模型架构

NeRF

NeRF 于 2020 年开发,用于将光场的 3D 表示捕获到神经网络中,第一次实施非常缓慢,需要几天时间才能捕获第一个3D图像。

然而,在2022年,英伟达公司的研究人员发现了一种在大约30秒内生成新模型的方法。这些模型可以以几兆字节为单位表示3D对象,并具有相当的质量,而其他技术可能需要占用千兆字节。这些模型有望为捕捉和生成元宇宙中的3D对象带来更有效的技术。英伟达的研究总监亚历山大·凯勒(Alexander Keller)表示,NeRFs对于3D图形的重要性最终可能与数码相机对现代摄影的重要性一样重要

Masood表示,NeRF在机器人、城市测绘、自主导航和虚拟现实应用方面显示出巨大的潜力。然而,NERF的计算成本仍然很高,将多个NERF组合成更大的场景也很具有挑战性,今天NeRF唯一可行的用例是将图像转换为3D对象或场景。尽管存在这些限制,Masood预测NeRF将在基本图像处理任务中找到新的角色,例如去噪,去模糊,上采样,压缩和图像编辑

GenAI生态系统进行时

重要的是要注意,这些模型正在进行中,研究人员正在寻求改进单个模型以及将它们与其他模型和处理技术相结合的方法。Lev预测,生成模型将变得更加通用,应用程序将扩展到传统领域之外,用户还可以更有效地指导AI模型,并了解它们如何更好地工作。

在多模态模型上也有工作正在进行中,这些模型使用检索方法来调用针对特定任务优化的模型库。他还希望生成模型能够开发其他功能,例如进行API调用和使用外部工具,例如,根据公司的呼叫中心知识微调的LLM将提供问题的答案并执行故障排除,例如重置客户调制解调器或在问题解决时发送电子邮件。

实际上,未来可能会有更高效的东西取代今天流行的模型架构。怀特表示:“当新架构出现时,Diffusion和Transformer模型可能不再有用。”我们从Diffusion的引入中看到了这一点,因为它们对自然语言应用的方法并不利于长短期记忆算法和递归神经网络(RNN)

有人预测,生成AI生态系统将演变为三层模型。基础层是一系列基于文本、图像、语音和代码的基础模型,这些模型会摄取大量数据,并基于大型深度学习模型构建,同时结合了人类的判断。接下来,特定于行业和功能的领域模型将改善医疗保健、法律或其他类型的数据处理。在顶层,公司将使用专有数据和主题专业知识构建专有模型。这三个层将颠覆团队开发模型的方式,并迎来模型即服务的新时代

如何选择生成式 AI 模型:首要注意事项

根据Sisense的Lev的说法,在模型之间进行选择时的首要考虑因素包括以下内容:

您要解决的问题。选择已知适用于您的特定任务的模型。例如,将转换器用于语言任务,将 NeRF 用于 3D 场景。

数据的数量和质量。Diffusion需要大量良好的数据才能正常工作,而VAE则在数据较少的情况下工作得更好。

结果的质量。GAN 更适合清晰和详细的图像,而 VAE 更适合更平滑的结果。

训练模型的难易程度。GAN可能很难训练,而VAE和Diffusion更容易。

计算资源要求。NeRF和Diffusion都需要大量的计算机能力才能正常工作。

需要控制和理解。如果您想更好地控制结果或更好地了解模型的工作原理,VAE 可能比 GAN 更好。

以上就是生成式AI的五大模型:VAEs、GANs、Diffusion、Transformers、NeRFs的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/808612.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
碧蓝航线不屈装备搭配
上一篇 2025年11月26日 21:32:15
Laravel开发:如何使用Laravel Nova和AdminLTE生成后台管理界面?
下一篇 2025年11月26日 21:32:18

相关推荐

  • 内存时序详解:CL值对游戏与创作性能的实际影响

    CL值是内存时序中衡量响应速度的关键参数,表示读取命令到数据传输的延迟周期数,需结合频率评估实际延迟,计算公式为(CL÷频率)×2000,高频可抵消高CL影响,相同延迟下性能相近;在游戏和内容创作中,低CL能提升帧率稳定性与操作流畅度,尤其对AMD Ryzen平台更明显;选择时应权衡平台、频率与稳定…

    2026年9月22日
    200
  • 俄罗斯搜索引擎免费访问入口_俄罗斯搜索引擎在线官网

    俄罗斯搜索引擎免费访问入口包括Yandex(https://yandex.com)、Mail.ru(www.mail.ru)和Rambler(www.rambler.ru),均无需登录即可使用,其中Yandex提供精准俄语检索、新闻聚合、地图导航与网页翻译等核心服务。 1、立即进入“俄罗斯搜索引擎免…

    2026年9月22日
    900
  • Pixc的AI工具怎么裁剪图片?一步步完成智能图片裁剪教程

    Pixc的AI工具怎么裁剪图片?一步步完成智能图片裁剪教程Pixc的AI工具怎么裁剪图片?一步步完成智能图片裁剪教程Pixc的AI工具怎么裁剪图片?一步步完成智能图片裁剪教程Pixc的AI工具怎么裁剪图片?一步步完成智能图片裁剪教程

    Pixc的AI工具通过智能识别主体与自动化裁剪,大幅提升图片处理效率与一致性,尤其适用于电商场景。用户只需上传图片,系统便自动完成背景移除、主体识别与推荐裁剪,支持批量处理、多比例选择及模板预设,兼顾效率与细节控制。相比传统手动裁剪,AI在处理速度、构图统一性上优势显著,虽在艺术性图片中仍有局限,但…

    2026年9月22日 用户投稿
    100
  • iPhone情侣模式如何同步双人相册?随时查看回忆的设置方法

    iPhone情侣模式如何同步双人相册?随时查看回忆的设置方法iPhone情侣模式如何同步双人相册?随时查看回忆的设置方法iPhone情侣模式如何同步双人相册?随时查看回忆的设置方法iPhone情侣模式如何同步双人相册?随时查看回忆的设置方法

    答案:使用iPhone共享相册可实现情侣间照片同步。首先双方开启iCloud照片共享,创建者在“照片”App中新建共享相簿并命名,邀请伴侣加入;对方接受邀请后,双方可上传、查看和评论内容。该功能为私密邀请制,不公开且不占用iCloud空间,支持最多5000张照片或视频,但照片最长边压缩至2048像素…

    2026年9月22日 用户投稿
    300
  • Krita如何导出AI生成的艺术图片?教你保存高质量图像的技巧

    答案:导出AI艺术图需注意文件格式、分辨率和色彩空间。首选PNG保留细节,网络用sRGB、72-150 DPI,打印选CMYK、300 DPI以上,避免色彩偏差与模糊。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Krita导出AI生成的…

    2026年9月22日
    000
  • ​​VSCode的终极骚操作!学会这些让你的编程效率无人能敌

    掌握VSCode的高效技巧能显著提升编程效率。首先利用代码片段(Snippets)避免重复输入,如设置“rcomp”快速生成React组件结构;接着通过Emmet缩写大幅提升HTML/CSS编写速度,如“ul>li*3”生成列表;再结合Prettier、ESLint等插件优化代码质量与格式;自…

    2026年9月22日
    400
  • GPU 使用率低下的成因分析与排查解决指南

    GPU使用率低不等于显卡未工作,可能是任务流程中存在等待或瓶颈。先检查驱动是否更新、电源模式是否设为高性能、显卡连接与散热是否正常;再分析是否存在CPU预处理慢、存储速度低或频繁I/O导致GPU等待;最后优化应用设置,如提升画质、关闭垂直同步、减少后台占用。问题多出在流程瓶颈而非显卡性能不足。 GP…

    2026年9月22日
    200
  • 荣耀官宣!谢霆锋成荣耀Mgaic8系列代言人

    今日,荣耀正式宣布谢霆锋担任“未来科技体验官”,并曝光其手持荣耀magic8 pro的宣传画面。 据知名数码博主@数码闲聊站透露,该机型将采用一块6.71英寸的1.5K等深四曲面屏幕,集成3D人脸识别与3D超声波指纹解锁功能,带来更安全便捷的交互体验。续航方面,新机内置高达7200mAh的青海湖电池…

    2026年9月22日
    000
  • Java项目中利用.class文件:Classpath配置与接口实现

    在Java项目中引用并实现来自.class文件的接口是常见的需求,尤其当仅提供编译后的字节码文件时。本文将深入讲解Java Classpath的核心概念及其重要性,并提供在命令行环境下配置Classpath的详细步骤和示例,确保编译器和JVM能够正确找到并加载所需的.class文件,从而顺利完成接口…

    2026年9月22日
    800
  • safari浏览器怎么阻止网站访问剪贴板_safari浏览器阻止网站访问剪贴板方法

    可通过关闭网站剪贴板权限、启用无痕浏览、禁用JavaScript或使用内容拦截扩展来阻止Safari网站访问剪贴板,保护隐私安全。 如果您在使用 Safari 浏览器时发现某些网站尝试自动读取或写入剪贴板内容,可能会导致隐私泄露或意外粘贴敏感信息。为防止此类行为,您可以采取以下措施限制网站对剪贴板的…

    2026年9月22日
    1900
  • Linux进程调度学习!

    进程调度决定了哪个进程将被执行以及执行的时间,操作系统通过合理的进程调度实现资源的最大化利用。 在单片机上,常见的方式是系统初始化后进入 while(1){} 循环。当然,单片机也可以运行类似 FreeRTOS 的系统,从而实现进程切换。 在带有操作系统的 CPU 上运行的逻辑是允许多个进程(实际上…

    2026年9月22日
    000
  • ​​VSCode高手才知道的骚操作!学会这些技巧开发快人一步​​

    掌握VSCode效率核心在于命令面板、自定义快捷键、多光标编辑、代码片段与扩展生态;通过减少鼠标依赖、实现快速跳转与自动化操作,构建专属高效开发环境,让注意力聚焦于代码思维而非工具操作。 VSCode里那些让你效率翻倍的“骚操作”,本质上是将开发流程中的重复性、高频操作进行极致的简化与自动化。它不是…

    2026年9月22日
    400
  • 工信部批复:eSIM 手机业务全网开通,暂不支持线上方式

    10 月 14 日消息,据 c114 通讯网报道,中国电信、中国联通与中国移动已于今日正式获得批准,可开展 esim 手机运营服务的商用试验。 根据三大运营商公布的相关信息,eSIM 手机服务将覆盖全国 31 个省、自治区及直辖市,并正式进入市场销售阶段。 需要注意的是,在此次商用试验阶段,暂不支持…

    2026年9月22日
    000
  • CanvaPro中AI生成图片如何导出为PDF?快速保存图像的方法

    在Canva Pro中导出AI生成图片为PDF,需先将图片添加至设计,点击“分享”→“下载”→选择“PDF标准”或“PDF打印”即可。2. PDF标准适用于在线分享,文件小、加载快;PDF打印适用于高质量印刷,支持300 DPI和CMYK色彩模式,确保色彩准确与细节清晰。3. 为保证AI图片导出质量…

    2026年9月22日
    200
  • Laravel 文件上传:解决数据库存储物理路径而非可访问 URL 的问题

    本教程旨在解决 laravel 文件上传后,数据库中存储文件物理路径而非可访问 url 的常见问题。通过分析 move() 方法的返回值,并引入 url() 辅助函数,我们将演示如何正确地将文件移动到指定目录,同时确保数据库记录的是可供前端访问的图片资源链接,从而避免图片无法正常显示。 在 Lara…

    2026年9月22日
    100
  • windows怎么更改计算机工作组_Windows计算机工作组修改方法

    首先通过系统属性修改工作组名称,右键“此电脑”选择属性,进入高级系统设置的计算机名选项卡进行更改并重启;其次可用管理员命令提示符执行wmic命令批量配置,输入指定命令后重启生效;最后专业版用户可通过组策略编辑器,在启动脚本中添加指令实现自动加入工作组。 如果您需要将Windows计算机加入或更改到特…

    2026年9月22日
    100
  • 机械键盘轴体深度手感分析:线性轴、段落轴与提前段落轴

    机械键盘手感取决于轴体类型,主流分为线性轴、段落轴和提前段落轴。线性轴直上直下顺滑连贯,代表如Cherry MX Red,适合游戏与快速输入;段落轴中程有明显阻力峰,提供清晰反馈,如Cherry MX Blue,适合文字工作;提前段落轴起步阻力大随后变轻,如TTC Gold Pink,防误触且节奏独…

    2026年9月22日
    000
  • 实现Java双向路径搜索的正确方法

    本文旨在帮助开发者理解并正确实现Java中的双向路径搜索算法。通过分析常见的实现错误,我们将提供一种清晰、可行的解决方案,并详细解释如何构建完整的路径,克服单向搜索树的局限性,从而实现从起点到终点的完整路径搜索。 双向路径搜索是一种优化路径搜索效率的策略,它同时从起点和终点开始搜索,并在中间相遇。然…

    2026年9月22日
    1000
  • VSCode设置Markdown写作环境(实用技巧,排版美化指南)

    要在vscode里打造舒服又高效的markdown写作环境,答案是通过安装核心扩展并进行个性化配置来实现;需安装markdown all in one、markdown preview enhanced、prettier和paste image等扩展,结合settings.json中的编辑器设置、自…

    2026年9月22日
    200
  • 如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南

    如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南如何用Filmora制作高质量AI视频?简易AI视频剪辑的实用指南

    Filmora的AI功能通过AI Copilot脚本生成、AI文本转视频、AI语音、图像生成、智能抠像及音频优化等工具,显著提升视频制作效率与专业度,尤其在视觉处理、听觉优化和创意辅助方面表现突出;关键在于将AI作为辅助起点,避免过度依赖,结合人工精修,才能实现高质量AI视频创作。 ☞☞☞AI 智能…

    2026年9月22日 用户投稿
    500

发表回复

登录后才能评论
关注微信