ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

本文是一篇关于提高零阶优化的扩展性的研究,代码已开源,论文已被 iclr 2024 接收。

今天我要介绍一篇题为“DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training”的论文,它由密歇根州立大学和劳伦斯·利弗莫尔国家实验室合作完成。这篇论文最近被ICLR 2024会议接收,并且研究团队已经将代码开源。该论文的主要目标是在深度学习模型训练中扩展零阶优化技术。零阶优化是一种不依赖梯度信息的优化方法,它可以更好地处理高维参数空间和复杂的模型结构。然而,现有的零阶优化方法在处理深度学习模型时面临着规模和效率方面的挑战。为了解决这些挑战,研究团队提出了DeepZero框架。该框架通过引入新的采样策略和自适应调整机制,能够高效地处理大规模深度学习模型的训练。DeepZero利用了零阶优化的优势,并结合了分布式计算和并行化技术,以加速训练过

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

论文地址:https://arxiv.org/abs/2310.02025

项目地址:https://www.optml-group.com/posts/deepzero_iclr24

1. 背景

零阶(Zeroth-Order, ZO)优化已成为解决机器学习(Machine Learning)问题的热门技术,特别是在一阶(First-Order, FO)信息难以或无法获得的情况下:

物理学和化学等学科:机器学习模型可能与复杂的模拟器或实验相互作用,其中底层系统是不可求导的。

黑盒学习场景:当深度学习(Deep Learning)模型与第三方 API 集成时,如针对黑盒深度学习模型的对抗性攻击和防御,以及语言模型服务的黑盒提示学习。

硬件限制:用于计算一阶梯度的原理性反向传播(backpropagation)机制在硬件系统上实现深度学习模型时可能不受支持。

然而,目前零阶优化的可扩展性仍然是一个未解决的问题:其使用主要限于相对较小规模的机器学习问题,如样本级的对抗性攻击生成。随着问题维度的增加,传统零阶方法的准确性和效率会下降。这是因为基于零阶有限差分的梯度估计是一阶梯度的有偏估算,且在高维空间中偏差更加明显。这些挑战激发了本文讨论的核心问题:如何扩展零阶优化使其可以训练深度学习模型?

2. 零阶梯度估算:RGE 还是 CGE?

零阶优化器仅通过提交输入和接收相应的函数值与目标函数进行交互。主要有两种梯度估算方法:坐标梯度估算(Coordinate Gradient Estimation, CGE)和随机梯度估算(Random Gradient Estimation, RGE),如下所示:

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

其中ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero表示对优化变量ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero(例如,神经网络的模型参数)的一阶梯度的估算。

在(RGE)中,ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero表示随机扰动向量,例如,从标准高斯分布中抽取;ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero是扰动大小(又称平滑参数);q 是用于获得有限差分的随机方向数。

在(CGE)中,ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero表示标准基向量,ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero提供了ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero在对应坐标的偏导数的有限差分估计。

与 CGE 相比,RGE 具有可以减少函数评估次数的灵活性。尽管查询效率高,但 RGE 在从头开始训练深度模型时是否能提供令人满意的准确性仍不确定。为此,我们进行了调查,其中我们使用 RGE 和 CGE 对不同大小的小型卷积神经网络(CNN)在 CIFAR-10 上进行了训练。如下图所示,CGE 可以实现与一阶优化训练相当的测试精度,并显著优于 RGE,同时也比 RGE 具有更高的时间效率。

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

基于 CGE 在准确性和计算效率方面相对于 RGE 的优势,我们选择 CGE 作为首选的零阶梯度估计器。然而,CGE 的查询复杂性仍然是一个瓶颈,因为它随模型大小增加而扩大。

3. 零阶深度学习框架:DeepZero

据我们所知,之前的工作没有展示出 ZO 优化在训练深度神经网络(DNN)时不会显著降低性能的有效性。为了克服这一障碍,我们开发了 DeepZero,一种原理性零阶优化深度学习框架,可以将零阶优化扩展到从头开始的神经网络训练。

a) 零阶模型修剪(ZO-GraSP):一个随机初始化的密集神经网络往往包含一个高质量的稀疏子网络。然而,大多数有效的修剪方法都包含模型训练作为中间步骤。因此,它们不适合通过零阶优化找到稀疏性。为了解决上述挑战,我们受到了无需训练的修剪方法的启发,称为初始化修剪。在这类方法中,梯度信号保留(GraSP)被选用,它是一种通过随机初始化网络的梯度流识别神经网络的稀疏性先验的方法。

b) 稀疏梯度:为了保留训练密集模型的准确性优势,在 CGE 中我们结合了梯度稀疏性而不是权重稀疏性。这确保了我们在权重空间中训练一个密集模型,而不是训练一个稀疏模型。具体而言,我们利用 ZO-GraSP 确定可以捕获 DNN 可压缩性的逐层修剪比率(Layer-wise Pruning Ratios, LPRs),然后零阶优化可以通过不断迭代更新部分模型参数权重来训练密集模型,其中稀疏梯度比率由 LPRs 确定。

c) 特征重用:由于 CGE 逐元素扰动每个参数,它可以重用紧接扰动层之前的特征,并执行剩余的前向传播操作,而不是从输入层开始。从经验上看,带有特征重用的 CGE 在训练时间上可以实现 2 倍以上的减少。

今天学点啥 今天学点啥

秘塔AI推出的AI学习助手

今天学点啥 258 查看详情 今天学点啥

d) 前传并行化:CGE 支持模型训练的并行化。这种解耦特性使得通过分布式机器扩展前向传播成为可能,从而显著提高零阶训练速度。

4. 实验分析

a) 图像分类

在 CIFAR-10 数据集上,我们将 DeepZero 训练的 ResNet-20 与两种通过一阶优化训练的变体进行比较:

(1)通过一阶优化训练获得的密集 ResNet-20

(2)通过一阶优化训练通过 FO-GraSP 获得的稀疏 ResNet-20

如下图所示,尽管在 80% 至 99% 的稀疏区间中,与(1)相比,使用 DeepZero 训练的模型仍存在准确度差距。这突出了 ZO 优化用于深度模型训练的挑战,其中高稀疏度的实现是被期望的。值得注意的是,在 90% 至 99% 的稀疏区间中,DeepZero 优于(2),展示了 DeepZero 中梯度稀疏性相对于权重稀疏性的优越性

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

b) 黑箱防御

当模型的所有者不愿意与防御者共享模型细节时,会出现黑盒防御问题。这对于使用一阶优化训练直接增强白盒模型的现有鲁棒性增强算法构成了挑战。为了克服这一挑战,ZO-AE-DS 被提出,在白盒去噪平滑(Denoised Smoothing, DS)防御操作和黑盒图像分类器之间引入了自动编码器(AutoEncoder, AE),以解决 ZO 训练的维度挑战。ZO-AE-DS 的缺点是难以扩展到高分辨率数据集(例如,ImageNet),因为使用 AE 会损害输入到黑盒图像分类器的图像的保真度,并导致较差的防御性能。相比之下,DeepZero 可以直接学习与黑盒分类器集成的防御操作,无需自动编码器。如下表所示,就认证准确率(Certified Accuracy, CA)而言 DeepZero 在所有输入扰动半径上始终优于 ZO-AE-DS。

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

c) 与仿真耦合的深度学习

数值方法在提供物理信息模拟方面不可或缺,但它们自身存在挑战:离散化不可避免地产生数值误差。通过与迭代偏微分方程(Partial Differential Equation, PDE)求解器的循环交互训练纠正神经网络的可行性,被称为” 求解器环路”(Solver-in-the-Loop, SOL)。虽然现有工作专注于使用或开发可微模拟器进行模型训练,我们通过利用 DeepZero 扩展了 SOL,使其能够与不可微或黑盒模拟器一起使用。下表比较了 ZO-SOL(通过 DeepZero 实现)与三种不同的可微方法的测试误差纠正性能:

(1) SRC(低保真模拟无误差纠正);

(2) NON(非交互式训练,使用预生成的低和高保真模拟数据在模拟循环外进行);

(3) FO-SOL(给定可微模拟器时,用于 SOL 的一阶训练)。

每个测试模拟的误差计算为与高保真模拟相比的纠正模拟的平均绝对误(MAE)。结果表明,通过 DeepZero 实现的 ZO-SOL 在只有基于查询的模拟器访问权限的情况下依然优于 SRC 和 NON,并缩小了与 FO-SOL 的性能差距。与 NON 相比,ZO-SOL 的表现突显了在有黑盒模拟器集成时的 ZO-SOL 前景。

ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero

5. 总结与讨论

这篇论文介绍了一个深度网络训练中零阶优化深度学习框架 (DeepZero)。具体来说,DeepZero 将坐标梯度估计、零阶模型修剪带来的梯度稀疏性、特征重用以及前传并行化整合到统一的训练流程中。利用这些创新,DeepZero 在包括图像分类任务和各种实际黑箱深度学习场景中表现出了效率和有效性。此外,还探索了 DeepZero 在其他领域的适用性,如涉及不可微物理实体的应用,以及在计算图和反向传播的计算不被支持的设备上进行训练。

作者介绍

张益萌,密歇根州⽴⼤学 OPTML 实验室, 计算机博士在读, 研究兴趣⽅向包括 Generative AI,  Multi-Modality,  Computer Vision,  Safe AI,  Efficient AI。

以上就是ICLR 2024 | 首个零阶优化深度学习框架,MSU联合LLNL提出DeepZero的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/426942.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
小米14 Pro电池掉电快怎么修 小米14 Pro续航提升技巧
上一篇 2025年11月7日 12:10:32
《星塔旅人》雾语介绍
下一篇 2025年11月7日 12:10:35

相关推荐

  • 如何使用Optuna优化AI大模型训练?自动化调参的详细教程

    如何使用Optuna优化AI大模型训练?自动化调参的详细教程如何使用Optuna优化AI大模型训练?自动化调参的详细教程如何使用Optuna优化AI大模型训练?自动化调参的详细教程如何使用Optuna优化AI大模型训练?自动化调参的详细教程

    Optuna通过智能搜索与剪枝机制,显著提升AI大模型超参数优化效率。它以目标函数封装训练流程,利用TPE等算法智能采样,结合ASHA等剪枝策略,在分布式环境下高效搜索最优配置,同时提供可复现性与可视化分析,降低调参成本。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 Dee…

    2026年9月23日 用户投稿
    100
  • VSCode高效配置Elixir:Phoenix框架、中文提示、模式匹配

    要高效配置vscode支持elixir开发,必须安装elixirls扩展并确保elixir和erlang环境正确;elixirls提供代码补全、跳转、格式化和调试功能,配合手动设置.heex、.leex文件关联为html可优化phoenix框架开发体验;通过安装中文语言包、设置files.encod…

    2026年9月23日
    200
  • 如何设置Linux用户会话超时 TMOUT环境变量详细配置

    如何设置Linux用户会话超时 TMOUT环境变量详细配置如何设置Linux用户会话超时 TMOUT环境变量详细配置如何设置Linux用户会话超时 TMOUT环境变量详细配置如何设置Linux用户会话超时 TMOUT环境变量详细配置

    tmout是bash shell用于设置用户会话超时的环境变量,单位为秒,常用方法包括:1. 临时设置通过执行export tmout=300仅对当前终端生效;2. 全局设置在/etc/profile中添加export tmout=600需root权限并执行source生效;3. 针对特定用户修改其…

    2026年9月22日 用户投稿
    000
  • Swift 3到5.1新特性整理

    tocSwift 5.1Swift 5.0Result类型Raw string自定义字符串插值动态可调用类型处理未来的枚举值从try?抹平嵌套可选检查整数是否为偶数字典compactMapValues()方法撤回的功能: 带条件的计数Swift 4.2CaseIterable协议警告和错误指令动态查…

    2026年9月22日
    100
  • VSCode高效配置Node.js:npm集成、中文报错、断点调试

    答案:高效配置VSCode与Node.js需确保Node.js和npm为最新版,利用集成终端运行命令,通过jsconfig.json或tsconfig.json优化项目配置,解决中文乱码需设置终端编码为UTF-8并选择支持中文的字体,调试核心是正确配置launch.json文件,使用pwa-node…

    2026年9月22日
    500
  • 如何使用DeepSpeed训练AI大模型?大规模模型训练的优化技巧

    DeepSpeed通过ZeRO等技术突破显存限制,实现大模型高效训练。它采用ZeRO-1/2/3分级优化,分别对优化器状态、梯度和参数进行分区,显著降低单卡显存占用;结合混合精度、梯度累积和CPU/NVMe卸载进一步节省资源。同时集成流水线并行与张量并行,支持多维并行策略协同,使万亿参数模型训练在普…

    2026年9月22日
    200
  • TensorFlow的AI混合工具怎么操作?构建机器学习模型的详细步骤

    TensorFlow的混合编程核心在于结合Keras的高级抽象与TensorFlow底层API的灵活性,实现高效模型开发。首先使用tf.data构建高性能数据管道,通过map、batch、shuffle和prefetch等操作优化数据预处理;接着利用Keras快速搭建模型结构,同时通过继承tf.ke…

    2026年9月21日
    400
  • google浏览器开发者工具怎么打开_google浏览器打开开发者工具方法

    1、使用F12或Ctrl+Shift+I快捷键可快速打开开发者工具;2、右键点击页面元素选择“检查”能直接定位HTML节点;3、通过浏览器右上角菜单进入“更多工具”-“开发者工具”也可启动;4、在地址栏输入chrome://inspect可管理远程设备调试并打开对应开发者工具窗口。 如果您在使用 G…

    2026年9月21日
    200
  • Linux命令行如何查看登录用户

    Linux命令行如何查看登录用户Linux命令行如何查看登录用户Linux命令行如何查看登录用户Linux命令行如何查看登录用户

    答案是 who、w 和 users 命令用于查看Linux系统登录用户,其中 who 显示登录用户及终端信息,w 还显示用户正在执行的命令和系统负载,users 仅输出用户名列表。 在Linux命令行下,要查看当前系统上有哪些用户登录,最直接、最常用的命令包括 who 、 w 和 users 。它们…

    2026年9月21日 用户投稿
    200
  • 蒙古开放世界游戏试玩获赞:马匹体验比大镖客2还好!

    蒙古开放世界游戏试玩获赞:马匹体验比大镖客2还好!蒙古开放世界游戏试玩获赞:马匹体验比大镖客2还好!蒙古开放世界游戏试玩获赞:马匹体验比大镖客2还好!蒙古开放世界游戏试玩获赞:马匹体验比大镖客2还好!

    由Aesir Interactive与NightinGames联合开发的开放世界新作《The Legend of Khiimori》已在Steam平台上线试玩版本,预计将于明年3月3日正式发售。 近日,国外媒体pcgamesn发布了该游戏的初步体验评测,并给予高度评价:“其骑马机制的表现力甚至超越了…

    2026年9月20日 用户投稿
    000
  • 《书店模拟器》攻略——游戏特色内容介绍

    《书店模拟器》攻略——游戏特色内容介绍《书店模拟器》攻略——游戏特色内容介绍《书店模拟器》攻略——游戏特色内容介绍《书店模拟器》攻略——游戏特色内容介绍

    《书店模拟器》(bookshop simulator)是由blep games开发并发行的一款温暖治愈的模拟经营类游戏。游戏中包含丰富的玩法元素,玩家可以通过赚取利润来装修店面、扩展空间,并雇佣店员协助运营。还能收集拥有特殊力量的古老珍本书籍,甚至收养一只猫咪,让它成为你和顾客之间的温馨纽带! 《书…

    2026年9月20日 用户投稿
    100
  • VSCode的悬浮提示信息如何自定义?

    通过JSDoc或docstring添加注释可直接影响VSCode悬浮提示内容,如JavaScript/TypeScript中使用/* /格式、Python中使用三引号文档字符串,配合Pylance等扩展增强显示;安装语言支持扩展可提升提示丰富度;高级场景可通过开发自定义语言服务器,在textDocu…

    2026年9月20日
    500
  • Linux怎么查看当前登录用户的信息

    whoami显示当前有效用户,who列出登录用户及终端信息,w还显示活动详情,id则查看用户UID、GID和所属组,不同命令适用于身份确认、在线状态、行为监控和权限分析场景。 在Linux系统里,想知道当前是哪个用户在操作,或者还有谁登录着,其实有几个非常直接的命令可以用。简单来说,最快的是 who…

    2026年9月12日
    200
  • 红魔11 Pro系列跑分突破435万:性能最强悍的安卓旗舰

    红魔11 Pro系列跑分突破435万:性能最强悍的安卓旗舰红魔11 Pro系列跑分突破435万:性能最强悍的安卓旗舰红魔11 Pro系列跑分突破435万:性能最强悍的安卓旗舰红魔11 Pro系列跑分突破435万:性能最强悍的安卓旗舰

    10月17日消息,今天下午,红魔11 pro系列正式发布,该机首发搭载高通第五代骁龙8至尊版平台,定位为红魔迄今为止性能最强的电竞旗舰。 除此之外,红魔11 Pro系列还配备了全新升级的红芯R4芯片,并融合红魔专属性能调校技术,实测安兔兔跑分达到4358152分,成为目前安卓阵营中跑分最高、性能最为…

    2026年9月12日 用户投稿
    400
  • 卡拉彼丘手游什么时候公测 公测时间及预下载介绍

    卡拉彼丘手游将于2025年10月23日迎来全平台正式公测,届时安卓与ios用户均可同步下载体验。此外,玩家可在公测前一日(10月22日)开启游戏预下载,提前准备,畅快开局。 以下是关于卡拉彼丘手游公测时间与预下载的详细信息: 一、公测时间安排 正式上线日期:游戏定于2025年10月23日全面开放公测…

    2026年9月12日
    100
  • 刚发布两个月Google称将向Pixel 10推送GPU驱动更新以修复画面问题

    google于2025年8月正式推出pixel 10系列手机,搭载了由其自主研发的tensor g5芯片平台,并集成了imagination提供的img dxt-48-1536移动gpu。 然而自发布以来,大量用户反映该机型在运行部分大型游戏及模拟器应用时存在明显问题,包括帧率波动、频繁掉帧、画面撕…

    2026年9月12日
    000
  • 《冲就完事模拟器2》多平台发售 好评解压续作

    《冲就完事模拟器2》多平台发售 好评解压续作《冲就完事模拟器2》多平台发售 好评解压续作《冲就完事模拟器2》多平台发售 好评解压续作《冲就完事模拟器2》多平台发售 好评解压续作

    开发发行商FuturLab正式宣布,备受玩家喜爱的解压神作续作《冲就完事模拟器2》现已全球上线,同步登陆PC平台(Steam/Epic Games/Microsoft Store)以及PS5和Xbox Series X|S主机。 经典洗刷体验全面升级!本作不仅带来了全新场景地图,还引入了前所未有的清…

    2026年9月12日 用户投稿
    100
  • 英特尔14代酷睿i9-14900K超频潜力全解析

    英特尔14代酷睿i9-14900k的超频最大频率可达6.0ghz以上。优化超频设置需:1.选择高效散热器;2.调整bios中的电压和频率;3.从小幅度超频开始并逐步增加;4.定期更新主板bios。超频对游戏性能有显著影响,但在gpu瓶颈游戏中提升有限。是否值得尝试超频取决于需求和预算,适合追求极致性…

    2026年9月12日
    300
  • 抖音作品浏览量低是什么原因?增加抖音浏览量的方法

    抖音作为当前热门的短视频社交平台,迅速吸引了大量创作者和用户。然而,很多创作者在发布作品后发现,作品的浏览量并不理想,导致曝光率低,影响了内容传播效果。本文将从多个角度分析造成浏览量低的原因,并提出相应的解决策略,以帮助创作者提升作品的曝光度和影响力。 一、抖音作品浏览量低的常见原因 1. 内容质量…

    2026年9月11日
    500
  • 虚拟伴侣AI如何设置陪伴模式 虚拟伴侣AI情感陪伴功能的调试教程

    虚拟伴侣AI如何设置陪伴模式 虚拟伴侣AI情感陪伴功能的调试教程虚拟伴侣AI如何设置陪伴模式 虚拟伴侣AI情感陪伴功能的调试教程虚拟伴侣AI如何设置陪伴模式 虚拟伴侣AI情感陪伴功能的调试教程虚拟伴侣AI如何设置陪伴模式 虚拟伴侣AI情感陪伴功能的调试教程

    启用情感陪伴模式并依次设置响应灵敏度、自定义记忆库、调试语音语调,最后通过情景模拟测试互动稳定性,确保AI回应连贯且富有共情。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 如果您希望虚拟伴侣AI能够提供稳定且贴近真实的情感互动体验,可能需…

    2026年9月11日 用户投稿
    100

发表回复

登录后才能评论
关注微信