一阶优化算法启发，北大林宙辰团队提出具有万有逼近性质的神经网络架构的设计方法

程序猿 • 2025年11月7日 10:20:57 • 科技 • 阅读 0

神经网络作为深度学习技术的基础已经在诸多应用领域取得了有效成果。在实践中，网络架构可以显著影响学习效率，一个好的神经网络架构能够融入问题的先验知识，确立网络训练，提高计算效率。目前，经典的网络架构设计方法包括人工设计、神经网络架构搜索（NAS）[1]、以及基于优化的网络设计方法 [2]。人工设计的网络架构如 ResNet 等；神经网络架构搜索则通过搜索或强化学习的方式在搜索空间中寻找最佳网络结构；基于优化的设计方法中的一种主流范式是算法展开（algorithm unrolling），该方法通常在有显式目标函数的情况下，从优化算法的角度设计网络结构。这些方法在优化算法的角度设计网络结构时，从优化算法的角度设计网络结构。

现今有经典神经网络架构设计大多忽略了网络的万有逼近性——这是神经网络具备强大性能的关键因素之一。因此，这些设计方法在一定程度上失去了网络的先验性能保障。尽管两层神经网络在宽度趋于无穷的时候已具有万有逼近性质 [3]，在实际中，我们通常只能考虑有限宽度的网络结构，这方面的表现分析的结果十分有限。实际上，启发性的人工设计，还是黑匣性质的神经网络架构搜索，都很难在网络设计中考虑万有逼近性质。基于优化的神经网络设计虽然相对更具解释性，但其通常需要一个明显的目标函数，这使得设计的网络结构种类有限，限制了其应用范围。如何系统性地设计工具有万有逼近性质的神经网络架构，仍然是一个重要的问题。

北京大学林宙辰教授团队提出了一种基于优化算法设计工具的神经网络架构，该方法通过将基于梯度的一阶优化算法与基于哈希的二阶优化算法相结合，提高了训练速度和收敛性能，并且增强了神经网络的鲁棒性保障。该神经网络模块也可用于现有基于模块化的网络设计方法，并且不断提高了模型的表现。最近，他们通过分析神经网络微分方程（NODE）的逼近性质，证明了跨层连接的神经网络具有万有近似性质，并利用提出的框架设计了ConvNext、ViT等变种网络，取得了超越baseline的结果。该论文被人工智能顶刊TPAMI接收。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文：Designing Universally-Approximating Deep Neural Networks: A First-Order Optimization Approach论文地址：https://ieeexplore.ieee.org/document/10477580

方法简介

传统的基于优化的神经网络设计方法常常从一个具有显式表达式的目标函数出发，采用特定的优化算法进行求解，再将优化结果映射为神经网络结构，例如著名的 LISTA-NN 就是利用 LISTA 算法求解 LASSO 问题所得到的显式表达式，将优化结果转化为神经网络结构 [4]。这种方法对于目标函数的显式表达式有着很强的依赖性，因此所得到的网络结构只能针对目标函数的显式表达式进行优化，存在着设计出不符合实际情况的假设的风险。一些研究者尝试通过自定义目标函数，再利用算法展开等方法设计网络结构，但他们也需要如权重重绑定等实际情况下不一定符合假设的假设。因此，一些研究者提出使用基于神经网络的进化算法进行网络架构搜索，来获取更加合理的网络结构。

网络架构设计方案的更新格式应遵循从一阶优化算法到更近点算法的思路，进行逐步优化。例如，可以将欧拉角算法改为四元数算法，或者采用更加高效的迭代算法来近似求解。更新格式应考虑增加计算精度和提高运行效率。

其中、表示第 k 步更新时的（步长）系数，再将梯度项替换为神经网络中的可学习模块 T，即可得到 L 层神经网络的骨架：

整体方法框架见图 1。

图 1 网络设计图示

论文提出的方法可以启发设计 ResNet、DenseNet 等经典网络，并且解决了传统基于优化设计网络架构的方法局限于特定目标函数的问题。

模块选取与架构细节

该方法所设计的网络模块 T 只要求有包含两层网络结构，即，作为其子结构，即可保证所设计的网络具有万有逼近性质，其中所表达的层的宽度是有限的（即不随逼近精度的提高而增长），整个网络的万有逼近性质不是靠加宽的层来获得的。模块 T 可以是 ResNet 中广泛运用的 pre-activation 块，也可以是 Transformer 中的注意力 + 前馈层的结构。T 中的激活函数可以是 ReLU、GeLU、Sigmoid 等常用激活函数。还可以根据具体任务在中添加对应的归一化层。另外，时，设计的网络是隐式网络 [5]，可以用不动点迭代的方法逼近隐格式，或采用隐式微分（implicit differentiation）的方法求解梯度进行更新。

通过等价表示设计更多网络

该方法不要求同一种算法只能对应一种结构，相反，该方法可以利用优化问题的等价表示设计更多的网络架构，体现其灵活性。例如，线性化交替方向乘子法通常用于求解约束优化问题：通过令即可得到一种可启发网络的更新迭代格式：

其启发的网络结构可见图 2。

图 2 线性化交替方向乘子法启发的网络结构

启发的网络具有万有逼近性质

问问小宇宙

问问小宇宙是小宇宙团队出品的播客AI检索工具

77 查看详情

对该方法设计的网络架构，可以证明，在模块满足此前条件以及优化算法（在一般情况下）稳定、收敛的条件下，任意一阶优化算法启发的神经网络在高维连续函数空间具有万有逼近性质，并给出了逼近速度。论文首次在有限宽度设定下证明了具有一般跨层连接的神经网络的万有逼近性质（此前研究基本集中在 FCNN 和 ResNet，见表 1），论文主定理可简略叙述如下：

主定理（简略版）：设 A 是一个梯度型一阶优化算法。若算法 A 具有公式 (1) 中的更新格式，且满足收敛性条件（优化算法的常用步长选取均满足收敛性条件。若在启发网络中均为可学习的，则可以不需要该条件），则由算法启发的神经网络：

在连续（向量值）函数空间以及范数下具有万有逼近性质，其中可学习模块 T 只要有包含两层形如的结构（σ 可以是常用的激活函数）作为其子结构都可以。

常用的 T 的结构如：

1）卷积网络中，pre-activation 块：BN-ReLU-Conv-BN-ReLU-Conv (z),

2）Transformer 中：Attn (z) + MLP (z+Attn (z)).

主定理的证明利用了 NODE 的万有逼近性质以及线性多步方法的收敛性质，核心是证明优化算法启发设计的网络结构恰对应一种收敛的线性多步方法对连续的 NODE 的离散化，从而启发的网络 “继承” 了 NODE 的逼近能力。在证明中，论文还给出了 NODE 逼近 d 维空间连续函数的逼近速度，解决了此前论文 [6] 的一个遗留问题。

表 1 此前万有逼近性质的研究基本集中在 FCNN 和 ResNet

实验结果

论文利用所提出的网络架构设计框架设计了 8 种显式网络和 3 种隐式网络（称为 OptDNN），网络信息见表 2，并在嵌套环分离、函数逼近和图像分类等问题上进行了实验。论文还以 ResNet, DenseNet, ConvNext 以及 ViT 为 baseline，利用所提出的方法设计了改进的 OptDNN，并在图像分类的问题上进行实验，考虑准确率和 FLOPs 两个指标。

表 2 所设计网络的有关信息

首先，OptDNN 在嵌套环分离和函数逼近两个问题上进行实验，以验证其万有逼近性质。在函数逼近问题中，分别考虑了逼近 parity function 和 Talgarsky function，前者可表示为二分类问题，后者则是回归问题，这两个问题都是浅层网络难以逼近的问题。OptDNN 在嵌套环分离的实验结果如图 3 所示，在函数逼近的实验结果如图 3 所示，OptDNN 不仅取得了很好的分离 / 逼近结果，而且比作为 baseline 的 ResNet 取得了更大的分类间隔和更小的回归误差，足以验证 OptDNN 的万有逼近性质。

图 3 OptNN 逼近 parity function

图 4 OptNN 逼近 Talgarsky function

然后，OptDNN 分别在宽 – 浅和窄 – 深两种设定下在 CIFAR 数据集上进行了图像分类任务的实验，结果见表 3 与 4。实验均在较强的数据增强设定下进行，可以看出，一些 OptDNN 在相同甚至更小的 FLOPs 开销下取得了比 ResNet 更小的错误率。论文还在 ResNet 和 DenseNet 设定下进行了实验，也取得了类似的实验结果。

表 3 OptDNN 在宽 – 浅设定下的实验结果

表 4 OptDNN 在窄 – 深设定下的实验结果

论文进一步选取了此前表现较好的 OptDNN-APG2 网络，进一步在 ConvNext 和 ViT 的设定下在 ImageNet 数据集上进行了实验，OptDNN-APG2 的网络结构见图 5，实验结果表 5、6。OptDNN-APG2 取得了超过等宽 ConvNext、ViT 的准确率，进一步验证了该架构设计方法的可靠性。

图 5 OptDNN-APG2 的网络结构

表 5 OptDNN-APG2 在 ImageNet 上的性能比较

表 6 OptDNN-APG2 与等宽（isotropic）的 ConvNeXt 和 ViT 的性能比较

最后，论文依照 Proximal Gradient Descent 和 FISTA 等算法设计了 3 个隐式网络，并在 CIFAR 数据集上和显式的 ResNet 以及一些常用的隐式网络进行了比较，实验结果见表 7。三个隐式网络均取得了与先进隐式网络相当的实验结果，也说明了方法的灵活性。

表 7 隐式网络的性能比较

总结

神经网络架构设计是深度学习中的核心问题之一。论文提出了一个利用一阶优化算法设计具有万有逼近性质保障的神经网络架构的统一框架，拓展了基于优化设计网络架构范式的方法。该方法可以与现有大部分聚焦网络模块的架构设计方法相结合，可以在几乎不增加计算量的情况下设计出高效的模型。在理论方面，论文证明了收敛的优化算法诱导的网路架构在温和条件下即具有万有逼近性质，并弥合了 NODE 和具有一般跨层连接网络的表示能力。该方法还有望与 NAS、 SNN 架构设计等领域结合，以设计更高效的网络架构。

以上就是一阶优化算法启发，北大林宙辰团队提出具有万有逼近性质的神经网络架构的设计方法的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/423265.html

design 数据模型

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

物联网传感器和人工智能如何彻底改变智能建筑

上一篇 2025年11月7日 10:20:42

Js-pytorch：开启前端+AI新世界

下一篇 2025年11月7日 10:21:20

好文分享

CSS3实现Material Design的示例代码分享

不断更新中预览这是一个正在完善的css文件，是对原生组件基于标签属性做了美化，对datepicker,select等无法用css实现的暂不考虑在本文内。按钮 Button 初始按钮 button red orange blue green link 描边按钮 button red orange…

程序猿
2025年12月23日
0000
好文分享

动态生成HTML表格：优化JavaScript数据展示与导出

本文旨在解决JavaScript中动态生成HTML表格时遇到的代码冗余和样式控制难题。通过引入数据驱动的编程思想，我们将数据与视图逻辑分离，首先将表格内容组织为JavaScript对象数组，然后利用一个通用的函数将这些结构化数据渲染为可读性强、易于维护且支持灵活样式的HTML表格字符串。这种方法不仅…

程序猿
2025年12月23日
0000
好文分享

HTML5性能优化怎么实现_HTML5新特性在性能优化方面的应用方法

HTML5通过语义化标签、Web Storage、Canvas/SVG、Service Worker和原生媒体支持等技术提升性能：1. 语义化标签优化渲染效率；2. Web Storage减少网络请求；3. Canvas/SVG降低资源加载量；4. Service Worker实现离线缓存；5. 原…

程序猿
2025年12月23日
0000
好文分享

利用UTM参数与GTM优化链接点击来源追踪

本文详细阐述了如何通过UTM参数精准追踪营销链接的点击来源，并深入探讨了Google Tag Manager (GTM) 在此过程中的高级应用。文章首先介绍了UTM参数的构成、生成方法及其在Google Analytics中的自动解析机制，强调其在识别流量来源方面的核心作用。随后，探讨了GTM如何通…

程序猿
2025年12月23日
0000
好文分享

如何通过HTML在线展示数据_HTML在线数据展示实现与可视化方案

网页展示数据需结合HTML、CSS与JavaScript，首选table展示结构化数据，配合Chart.js等库实现可视化图表，通过fetch加载远程JSON动态渲染内容，并利用响应式设计与交互优化提升用户体验。在网页中展示数据，核心是将结构化信息清晰、直观地呈现给用户。HTML本身是内容载体，结…

程序猿
2025年12月23日
0000
好文分享

html在线几何图形绘制 html在线SVG应用实战教程

使用HTML与SVG结合可高效绘制几何图形。SVG基于XML，支持圆形、矩形、多边形、路径等，在任意分辨率下清晰。1. 基础元素包括rect、circle、ellipse、line、polygon、polyline和path。2. 实战示例：用polygon绘制三角形，path绘制五角星和弧线仪表盘…

程序猿
2025年12月23日
0000
好文分享

单页应用（SPA）中特定分类数据的API直链访问与性能考量

针对单页应用（SPA），本文探讨了如何通过URL直接访问特定分类数据，而非依赖客户端UI交互。文章揭示了SPA在初始加载时已获取所有数据，因此客户端分类选择对数据加载量无影响。核心策略是绕过前端界面，直接调用后端API获取所需数据，从而实现高效且精准的数据访问，并提供了具体API示例。理解单页应用…

程序猿
2025年12月23日
1000
好文分享

jQuery循环中动态表格数据访问与比较教程

本文详细介绍了在jQuery循环中处理动态生成表格数据时常见的挑战与解决方案。我们将探讨如何正确使用.find()代替.children()来定位嵌套元素，解决.data()方法返回数字类型导致比较错误的问题，并提供一个基于事件监听的实用示例，以实现对用户修改数据的实时检测和保存。动态表格数据处理…

程序猿
2025年12月22日
0000
揭秘canvas技术在数据可视化中的独特威力

发现Canvas技术在数据可视化中的独特作用随着数据时代的到来，数据可视化成为了一种重要的方式来呈现大量的数据。在数据可视化中，Canvas技术以其独特的优势在各个领域展示了巨大的潜力。本文将着重介绍Canvas技术在数据可视化中的独特作用，并给出具体的代码示例。 Canvas是HTML5中的一个…

程序猿
好文分享 2025年12月21日
0000
好文分享

使用localstorage存储数据所需的包有哪些？

localstorage是HTML5中的一项重要技术，它可以用来在客户端本地存储数据。在使用localstorage存储数据之前，我们需要确保在代码中引入合适的包来操作这个功能。在使用localstorage之前，我们需要在HTML文件中添加以下代码来引入localstorage的相关包：在以上…

程序猿
2025年12月21日
0000
好文分享

无法将数据保存到localstorage，为什么？

为什么我的数据无法保存到localstorage中？本文将详细讨论为何在某些情况下，数据无法保存到本地存储(localstorage)中。同时，我将提供一些具体的代码示例以帮助您解决这个问题。首先，让我们来了解一下什么是localstorage。localstorage是HTML5中引入的一种W…

程序猿
2025年12月21日
0000
好文分享

如何将HTML表单数据作为文本并发送到html2pdf？

html2pdf 是一个 JavaScript 包，允许开发人员将 html 转换为 canvas、pdf、图像等。它将 html 作为参数并将其添加到 pdf 或所需文档中。此外，它还允许用户在添加 html 内容后下载该文档。在这里，我们将访问表单并使用html2pdf npm包将其添加到pd…

程序猿
2025年12月21日
0000
HTML中如何用post提交数据

http/1.1 协议规定的 http 请求方法有 options、get、head、post、put、delete、trace、connect 这几种。其中 post 一般用来向服务端提交数据，本文主要讨论 post 提交数据的几种方式 http/1.1 协议规定的 http 请求方法有 opti…

程序猿
好文分享 2025年12月21日
0000
html的盒模型详解

这次给大家带来html的盒模型详解，使用html盒模型的注意事项有哪些，下面就是实战案例，一起来看一下。 1.1. 盒的内容区的尺寸— content width和content height —取决于几个因素： –生成该盒的元素是否设置了’width’或&#82…

程序猿
好文分享 2025年12月21日
0000
服务端主动发送数据回客户端在H5里的实现步奏

我们知道，在server sent event里，通过eventsource对象接收服务器发送事件的通知是有三个事件的，message, open, error这三种，今天就给大家演示一下服务端主动发送数据回客户端在h5里的实现步奏。 Server Sent Event Server Sent Ev…

程序猿
好文分享 2025年12月21日
0000
好文分享

可视化图表制作_javascript数据展示

答案是使用JavaScript库如Chart.js、D3.js和ECharts可实现交互式数据可视化；其中Chart.js适合快速集成常见图表，D3.js适用于高度自定义的复杂图形，ECharts支持高级图表且中文文档完善；以Chart.js创建柱状图需引入库、添加canvas容器并初始化Chart…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS：深入理解订单与现金支付明细并高效调试

本教程旨在指导odoo 14 pos开发者如何准确读取销售会话中的订单及其现金支付明细，并计算总现金支付金额。文章将详细介绍odoo前端数据模型的访问方法，并着重强调利用浏览器开发者工具和`debugger`关键字进行运行时对象结构检查与调试的最佳实践，帮助开发者高效解决数据访问中的常见问题。 Od…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS会话中现金支付金额的准确获取与调试指南

针对odoo 14 pos会话中读取订单并计算现金支付总额的需求，本文将详细指导如何正确访问支付明细对象属性。重点介绍利用浏览器开发者工具设置断点进行实时调试的方法，帮助开发者深入理解数据结构，从而高效准确地实现功能，避免因属性名称不匹配而导致的常见问题。 1. 理解Odoo POS数据模型在Od…

程序猿
2025年12月21日
0000
好文分享

javascript_如何实现数据可视化

JavaScript实现数据可视化需将数据转为图形，常用Chart.js、D3.js等库快速构建图表，或用Canvas/SVG原生绘图；通过fetch获取数据并动态更新视图，如Chart.js调用update()刷新，最终实现交互式可视化。 JavaScript 实现数据可视化，核心是将数据转换成图…

程序猿
2025年12月21日
0000
好文分享

Ionic 应用在浏览器刷新时状态持久化策略

当 ionic 应用在浏览器中被刷新时，浏览器会执行完整的页面重载，导致应用状态和数据丢失。本文旨在阐明为何无法阻止浏览器进行全面重载，并提供一个专业的解决方案：利用 capacitor preferences 等客户端存储机制来持久化关键应用状态和数据，确保在浏览器刷新后也能恢复应用到预期状态，从…

程序猿
2025年12月21日
1000