字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%

字节跳动豆包大模型团队于近日提出超连接(Hyper-Connections),一种简单有效的残差连接替代方案。面向残差连接的主要变体的局限问题,超连接可通过动态调整不同层之间的连接权重,解决梯度消失和表示崩溃(Representation Collapse)之间的权衡困境。在 Dense 模型和 MoE 模型预训练中,超连接方案展示出显著的性能提升效果,使收敛速度最高可加速 80%。
自从 ResNet 提出后,残差连接已成为深度学习模型的基础组成部分。其主要作用是 —— 缓解梯度消失问题,使得网络的训练更加稳定。
但是,现有残差连接变体在梯度消失和表示崩溃之间存在一种 “跷跷板式” 的权衡,无法同时解决。
为此,字节豆包大模型 Foundation 团队于近日提出超连接(Hyper-Connections),针对上述 “跷跷板式” 困境,实现了显著提升。
该方法适用于大规模语言模型(LLMs)的预训练,在面向 Dense 模型和 MoE 模型的实验中,展示了显著性能提升效果,使预训练收敛速度最高可加速 80%。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%

研究团队还发现,超连接在两个小型的视觉任务中表现同样优异,这表明,该方法在多个领域有广泛的应用前景。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
论文标题:Hyper-Connections
论文链接:https://arxiv.org/pdf/2409.19606

1. 超连接的核心思想
前文提及,残差连接的两种主要变体 Pre-Norm 和 Post-Norm 各自都有其局限性,具体体现如下:
Pre-Norm:在每个残差块之前进行归一化操作,可有效减少梯度消失问题。然而,Pre-Norm 在较深网络中容易导致表示崩溃,即深层隐藏表示过于相似,从而削弱了模型学习能力。
Post-Norm:在残差块之后进行归一化操作,有助于减少表示崩溃问题,但也重新引入梯度消失问题。在 LLM 中,通常不会采用此方法。
超连接的核心思路在于 —— 引入可学习的深度连接(Depth-connections)和宽度连接(Width-connections)。
从理论上,这使得模型不仅能够动态调整不同层之间的连接强度,甚至能重新排列网络层次结构,弥补了残差连接在梯度消失和表示崩溃(Representation Collapse)之间的权衡困境。
深度连接与宽度连接
起初,该方法会将网络输入扩展为 n 个隐向量(n 称作 Expansion rate)。之后每一层的输入都会是 n 个隐向量,超连接会对这些隐向量建立以下两类连接:
深度连接(Depth-Connections):这些连接类似于残差连接,只为输入与输出之间的连接分配权重,允许网络学习不同层之间的连接强度。
宽度连接(Width-Connections):这些连接使得每一层多个隐藏向量之间可进行信息交换,从而提高模型表示能力。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
静态与动态超连接
超连接可以是静态的,也可以是动态的。
其中,静态超连接(Static Hyper-Connections, SHC)意味着连接权重在训练结束后固定不变。而动态超连接(Dynamic Hyper-Connections, DHC)则对应连接权重可根据输入动态调整。实验表明,动态超连接效果更好。
2. 技术细节
超连接(Hyper-connections)
首先,考虑第 k 层的输入隐藏向量字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,网络的初始输入为字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,并将其复制 n 次,形成初始的超隐藏矩阵(Hyper Hidden Matrix):
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
这里,n 称为扩展率(Expansion Rate)。在第 k 层,输入是上一层的超隐藏矩阵字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,即:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
对最后一层的超隐藏矩阵逐行求和,得到所需的隐藏向量,并通过一个投影层输出网络最终的结果(在 Transformer 中即为归一化层和解嵌入层)。
为了简化后续分析的符号表示,作者省略层索引,直接将超隐藏矩阵表示为:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
超连接可以用一个矩阵来表示,对于扩展率为 n 的情况,超连接矩阵 HC 如下:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
考虑一层网络字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,它可能是 Transformer 中的 attention 层或者是 FFN 层。超连接的输出 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%可以简单地表示为:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
也就是说,用 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%作为权重对输入 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%进行加权求和,得到当前层的输入字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%同时,字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%用于将 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%映射到残差超隐藏矩阵字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,表示如下:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
最终的输出表达式为:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
伪代码如下:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
动态超连接的实现
超连接矩阵 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%的元素可以动态依赖于输入 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,动态超连接的矩阵表示为:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
同样,给定层 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%和输入字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%,可以得到动态超连接的输出:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
在实际操作中,团队结合了静态和动态矩阵来实现动态超连接,动态参数通过线性变换获得。
为了稳定训练过程,团队在线性变换前引入归一化,并在其后应用 tanh 激活函数,通过一个可学习的小因子进行缩放。动态参数的计算公式如下:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
实验表明,动态超连接在语言建模任务中优于静态超连接。
3. 为什么使用超连接(Hyper-Connections)
研究团队认为,残差连接的两种变体,即前归一化(Pre-Norm)和后归一化(Post-Norm),可以被视为不可训练的超连接。
随后,团队引入了顺序 – 并行二象性概念,展示了超连接如何动态优化层的排列以提升网络性能。
残差连接是不可训练的超连接
前归一化和后归一化的残差连接可以表示为以下扩展率为 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%的超连接矩阵:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
其中,字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%和 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80% 分别表示神经网络层输入和输出的标准差,字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%表示它们之间的协方差。
对于 Pre-Norm,其超连接矩阵是一个 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%的矩阵,右下三角部分填充为 1,其余部分为占位符 0。对于 Post-Norm,权重依赖于输入和输出的方差及协方差,形成一个 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%的矩阵。因此,它们的超连接矩阵是不可训练的。
而本工作提出的方法的超连接矩阵是 字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%矩阵,且权重是可训练的,甚至可以基于输入进行动态预测。
顺序 – 并行二象性
给定一系列神经网络模块,我们可以将它们顺序排列或并行排列。作者认为,超连接可以学习如何将这些层重新排列,形成顺序和并行配置的混合。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
在不失一般性的情况下,可以将扩展率设置为 n=2。如果超连接以如下矩阵形式学习,神经网络将被顺序排列:
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
在这种情况下,深度连接退化为残差连接,如图 (a) 所示。
当奇数层和偶数层的超连接矩阵分别定义为以下形式时,神经网络每两层将被并行排列,类似于 Transformer 中的 parallel transformer block 的排列方式,如图 (b) 所示。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
因此,通过学习不同形式的超连接矩阵,网络层的排列可以超越传统的顺序和并行配置,形成软混合甚至动态排列。对于静态超连接,网络中的层排列在训练后保持固定;而对于动态超连接,排列可以根据每个输入动态调整。
4. 实验结果
实验主要集中在大规模语言模型的预训练上,涵盖了 Dense 模型和 MoE 模型。
实验结果表明,使用超连接的模型显著优于使用残差连接的模型。
1B Dense 模型实验
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
只要扩展率 > 1,效果就十分显著,且训练更稳定,消掉了训练 loss 的 spikes。
7B Dense 模型实验
团队甚至 Scale 到了 7B 模型,效果也十分亮眼,同时可以看到有超连接的网络训练更稳定。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
7B 候选激活 1.3B 的 MoE 模型实验
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
可以看到,下游指标全涨,在 ARC-Challenge 上甚至涨了 6 个百分点。
字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%
综上,研究团队介绍了超连接(Hyper-Connections),它解决了残差连接在梯度消失和表示崩溃之间的权衡问题。实验结果表明,超连接在大规模语言模型的预训练以及视觉任务中都表现出显著的性能提升。
值得注意的是,超连接的引入几乎不增加额外的计算开销或参数量,团队认为,该成果具有广泛的应用潜力,可以推广到文音视图模态的不同任务上,包括多模态理解、生成基座模型等。
5. 写在最后
团队关注底层问题,尤其在 LLMs 和多模态方面,期望实现更多突破。
更多团队技术研究进展,可以进入「豆包大模型团队」技术解读栏目了解。

以上就是字节豆包大模型团队突破残差连接局限!预训练收敛最快加速80%的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/412327.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Office365如何在Excel中使用Power Query_Office365数据查询的导入转换
上一篇 2025年11月6日 23:46:43
java通过定义数组类怎么求和
下一篇 2025年11月6日 23:46:52

相关推荐

  • 抖音商城是哪个公司在运营

    抖音商城的运营主体揭晓 抖音商城由北京微播视界科技有限公司负责运营。 作为抖音背后的母公司,字节跳动通过其全资子公司——微播视界,全面掌舵抖音平台及其电商板块的日常运作。依托雄厚的技术积累与多元化的业务布局,为用户打造流畅、智能且高效的购物环境。 抖音商城究竟是什么? 抖音商城是抖音App内嵌的一站…

    2026年9月21日
    100
  • 豆包语音2.0— 字节跳动推出的升级版AI语音模型

    豆包语音2.0是什么 豆包语音2.0是字节跳动推出的升级版ai语音模型,包含两大核心模型:豆包语音合成模型2.0(doubao-seed-tts 2.0)和豆包声音复刻模型2.0(doubao-seed-icl 2.0)。语音合成模型2.0支持对话式合成,可精准理解语义和情感,实现复杂公式朗读,准确…

    2026年9月21日
    100
  • 如何制作抖音点单小程序:全面指南与实用技巧

    引言: 随着移动互联网的飞速发展,抖音已不仅仅是短视频平台,更成为商家连接用户的重要入口。越来越多企业开始关注抖音点单小程序的搭建,以提升服务效率和用户体验。本文将为您系统讲解抖音点单小程序的制作流程,并分享实用技巧与真实案例,助您快速打造专属的小程序,实现流量变现与销售增长。 1. 明确核心需求与…

    2026年9月21日
    200
  • REDMI有史以来最强手机!K90 Pro Max这次真的强到爆

    REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆REDMI有史以来最强手机!K90 Pro Max这次真的强到爆

    如果说redmi过去是“性价比之王”,那么这一次,它彻底进化成了“性能怪兽”。10月23日即将登场的redmi k90 pro max,不仅是品牌年度旗舰的压轴大戏,更是其历史上首款冠以“pro max”之名的巅峰之作。 这可以看作是REDMI向高端市场发起冲击的正式宣言。卢伟冰亲自放话:“给4K价…

    2026年9月21日 用户投稿
    300
  • vivo浏览器设置选项在哪里_vivo浏览器系统设置入口位置

    首先打开vivo浏览器,点击右上角三点图标进入设置菜单;也可通过首页滑动侧边栏或搜索框输入“设置”快速跳转,进而调整搜索引擎、隐私权限及清除缓存等配置。 如果您在使用vivo浏览器时需要调整浏览设置,例如更改默认搜索引擎、管理隐私权限或清除缓存数据,可以通过浏览器内置的系统设置入口进行操作。以下是进…

    2026年9月20日
    100
  • mac怎么合并多个PDF文件_Mac合并PDF文件方法

    使用macOS可便捷合并PDF:1. 用预览拖拽缩略图或插入文件;2. 通过访达快速操作批量合并;3. 借助在线工具如iLovePDF处理。 如果您需要将多个PDF文件整合为一个文档以便于分享或管理,macOS系统提供了多种便捷的合并方式。以下是一些有效的操作步骤: 本文运行环境:MacBook P…

    2026年9月20日
    000
  • order by排序在mysql中如何实现

    ORDER BY用于对查询结果排序,支持ASC升序和DESC降序,位于SELECT语句末尾,可按单列或多列排序;MySQL优先利用索引有序性避免排序,若无合适索引则采用filesort在内存或磁盘排序;优化器选择单路或双路排序以提升效率;性能关键包括为排序字段建立索引、避免大结果集无索引排序、减少S…

    2026年9月20日
    000
  • 如何配置豆包电脑网页版_豆包网页版正版下载教程

    首先访问豆包官网https://www.doubao.com登录账号,再下载安装浏览器插件以启用AI划词与翻译功能,接着通过“AI伴读”上传PDF实现智能解析,最后点击图钉图标将聊天窗口固定为侧边栏便于持续交互。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek…

    2026年9月20日
    000
  • 在Java中如何实现多条件排序

    使用Comparator.thenComparing()可实现多条件排序,如先按年龄升序、再按分数降序、最后按姓名升序排列。 在Java中实现多条件排序,通常可以通过 Comparator 接口来完成。你可以根据多个字段依次比较,优先级从高到低排列。以下是几种常用且清晰的实现方式。 使用 Compa…

    2026年9月20日
    100
  • 京东大健康到底是什么?包含哪些模块?医疗健康新风口!京东大健康全生态解析,附入驻资质清单!

    在互联网医疗迅猛发展的当下,京东大健康作为京东集团聚焦医疗健康产业的重要战略布局,依托其强大的供应链体系、前沿技术能力与服务体系,打造了一个贯通药品流通、线上诊疗、个人健康管理等多元场景的数字化健康生态。本文将全面剖析其核心架构、业务布局及商家入驻标准,帮助您深入理解这一“科技+医疗健康”平台的运作…

    2026年9月20日
    100
  • 更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活

    更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活更智能、更安全、更流畅 鸿蒙6体验全面升级,畅享智慧生活

    2025年10月22日,华为正式推出全新操作系统——harmonyos 6(鸿蒙操作系统6)。此次发布不仅是技术体验的全面升级,更标志着鸿蒙生态迈入关键发展阶段。从“可用”到“好用”,鸿蒙正以惊人的速度进化,重新定义万物互联时代的用户体验边界。 作为新一代全场景智能系统,HarmonyOS自2019…

    2026年9月20日 用户投稿
    000
  • VSCode的悬浮提示信息如何自定义?

    通过JSDoc或docstring添加注释可直接影响VSCode悬浮提示内容,如JavaScript/TypeScript中使用/* /格式、Python中使用三引号文档字符串,配合Pylance等扩展增强显示;安装语言支持扩展可提升提示丰富度;高级场景可通过开发自定义语言服务器,在textDocu…

    2026年9月20日
    500
  • 企查查如何使用快捷查询栏_企查查查询栏的自定义配置教程

    首先启用快捷查询栏,再添加自定义模板如“高新技术企业_北京”,设置行业、地区等条件并保存,随后调整模板顺序以优化访问效率,最后可编辑或删除不再需要的查询配置。 如果您希望在企查查中快速查找企业信息,但每次手动输入查询条件较为繁琐,可以通过配置快捷查询栏来提升效率。通过自定义查询栏的显示字段和默认筛选…

    2026年9月20日
    000
  • 阿里夸克上线对话助手,采用 Qwen 最新闭源模型

    阿里巴巴“c计划”的首款成果近日正式亮相,即夸克app推出的全新对话助手功能。 据《科创板日报》消息,该对话助手基于Qwen(通义千问)最新闭源大模型打造。用户可通过点击夸克App首页的助手入口或右滑操作便捷进入该模式。 从形态与功能来看,这款对话助手与字节跳动旗下的“豆包”等产品类似,具备通用问答…

    2026年9月20日
    000
  • 如何在Laravel中实现数据排序

    在laravel中实现数据排序的核心方法是使用eloquent查询构建器的orderby方法。1. 基础排序可通过orderby指定字段及方向,如按创建时间倒序排列;2. 可使用latest()和oldest()分别实现倒序和正序排列;3. 多字段排序通过链式调用多个orderby方法实现,如先按姓…

    2026年9月20日
    100
  • 蛙漫2(日版)(网页版)在线登录 蛙漫2(日版)入口通道

    蛙漫2(日版)在线登录入口为https://manwa2.com/,该平台汇集日漫、国漫等多类型高清漫画,涵盖校园、恋爱、冒险等题材,支持每日更新、智能推荐、夜间模式及书架同步等功能。 蛙漫2(日版)在线登录入口通道在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来蛙漫2(日版)最新网页版访…

    2026年9月20日
    100
  • Steam商店重磅更新上线!心动游戏发售不错过

    steam平台每日都有大量新游戏上线,这让玩家难以全面关注所有值得关注的作品。为解决这一难题,valve正推出一项全新功能——“个性化推荐日历”,目前该功能已通过steam labs实验项目进入测试阶段。 据Valve介绍,这项日历功能将根据每位用户的兴趣偏好和历史游玩行为,智能筛选并推荐可能感兴趣…

    2026年9月13日
    000
  • Linux如何统计目录大小du命令实例

    Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例Linux如何统计目录大小du命令实例

    使用du命令可高效查看Linux目录大小,如du -s显示总占用空间,du -sh以易读格式展示,du -h列出各子目录大小,–max-depth限制层级深度,结合sort -h可排序定位最大目录。 在Linux系统中,du(disk usage)命令用于查看文件和目录的磁盘使用情况。统…

    2026年9月13日 用户投稿
    100
  • 索引如何提升mysql查询效率

    索引通过B+树结构改变数据查找方式,使MySQL无需全表扫描即可快速定位数据。有序存储、多层结构和高扇出性让查询效率大幅提升。例如在age字段建索引后,SELECT * FROM users WHERE age = 25可直接在B+树中查找,避免逐行比对。应为高频查询字段创建索引,优先使用复合索引并…

    2026年9月13日
    200
  • 周受资再发通知,90 后女将支颖成 TikTok 关键人物

    1992 年出生的女性高管支颖,正式跃升为 tiktok 的核心掌舵者之一。 继今年 8 月组织架构调整后,TikTok 再度迎来重大人事变动。 北京时间 10 月 22 日晚间,TikTok CEO 周受资在内部群发布通知,宣布将 TikTok 运营部门的汇报线并入产品部门。此举被视为此前战略调整…

    2026年9月13日
    000

发表回复

登录后才能评论
关注微信