Llama架构比不上GPT2？神奇token提升10倍记忆？

程序猿 • 2025年11月11日 04:19:57 • 科技 • 阅读 0

一个 7B 规模的语言模型 LLM 能存储多少人类知识？如何量化这一数值？训练时间、模型架构的不同将如何影响这一数值？浮点数压缩 quantization、混合专家模型 MoE、以及数据质量的差异 (百科知识 vs 网络垃圾) 又将对 LLM 的知识容量产生何种影响？

朱泽园（Meta AI）和李远志（MBZUAI）最新研究《语言模型物理学 Part 3.3：知识的Scaling Laws》用海量实验（50,000条任务，总计4,200,000 GPU小时）总结了12条定律，为LLM在不同文件下的知识容量提供了较为精确的计量方法。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

作者首先指出，通过开源模型在基准数据集（benchmark）上的表现来衡量LLM的scaling law是不现实的。举例来说，LLaMA-70B在知识数据集上的表现比LLaMA-7B好30%，这并不能说明模型扩大10倍仅能在容量上提高30%。如果使用网络数据训练模型，我们也将很难估计其中包含的知识总量。

再举个例子，我们比较 Mistral 和 Llama 模型的好坏之时，到底是他们的模型架构不同导致的区别，还是他们训练数据的制备不同导致的？

在以上考量，作者采用了他们《语言模型物理学》系列论文的核心思路，即制造人工合成数据，通过控制数据中知识的数量和类型，来严格调控数据中的知识比特（bits）。同时，作者使用不同大小和构架的 LLM 在人工合成数据上进行训练，并给出数学定义，来精确计算训练好的模型从数据中学到了多少比特的知识。

论文地址：https://arxiv.org/pdf/2404.05405.pdf论文标题：Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws

对于这项研究，有人表示这个方向似乎是合理的。我们可以使用非常科学的方式对scaling law 进行分析。

也有人认为，这项研究将 scaling law 提升到了不同的层次。当然，对于从业者来说是一篇必读论文。

研究概览

作者研究了三种类型的合成数据：bioS、bioR、bioD。bioS 是使用英语模板编写的人物传记，bioR 是由 LlaMA2 模型协助撰写的人物传记（22GB 总量），bioD 则是一种虚拟但可以进一步控制细节的知识数据（譬如可以控制知识的长度、词汇量等等细节）。作者重点研究了基于 GPT2、LlaMA、Mistral 的语言模型架构，其中 GPT2 采用了更新的 Rotary Position Embedding (RoPE) 技术。

左图为训练时间充足，右图为训练时间不足的 scaling laws

上图 1 简要概述了作者提出的前 5 条定律，其中左 / 右分别对应了「训练时间充足」和「训练时间不足」两种情况，分别对应了常见知识（如中国首都是北京）和较少出现的知识（如清华物理系成立于 1926 年）。

如果训练时间充足，作者发现，不论使用何种模型架构，GPT2 或 LlaMA/Mistral，模型的存储效率均可以达到 2bit/param—— 即平均每个模型参数可以存储 2 比特的信息。这与模型的深度无关，仅与模型大小有关。换言之，一个 7B 大小的模型，如果训练充足，可以存储 14B 比特的知识，这超过了维基百科和所有英文教科书中人类知识的总和！

更令人惊讶的是，尽管传统理论认为 transformer 模型中的知识主要存储在 MLP 层，但作者的研究反驳了这一观点，他们发现即便移除了所有 MLP 层，模型仍能达到 2bit/param 的存储效率。

图 2：训练时间不足情况下的 scaling laws

然而，当我们观察训练时间不足的情况时，模型间的差异就显现出来了。如上图 2 所示，在这种情况下，GPT2 模型能比 LlaMA/Mistral 存储超过 30% 的知识，这意味着几年前的模型在某些方面超越了今天的模型。为什么会这样？作者通过在 LlaMA 模型上进行架构调整，将模型与 GPT2 的每个差异进行增减，最终发现是 GatedMLP 导致了这 30% 的损失。

强调一下，GatedMLP 并不会导致模型的「最终」存储率变化 —— 因为图 1 告诉我们如果训练充足它们就不会有差。但是，GatedMLP 会导致训练不稳定，因此对同样的知识，需要更长的训练时间；换句话说，对于较少出现在训练集里的知识，模型的存储效率就会下降。

图 3：quantization 和 MoE 对模型 scaling laws 的影响

作者的定律 8 和定律 9 分别研究了 quantization 和 MoE 对模型 scaling law 的影响，结论如上图 3 所示。其中一个结果是，将训练好的模型从 float32/16 压缩到 int8，竟然对知识的存储毫无影响，即便对已经达到 2bit/param 存储极限的模型也是如此。

这意味着，LLM 可以达到「信息论极限」的 1/4—— 因为 int8 参数只有 8 比特，但平均每个参数可以存储 2 比特的知识。作者指出，这是一个普遍法则（universal law），和知识的表现形式无关。

最引人注目的结果来自于作者的定律 10-12（见图 4）。如果我们的 (预) 训练数据中，有 1/8 来自高质量知识库（如百度百科），7/8 来自低质量数据（如 common crawl 或论坛对话，甚至是完全随机的垃圾数据）。

那么，低质量数据是否会影响 LLM 对高质量知识的吸收呢？结果令人惊讶，即使对高质量数据的训练时间保持一致，低质量数据的「存在本身」，可能会让模型对高质量知识的存储量下降 20 倍！即便将高质量数据的训练时间延长 3 倍，知识储量仍会降低 3 倍。这就像是将金子丢进沙子里，高质量数据被严重浪费了。

有什么办法修复呢？作者提出了一个简单但极其有效的策略，只需给所有的 (预) 训练数据加上自己的网站域名 token 即可。例如，将 Wiki 百科数据统统加上 wikipedia.org。模型不需要任何先验知识来识别哪些网站上的知识是「金子」，而可以在预训练过程中，自动发现高质量知识的网站，并自动为这些高质量数据腾出存储空间。

作者提出了一个简单的实验来验证：如果高质量数据都加上一个特殊 token（任何特殊 token 都行，模型不需要提前知道是哪个 token），那么模型的知识存储量可以立即回升 10 倍，是不是很神奇？所以说对预训练数据增加域名 token，是一个极其重要的数据制备操作。

图 4：预训练数据「知识质量不齐」情形下的 scaling laws，模型缺陷以及如何修复

结语

作者认为，通过合成数据，计算模型在训练过程中获得的知识总量的方法，可以为「评估模型架构、训练方法和数据制备」提供了一套系统且精确的打分体系。这和传统的 benchmark 比较完全不同，并且更可靠。他们希望这能帮助未来 LLM 的设计者做出更明智的决策。

以上就是Llama架构比不上GPT2？神奇token提升10倍记忆？的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/616632.html

llama 数据模型

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

上一篇 2025年11月11日 04:19:46

讯飞星火V3.5正式发布，基于全国产算力平台“飞星一号”训练

下一篇 2025年11月11日 04:20:46

好文分享

动态生成HTML表格：优化JavaScript数据展示与导出

本文旨在解决JavaScript中动态生成HTML表格时遇到的代码冗余和样式控制难题。通过引入数据驱动的编程思想，我们将数据与视图逻辑分离，首先将表格内容组织为JavaScript对象数组，然后利用一个通用的函数将这些结构化数据渲染为可读性强、易于维护且支持灵活样式的HTML表格字符串。这种方法不仅…

程序猿
2025年12月23日
0000
好文分享

HTML5性能优化怎么实现_HTML5新特性在性能优化方面的应用方法

HTML5通过语义化标签、Web Storage、Canvas/SVG、Service Worker和原生媒体支持等技术提升性能：1. 语义化标签优化渲染效率；2. Web Storage减少网络请求；3. Canvas/SVG降低资源加载量；4. Service Worker实现离线缓存；5. 原…

程序猿
2025年12月23日
0000
好文分享

利用UTM参数与GTM优化链接点击来源追踪

本文详细阐述了如何通过UTM参数精准追踪营销链接的点击来源，并深入探讨了Google Tag Manager (GTM) 在此过程中的高级应用。文章首先介绍了UTM参数的构成、生成方法及其在Google Analytics中的自动解析机制，强调其在识别流量来源方面的核心作用。随后，探讨了GTM如何通…

程序猿
2025年12月23日
0000
好文分享

如何通过HTML在线展示数据_HTML在线数据展示实现与可视化方案

网页展示数据需结合HTML、CSS与JavaScript，首选table展示结构化数据，配合Chart.js等库实现可视化图表，通过fetch加载远程JSON动态渲染内容，并利用响应式设计与交互优化提升用户体验。在网页中展示数据，核心是将结构化信息清晰、直观地呈现给用户。HTML本身是内容载体，结…

程序猿
2025年12月23日
0000
好文分享

html在线几何图形绘制 html在线SVG应用实战教程

使用HTML与SVG结合可高效绘制几何图形。SVG基于XML，支持圆形、矩形、多边形、路径等，在任意分辨率下清晰。1. 基础元素包括rect、circle、ellipse、line、polygon、polyline和path。2. 实战示例：用polygon绘制三角形，path绘制五角星和弧线仪表盘…

程序猿
2025年12月23日
0000
好文分享

单页应用（SPA）中特定分类数据的API直链访问与性能考量

针对单页应用（SPA），本文探讨了如何通过URL直接访问特定分类数据，而非依赖客户端UI交互。文章揭示了SPA在初始加载时已获取所有数据，因此客户端分类选择对数据加载量无影响。核心策略是绕过前端界面，直接调用后端API获取所需数据，从而实现高效且精准的数据访问，并提供了具体API示例。理解单页应用…

程序猿
2025年12月23日
1000
好文分享

jQuery循环中动态表格数据访问与比较教程

本文详细介绍了在jQuery循环中处理动态生成表格数据时常见的挑战与解决方案。我们将探讨如何正确使用.find()代替.children()来定位嵌套元素，解决.data()方法返回数字类型导致比较错误的问题，并提供一个基于事件监听的实用示例，以实现对用户修改数据的实时检测和保存。动态表格数据处理…

程序猿
2025年12月22日
0000
揭秘canvas技术在数据可视化中的独特威力

发现Canvas技术在数据可视化中的独特作用随着数据时代的到来，数据可视化成为了一种重要的方式来呈现大量的数据。在数据可视化中，Canvas技术以其独特的优势在各个领域展示了巨大的潜力。本文将着重介绍Canvas技术在数据可视化中的独特作用，并给出具体的代码示例。 Canvas是HTML5中的一个…

程序猿
好文分享 2025年12月21日
0000
好文分享

使用localstorage存储数据所需的包有哪些？

localstorage是HTML5中的一项重要技术，它可以用来在客户端本地存储数据。在使用localstorage存储数据之前，我们需要确保在代码中引入合适的包来操作这个功能。在使用localstorage之前，我们需要在HTML文件中添加以下代码来引入localstorage的相关包：在以上…

程序猿
2025年12月21日
0000
好文分享

无法将数据保存到localstorage，为什么？

为什么我的数据无法保存到localstorage中？本文将详细讨论为何在某些情况下，数据无法保存到本地存储(localstorage)中。同时，我将提供一些具体的代码示例以帮助您解决这个问题。首先，让我们来了解一下什么是localstorage。localstorage是HTML5中引入的一种W…

程序猿
2025年12月21日
0000
好文分享

如何将HTML表单数据作为文本并发送到html2pdf？

html2pdf 是一个 JavaScript 包，允许开发人员将 html 转换为 canvas、pdf、图像等。它将 html 作为参数并将其添加到 pdf 或所需文档中。此外，它还允许用户在添加 html 内容后下载该文档。在这里，我们将访问表单并使用html2pdf npm包将其添加到pd…

程序猿
2025年12月21日
0000
HTML中如何用post提交数据

http/1.1 协议规定的 http 请求方法有 options、get、head、post、put、delete、trace、connect 这几种。其中 post 一般用来向服务端提交数据，本文主要讨论 post 提交数据的几种方式 http/1.1 协议规定的 http 请求方法有 opti…

程序猿
好文分享 2025年12月21日
0000
html的盒模型详解

这次给大家带来html的盒模型详解，使用html盒模型的注意事项有哪些，下面就是实战案例，一起来看一下。 1.1. 盒的内容区的尺寸— content width和content height —取决于几个因素： –生成该盒的元素是否设置了’width’或&#82…

程序猿
好文分享 2025年12月21日
0000
服务端主动发送数据回客户端在H5里的实现步奏

我们知道，在server sent event里，通过eventsource对象接收服务器发送事件的通知是有三个事件的，message, open, error这三种，今天就给大家演示一下服务端主动发送数据回客户端在h5里的实现步奏。 Server Sent Event Server Sent Ev…

程序猿
好文分享 2025年12月21日
0000
好文分享

可视化图表制作_javascript数据展示

答案是使用JavaScript库如Chart.js、D3.js和ECharts可实现交互式数据可视化；其中Chart.js适合快速集成常见图表，D3.js适用于高度自定义的复杂图形，ECharts支持高级图表且中文文档完善；以Chart.js创建柱状图需引入库、添加canvas容器并初始化Chart…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS：深入理解订单与现金支付明细并高效调试

本教程旨在指导odoo 14 pos开发者如何准确读取销售会话中的订单及其现金支付明细，并计算总现金支付金额。文章将详细介绍odoo前端数据模型的访问方法，并着重强调利用浏览器开发者工具和`debugger`关键字进行运行时对象结构检查与调试的最佳实践，帮助开发者高效解决数据访问中的常见问题。 Od…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS会话中现金支付金额的准确获取与调试指南

针对odoo 14 pos会话中读取订单并计算现金支付总额的需求，本文将详细指导如何正确访问支付明细对象属性。重点介绍利用浏览器开发者工具设置断点进行实时调试的方法，帮助开发者深入理解数据结构，从而高效准确地实现功能，避免因属性名称不匹配而导致的常见问题。 1. 理解Odoo POS数据模型在Od…

程序猿
2025年12月21日
0000
好文分享

javascript_如何实现数据可视化

JavaScript实现数据可视化需将数据转为图形，常用Chart.js、D3.js等库快速构建图表，或用Canvas/SVG原生绘图；通过fetch获取数据并动态更新视图，如Chart.js调用update()刷新，最终实现交互式可视化。 JavaScript 实现数据可视化，核心是将数据转换成图…

程序猿
2025年12月21日
0000
好文分享

Ionic 应用在浏览器刷新时状态持久化策略

当 ionic 应用在浏览器中被刷新时，浏览器会执行完整的页面重载，导致应用状态和数据丢失。本文旨在阐明为何无法阻止浏览器进行全面重载，并提供一个专业的解决方案：利用 capacitor preferences 等客户端存储机制来持久化关键应用状态和数据，确保在浏览器刷新后也能恢复应用到预期状态，从…

程序猿
2025年12月21日
1000
好文分享

Node.js中高效移除文本文件中的制表符（）

本文详细探讨了在node.js环境中从文本文件移除制表符（“）的有效方法。文章首先解释了为何常见的字符串替换尝试可能失败，强调了“和`t`在正则表达式中的区别。随后，提供了两种实用解决方案：直接使用正确正则表达式进行替换，以及通过按行处理数据实现更精细的控制。文章还包含了示例…

程序猿
2025年12月21日
0000

发表回复

登录后才能评论

Llama架构比不上GPT2？神奇token提升10倍记忆？

研究概览

结语

关于作者

相关推荐

发表回复