量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?

量化剪枝、蒸馏,如果你经常关注大语言模型,一定会看到这几个词,单看这几个字,单看这几个字,我们很难理解它们都干了什么,但是这几个词对于现阶段的大语言模型发展特别重要。这篇文章就带大家来认识认识它们,理解其中的原理。

模型压缩

量化、剪枝、蒸馏,其实是通用的神经网络模型压缩技术,不是大语言模型专有的。

模型压缩的意义

压缩后,模型文件会变小,其使用的硬盘空间也会变小,加载到内存或者显示时使用的缓存空间也会变小,并且模型的运行速度还可能会有一些提高。

通过压缩,使用模型将消耗更少的计算资源,这可以极大的扩展模型的应用场景,特别是对模型大小和计算效率比较关注的地方,比如手机、嵌入式设备等。

压缩的是什么?

压缩的是模型的参数,模型的参数又是什么呢?

你可能听说过现在的机器学习使用的都是神经网络模型,神经网络模型就是模拟人的大脑中的神经网络。

这里我画了一个简单的示意图,大家可以看看。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?图片

简单起见,只描述三个神经元:A1、A2、A3。每个神经元都会接收别的神经元的信号,也会将信号传递给别的神经元。

A3会接收A1、A2传递过来的信号I_A1、I_A2,但是A3接收A1、A2信号的强度是不一样的(这个强度称为“权重”),假设这里的强度分别是W_13和W_23,A3会对接收到的信号数据进行加工。

首先对信号进行加权求和,也就是 I_A1*W_13+I_A2*W_23,然后再加上A3自己的一个参数 B_3(称为“偏置”),最后再把这个数据和转换为特定的形式,并把转换后的信号再发给下一个神经元。

在这个信号数据的加工过程中,用到的权重(W_13、W_23)和偏置( B_3 )就是模型的参数,当然模型还有其它一些参数,不过权重和偏置一般是所有参数中的大头,如果用二八原则来划分,应该都在80%以上。

使用大语言模型生成文本时,这些参数都已经是预训练好的,我们并不能对它们进行修改,这就像数学中多项式的系数,我们只能传递未知数xyz进去,然后得到一个输出结果。

模型压缩就是对模型的这些参数进行压缩处理,首要考虑的主要就是权重和偏置,使用的具体方法就是本文重点要介绍的量化、剪枝和蒸馏。

量化

量化就是降低模型参数的数值精度,比如最开始训练出的权重是32位的浮点数,但是实际使用发现用16位来表示也几乎没有什么损失,但是模型文件大小降低一般,显存使用降低一半,处理器和内存之间的通信带宽要求也降低了,这意味着更低的成本、更高的收益。

这就像按照菜谱做菜,你需要确定每种食材的重量。你可以使用一个非常精确的电子秤,它可以精确到0.01克,这固然很好,因为你可以非常精确地知道每样食材的重量。但是,如果你只是做一顿家常便饭,实际上并不需要这么高的精度,你可以使用一个简单又便宜的秤,最小刻度是1克,虽然不那么精确,但是足以用来做一顿美味的晚餐。

量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?图片

量化还有一个好处,那就是计算的更快。现代处理器中通常都包含了很多的低精度向量计算单元,模型可以充分利用这些硬件特性,执行更多的并行运算;同时低精度运算通常比高精度运算速度快,单次乘法、加法的耗时更短。这些好处还让模型得以运行在更低配置的机器上,比如没有高性能GPU的普通办公或家用电脑、手机等移动终端。

沿着这个思路,人们继续压缩出了8位、4位、2位的模型,体积更小,使用的计算资源更少。不过随着权重精度的降低,不同权重的值会越来越接近甚至相等,这会降低模型输出的准确度和精确度,模型的性能表现会出现不同程度的下降。

量化技术有很多不同的策略和技术细节,比如如动态量化、静态量化、对称量化、非对称量化等,对于大语言模型,通常采用静态量化的策略,在模型训练完成后,我们就对参数进行一次量化,模型运行时不再需要进行量化计算,这样可以方便地分发和部署。

剪枝

剪枝就是去掉模型中不重要的或者很少会用到的权重,这些权重的数值一般都接近于0。对于某些模型,剪枝可以产生比较高的压缩比,让模型更加紧凑和高效。这对于在资源受限的设备上或者内存和存储有限的情况下部署模型特别有用。

剪枝还会增强模型的可解释性。通过删除不必要的组件,剪枝使模型的底层结构更加透明且更易于分析。这对于理解神经网络等复杂模型的决策过程十分重要。

剪枝不仅涉及权重参数的剪枝,还可以剪除某些神经元节点,如下图所示:

量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?图片

注意剪枝并非适合所有的模型,对于一些稀疏模型(大部份参数都为0或者接近于0),剪枝可能没什么效果;对于一些参数比较少的小型模型,剪枝可能导致模型性能的明显下降;对于一些高精度的任务或者应用,也不适合对模型进行剪枝,比如医疗诊断这种人命关天的事。

可图大模型 可图大模型

可图大模型(Kolors)是快手大模型团队自研打造的文生图AI大模型

可图大模型 32 查看详情 可图大模型

在实际运用剪枝技术时,通常需要综合考虑剪枝对模型运行速度的提升和对模型性能的负面影响,采取一些策略,比如给模型中的每个参数打分,也就是评估参数对模型性能的贡献有多大。分数高的,就是绝对不能剪掉的重要参数;分数低的,就是可能不那么重要,可以考虑剪掉的参数。这个分数可以通过各种方法计算,比如看参数的大小(绝对值大的通常更重要),或者通过一些更复杂的统计分析方法来确定。

蒸馏

蒸馏就是把大模型学习到的概率分布直接复制到一个小模型中。被复制的模型称为教师模型,一般是参数量较大、性能很强的优秀模型,新模型称为学生模型,一般是参数比较少的小模型。

蒸馏时,教师模型会根据输入生成多个可能输出的概率分布,然后学生模型学习这个输入和输出的概率分布情况。经过大量训练,学生模型就可以模仿教师模型的行为,或者说学习到了教师模型的知识。

比如在图像分类任务中,给出一张图,教师模型可能会输出类似如下的概率分布:

猫:0.7狗:0.4车:0.1

然后把这张图和输出的概率分布信息一起提交给学生模型进行模仿学习。

量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?图片

因为蒸馏是把教师模型的知识压缩到一个更小更简单的学生模型中,新的模型可能会丢失一些信息;另外学生模型可能过度依赖教师模型,导致模型的泛化能力不佳。

为了让学生模型的学习效果更好,我们可以采用一些方法和策略。

引入温度参数:假设有一位老师讲课速度非常快,信息密度很高,学生可能有点难以跟上。这时如果老师放慢速度,简化信息,就会让学生更容易理解。在模型蒸馏中,温度参数起到的就是类似“调节讲课速度”的作用,帮助学生模型(小模型)更好地理解和学习教师模型(大模型)的知识。专业点说就是让模型输出更加平滑的概率分布,方便学生模型捕捉和学习教师模型的输出细节。

调整教师模型和学生模型的结构:一个学生想要从一个专家那里学点东西可能是很难的,因为他们之间的知识差距太大,直接学习可能会听不懂,这时候可以在中间加入一个老师,它既能理解专家的话,又能转化为学生可以听懂的语言。中间加入的这个老师可能是一些中间层或者辅助神经网络,或者这个老师可以对学生模型进行一些调整,让它能更匹配教师模型的输出。

上边我们介绍了三种主要的模型压缩技术,其实这里边还有很多的细节,不过对于理解原理差不多已经够了,也还有其它一些模型压缩技术,比如低秩分解、参数共享、稀疏连接等,有兴趣的同学可以多去查查相关内容。

另外模型压缩后,其性能可能会出现比较明显的下降,此时我们可以对模型进行一些微调,特别是一些对模型精度要求比较高的任务,比如医学诊断、金融风控、自动驾驶等,微调可以让模型的性能得到一定的恢复,稳固其在某些方面的准确性和精确性。

谈到模型微调,最近我在AutoDL上分享了一个 Text Generation WebUI 的镜像,Text Generation WebUI 是一个使用Gradio编写的Web程序,可以方便的对大语言模型进行推理、微调,支持多种类型的大语言模型,包括Transformers、llama.cpp(GGUF)、GPTQ、AWQ、EXL2等多种格式的模型,在最新的镜像中,我已经内置了Meta最近开源的 Llama3 大模型,感兴趣的同学可以去体验下,使用方法参见:十分钟学会微调大语言模型

量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?图片

参考文章:

https://www.php.cn/link/d7852cd2408d9d3205dc75b59a6ce22e

https://www.php.cn/link/f204aab71691a8e18c3f6f00872db63b

https://www.php.cn/link/b31f0c758bb498b5d56b5fea80f313a7

https://www.php.cn/link/129ccfc1c1a82b0b23d4473a72373a0a

https://www.php.cn/link/bdffc7973c9f8f88ab4effb397c59f92

https://www.php.cn/link/8fc81fd7630f52aca6381ff6df0f6cec

以上就是量化、剪枝、蒸馏,这些大模型黑话到底说了些啥?的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/421457.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
想将 AI 模型创意灵感激发工具与豆包联用获取灵感?详细步骤​
上一篇 2025年11月7日 09:28:17
深圳app开发定制:深圳app开发定制外包哪家专业?
下一篇 2025年11月7日 09:28:21

相关推荐

  • 蛙漫2(日版)(网页版)在线登录 蛙漫2(日版)入口通道

    蛙漫2(日版)在线登录入口为https://manwa2.com/,该平台汇集日漫、国漫等多类型高清漫画,涵盖校园、恋爱、冒险等题材,支持每日更新、智能推荐、夜间模式及书架同步等功能。 蛙漫2(日版)在线登录入口通道在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来蛙漫2(日版)最新网页版访…

    2026年9月20日
    100
  • 百度浏览器图片加载慢怎么办 百度浏览器图片显示缓慢优化方法

    图片加载慢通常因网络或网页内容导致,优先检查网络连接、重启路由器、切换网络环境;清理浏览器缓存与Cookie;尝试开关硬件加速;最终建议改用Chrome、Edge等现代浏览器以提升加载效率。 百度浏览器图片加载慢,问题通常不在浏览器本身,而是网页内容和网络环境导致的。解决方法需要从多个方面入手,核心…

    2026年9月12日
    100
  • IEEE P3366.1 点云压缩标准正式发布

    来源:https://www.php.cn/link/a65b920e6ce1070509a476e3b48aa56fhttps://www.php.cn/link/c732e4cb57268226f297e389d8382baf ieee p3366.1点云压缩标准已正式发布,成为ieee 336…

    用户投稿 2026年9月12日
    000
  • deepseek官方社区网址_加入deepseek官方社区官网交流

    deepseek官方社区网址是https://chat.deepseek.com/,该平台提供互动交流、模型更新、技术文档、多语言支持及开源项目协作,同时支持实时对话、多终端同步与API集成。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ …

    2026年9月10日
    600
  • DeepSeek-OCR— DeepSeek团队开源的视觉语言模型

    DeepSeek-OCR— DeepSeek团队开源的视觉语言模型DeepSeek-OCR— DeepSeek团队开源的视觉语言模型DeepSeek-OCR— DeepSeek团队开源的视觉语言模型DeepSeek-OCR— DeepSeek团队开源的视觉语言模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ DeepSeek 幻方量化公司旗下的开源大模型平台 7009 查看详情 DeepSeek-OCR是什么 deepseek-ocr 是由 deepseek 团队开发的一款先进视觉语言模型,专注于利…

    2026年9月10日 用户投稿
    100
  • 不同压缩算法(如ZIP、RAR、7z)在压缩率和速度上有何差异?

    ZIP压缩快但率低,RAR兼顾压缩率与功能,7z压缩率最高但速度慢;选择应根据文件类型及对速度、兼容性、压缩率的需求权衡。 不同压缩算法在压缩率和速度上的表现各有特点,主要取决于其设计原理、使用的压缩技术以及是否支持多线程等优化手段。常见的压缩格式如 ZIP、RAR 和 7z 分别由不同的算法驱动,…

    2026年9月10日
    100
  • 特斯拉 FSD 加入大量全新渲染模型 玩滑板的人都能识别

    近日,有汽车领域博主爆料,特斯拉的fsd(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。 这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、…

    2026年9月8日
    100
  • 中国农业大学发布神农大模型 3.0

    中国农业大学正式推出神农大模型3.0,这是目前国内覆盖农业学科与应用场景最全面的大规模人工智能模型。该模型具备农业知识问答、生产决策推理等核心功能,标志着我国农业领域的人工智能技术迈入全新发展阶段。 回顾发展历程,神农大模型1.0主要实现了基础的农业知识查询能力;2.0版本则在多模态理解方面取得突破…

    2026年9月8日
    000
  • MySQL数据压缩技术与性能影响_节省空间与保证速度平衡方案

    MySQL数据压缩技术与性能影响_节省空间与保证速度平衡方案MySQL数据压缩技术与性能影响_节省空间与保证速度平衡方案MySQL数据压缩技术与性能影响_节省空间与保证速度平衡方案MySQL数据压缩技术与性能影响_节省空间与保证速度平衡方案

    mysql数据压缩并非万能药,它在节省存储空间的同时会增加cpu开销并可能影响性能。1. 压缩通过减少磁盘i/o提升效率,但压缩和解压消耗cpu资源;2. buffer pool中解压后的数据占用内存,可能导致更多磁盘i/o;3. 频繁更新会引发写入放大问题,增加i/o负担;4. 选择压缩策略需分析…

    2026年9月7日 用户投稿
    100
  • 用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐用慢思考提升模型安全性,北交大、鹏城实验室提出系统2对齐

    aixiv专栏:北京交通大学adam团队探索系统2对齐,提升大模型安全性 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 北京交通大学ADaM团队长期关注AI安全领域,此前已开源o1复现项目o1-Coder (https://www.php.…

    2026年9月7日 用户投稿
    000
  • Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释

    Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释Meta陷入恐慌?内部爆料:在疯狂分析复制DeepSeek,高预算难以解释

    deepseek开源大模型的横空出世,引发美国ai巨头恐慌,meta首当其冲。 近期,Meta员工在Teamblind匿名论坛爆料,DeepSeek一系列低成本高性能的模型发布,让Meta生成式AI团队面临巨大压力,其高昂预算的合理性受到质疑。 爆料帖原文指出,DeepSeek-V3在基准测试中超越…

    2026年9月7日 用户投稿
    000
  • DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录

    DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录DARWIN 1.5 来啦!材料设计通用大语言模型,刷新多项实验性质预测记录

    darwin 1.5:一款基于语言接口的材料发现与设计ai模型 材料科学的核心挑战在于高效地寻找理想的材料成分和结构。传统的计算方法,例如高通量筛选和机器学习,通常依赖于复杂的、特定任务的描述符,这些描述符难以泛化,且与真实材料特性存在偏差,限制了实际应用。为了克服这些局限,GreenDynamic…

    2026年9月6日 用户投稿
    000
  • 致敬DeepSeek:以国产GPU为基,燎原中国AI生态之火

    deepseek开源模型(v3、r1系列等)在多语言理解和复杂推理任务中表现出色,极大促进了ai技术发展,为开发者提供了重要资源。deepseek不仅技术领先,更积极回馈开源社区。 摩尔线程高效部署DeepSeek 国产GPU创新企业摩尔线程已高效部署DeepSeek蒸馏模型推理服务,助力开发者基于…

    2026年9月5日
    400
  • C盘空间越来越小怎么办

    一、所需工具: 清理软件:例如CCleaner等,能够帮助我们清除系统中的垃圾和临时文件,从而腾出C盘空间。 外接存储设备:当C盘容量紧张时,可以将一些不常用的资料转移到外接硬盘或U盘中保存。 二、解决办法: 扫描并清理垃圾文件:利用清理软件定期对系统中的垃圾进行扫描与清除,包括缓存文件、回收站内容…

    2026年9月4日
    500
  • 为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    deepseek风靡一时,但并非人人可用。 众多ai云服务商抓住机遇,纷纷上线deepseek模型,并推出优惠活动吸引用户。然而,免费token往往难以顺利调用deepseek-r1,可用性堪忧。 这凸显了选择可靠大厂的重要性。 火山引擎上线DeepSeek-R1模型(含完整版及蒸馏版),并赠送50…

    2026年9月2日 用户投稿
    100
  • 苹果选择通义,肯定阿里的同时,也否定了阿里

    苹果ai订单尘埃落定:阿里通义千问胜出,生态安全成关键 历时两年的苹果AI订单争夺战最终以阿里巴巴胜出告终。2月11日消息,苹果已选择阿里巴巴为中国版iPhone开发人工智能功能。 自2023年起,苹果便在测试多家中国AI模型,竞争者包括百度、字节跳动等巨头,以及百川智能、月之暗面和DeepSeek…

    2026年9月1日
    000
  • 撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开

    撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开撞车DeepSeek NSA,Kimi杨植麟署名的新注意力架构MoBA发布,代码也公开

    月之暗面发布moba注意力机制,高效处理超长文本!近日,月之暗面团队公开了一种名为moba(mixture of block attention,块注意力混合)的全新注意力机制,该机制巧妙地将混合专家(moe)原理应用于注意力机制,并在长文本处理方面展现出显著优势。这与deepseek同期发布的ns…

    2026年8月31日 用户投稿
    200
  • 爆款和平替之后,华为极简全闪数据中心还要Pro+

    过去一年,全闪存市场出现了几款爆品,例如oceanstordorado 2000、oceanstordorado 2100、oceanprotectx3000、fusioncube1000v。部分爆品甚至越界平替了hdd(机械硬盘)产品。合作伙伴也受益其中,上海华讯、广州耀恒等公司的相关业绩,都增长…

    2026年8月30日
    200
  • 流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示

    流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示流畅阅读— 开源AI浏览器翻译插件,支持双语对照显示

    fluentread:你的浏览器翻译利器,助你畅享无障碍阅读体验! FluentRead是一款开源浏览器翻译插件,它利用先进的AI技术,旨在为你提供如同母语般流畅的阅读体验。支持多种翻译引擎,包括传统的机器翻译和强大的AI大模型,并且允许你自定义翻译服务。其核心功能包含智能翻译、便捷的双语对照显示以…

    2026年8月29日 用户投稿
    200
  • Swoole UDP 广播功能在物联网场景中的应用及实现

    swoole udp广播在物联网中的应用包括设备发现和状态广播。1) 创建udp服务器并处理数据包,2) 使用定时器定期广播设备状态,3) 优化广播频率和数据包大小,4) 利用异步处理提高性能。 引言 在物联网(IoT)领域,设备之间的通信至关重要,而UDP广播作为一种高效的通信方式,常常被用于设备…

    2026年8月29日
    100

发表回复

登录后才能评论
关注微信