人手一个ChatGPT！微软DeepSpeed Chat震撼发布，一键RLHF训练千亿级大模型

程序猿 • 2025年11月10日 00:32:07 • 用户投稿 • 阅读 0

人手一个ChatGPT的梦想，就要实现了？

刚刚，微软开源了一个可以在模型训练中加入完整RLHF流程的系统框架——DeepSpeed Chat。

也就是说，各种规模的高质量类ChatGPT模型，现在都唾手可得了！

项目地址：https://github.com/microsoft/DeepSpeed

一键解锁千亿级ChatGPT，轻松省钱15倍

众所周知，由于OpenAI太不Open，开源社区为了让更多人能用上类ChatGPT模型，相继推出了LLaMa、Alpaca、Vicuna、Databricks-Dolly等模型。

但由于缺乏一个支持端到端的RLHF规模化系统，目前类ChatGPT模型的训练仍然十分困难。而DeepSpeed Chat的出现，正好补全了这个「bug」。

更亮的是，DeepSpeed Chat把成本大大地打了下来。

此前，昂贵的多GPU设置超出了许多研究者的能力范围，并且，即使能访问多GPU集群，现有的方法也无力负担数千亿参数ChatGPT模型的训练。

现在，只要花1620美元，就可以通过混合引擎DeepSpeed-HE，在2.1天内训练一个OPT-66B模型。

而如果使用多节点、多GPU系统，DeepSpeed-HE可以花320美元，在1.25小时内训练一个OPT-13B模型，花5120美元，就能在不到一天的时间内训练一个OPT-175B模型。

前Meta AI专家Elvis激动转发，称这是一件大事，并表示好奇DeepSpeed Chat和ColossalChat相比起来如何。

下面，我们就来看看效果如何。

经过DeepSpeed-Chat的训练，13亿参数版「ChatGPT」在问答环节上的表现非常亮眼。不仅能get到问题的上下文关系，而且给出的答案也有模有样。

在多轮对话中，这个13亿参数版「ChatGPT」所展示出的性能，也完全超越了这个规模的固有印象。

一段代码，生成你的第一个ChatGPT

当然，在体验之前，还需要把环境配置一下：

git clone https://github.com/microsoft/DeepSpeed.gitcd DeepSpeedpip install .git clone https://github.com/microsoft/DeepSpeedExamples.gitcd DeepSpeedExamples/applications/DeepSpeed-Chat/pip install -r requirements.txt

一杯咖啡，训完13亿参数版ChatGPT

如果你只有大约1-2小时的咖啡或午餐休息时间，也可以尝试使用DeepSpeed-Chat训练一个「小玩具」。

团队特地准备了一个针对1.3B模型的训练示例，可在消费级GPU上进行测试。最棒的是，当你从午休回来时，一切都已准备就绪。

python train.py --actor-model facebook/opt-1.3b --reward-model facebook/opt-350m --num-gpus 1

配备48GB显存的消费级NVIDIA A6000 GPU：

一个GPU Node，半天搞定130亿参数

如果你只有半天的时间，以及一台服务器节点，则可以通过预训练的OPT-13B作为actor模型，OPT-350M作为reward模型，来生成一个130亿参数的类ChatGPT模型：

python train.py --actor-model facebook/opt-13b --reward-model facebook/opt-350m --num-gpus 8

单DGX节点，搭载了8个NVIDIA A100-40G GPU：

超省钱云方案，训练660亿参数模型

如果你可以使用多节点集群或云资源，并希望训练一个更大、更高质量的模型。那么只需基于下面这行代码，输入你想要的模型大小（如66B）和GPU数量（如64）：

python train.py --actor-model facebook/opt-66b --reward-model facebook/opt-350m --num-gpus 64

8个DGX节点，每个节点配备8个NVIDIA A100-80G GPU：

具体来说，针对不同规模的模型和硬件配置，DeepSpeed-RLHF系统所需的时间和成本如下：

DeepSpeed Chat是个啥？

DeepSpeed Chat是一种通用系统框架，能够实现类似ChatGPT模型的端到端RLHF训练，从而帮助我们生成自己的高质量类ChatGPT模型。

DeepSpeed Chat具有以下三大核心功能：

1. 简化ChatGPT类型模型的训练和强化推理体验

开发者只需一个脚本，就能实现多个训练步骤，并且在完成后还可以利用推理API进行对话式交互测试。

2. DeepSpeed-RLHF模块

DeepSpeed-RLHF复刻了InstructGPT论文中的训练模式，并提供了数据抽象和混合功能，支持开发者使用多个不同来源的数据源进行训练。

3. DeepSpeed-RLHF系统

团队将DeepSpeed的训练（training engine）和推理能力（inference engine) 整合成了一个统一的混合引擎（DeepSpeed Hybrid Engine or DeepSpeed-HE）中，用于RLHF训练。由于，DeepSpeed-HE能够无缝地在推理和训练模式之间切换，因此可以利用来自DeepSpeed-Inference的各种优化。

DeepSpeed-RLHF系统在大规模训练中具有无与伦比的效率，使复杂的RLHF训练变得快速、经济并且易于大规模推广：

高效且经济：

DeepSpeed-HE比现有系统快15倍以上，使RLHF训练快速且经济实惠。

例如，DeepSpeed-HE在Azure云上只需9小时即可训练一个OPT-13B模型，只需18小时即可训练一个OPT-30B模型。这两种训练分别花费不到300美元和600美元。

卓越的扩展性：

DeepSpeed-HE能够支持训练拥有数千亿参数的模型，并在多节点多GPU系统上展现出卓越的扩展性。

因此，即使是一个拥有130亿参数的模型，也只需1.25小时就能完成训练。而对于拥有1750 亿参数的模型，使用DeepSpeed-HE进行训练也只需不到一天的时间。

实现RLHF训练的普及化：

仅凭单个GPU，DeepSpeed-HE就能支持训练超过130亿参数的模型。这使得那些无法使用多GPU系统的数据科学家和研究者不仅能够轻松创建轻量级的RLHF模型，还能创建大型且功能强大的模型，以应对不同的使用场景。

完整的RLHF训练流程

为了提供无缝的训练体验，研究者遵循InstructGPT，并在DeepSpeed-Chat中包含了一个完整的端到端训练流程。

DeepSpeed-Chat的RLHF训练流程图示，包含了一些可选择的功能

流程包括三个主要步骤：

第 1 步：

监督微调 (SFT)，使用精选的人类回答来微调预训练的语言模型，以应对各种查询。

第 2 步：

奖励模型微调，用一个包含人类对同一查询的多个答案打分的数据集，来训练一个独立的（通常比SFT小）奖励模型（RW）。

第 3 步：

RLHF训练，在这一步，SFT模型通过使用近似策略优化（PPO）算法，从RW模型的奖励反馈进一步微调。

在步骤3中，研究者还提供了两个附加功能，来帮助提高模型质量：

– 指数移动平均线（EMA）的收集，可以选择一个基于EMA的检查点，进行最终评估。

– 混合训练，将预训练目标（即下一个词预测）与 PPO 目标混合，以防止在公共基准（如SQuAD2.0）上的性能回归。

EMA和混合训练这两个训练特征，常常被其他的开源框架所忽略，因为它们并不会妨碍训练的进行。

然而，根据InstructGPT，EMA检查点往往比传统的最终训练模型提供更好的响应质量，而混合训练可以帮助模型保持训练前的基准解决能力。

因此，研究者为用户提供了这些功能，让他们可以充分获得InstructGPT中描述的训练经验。

而除了与InstructGPT论文高度一致外，研究者还提供了功能，让开发者使用多种数据资源，训练自己的RLHF模型：

数据抽象和混合能力：

DeepSpeed-Chat配备了（1）抽象数据集层，以统一不同数据集的格式；以及（2）数据拆分/混合功能，从而使多个数据集被适当地混合，然后在3个训练阶段进行分割。

DeepSpeed混合引擎

指示引导的RLHF管道的第1步和第2步，类似于大模型的常规微调，它们由基于ZeRO的优化和DeepSpeed训练中灵活的并行策略组合，来实现规模和速度。

而管道的第3步是在性能影响方面最复杂的部分。

每个迭代都需要有效地处理两个阶段：a）推理阶段，用于token/经验的生成，产生训练的输入；b）训练阶段，更新actor和reward模型的权重，以及它们之间的互动和调度。

它引入了两个主要的困难：（1）内存成本，因为在整个第三阶段需要运行多个SFT和RW模型；（2）生成回答阶段的速度较慢，如果没有正确加速，将显著拖慢整个第三阶段。

此外，研究者在第三阶段增加的两个重要功能——指数移动平均（EMA）收集和混合训练，将产生额外的内存和训练成本。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

为了应对这些挑战，研究者将DeepSpeed训练和推理的全部系统能力组成了一个统一的基础设施，即混合引擎（Hybrid Engine）。

它利用原有的DeepSpeed引擎进行快速训练模式，同时毫不费力地应用DeepSpeed推理引擎进行生成/评估模式，为第三阶段的RLHF训练提供了一个更快的训练系统。

如下图所示，DeepSpeed训练和推理引擎之间的过渡是无缝的：通过为actor模型启用典型的eval和train模式，在运行推理和训练流程时，DeepSpeed选择了不同的优化，以更快地运行模型，并提高整个系统的吞吐量。

用于加速RLHF流程中最耗时部分的DeepSpeed混合引擎设计

在RLHF训练的经验生成阶段的推理执行过程中，DeepSpeed混合引擎使用轻量级的内存管理系统，来处理KV缓存和中间结果，同时使用高度优化的推理CUDA核和张量并行计算，与现有方案相比，实现了吞吐量（每秒token数）的大幅提升。

在训练期间，混合引擎启用了内存优化技术，如DeepSpeed的ZeRO系列技术和低阶自适应（LoRA）。

而研究者设计和实现这些系统优化的方式是，让它们彼此兼容，并可以组合在一起，在统一的混合引擎下提供最高的训练效率。

混合引擎可以在训练和推理中无缝地改变模型分区，以支持基于张量并行的推理，和基于ZeRO的训练分片机制。

它还可以重新配置内存系统，以便在每一种模式中最大限度地提高内存可用性。

这就避免了内存分配瓶颈，能够支持大的batch size，让性能大大提升。

总之，混合引擎推动了现代RLHF训练的边界，为RLHF工作负载提供了无与伦比的规模和系统效率。

天工大模型

中国首个对标ChatGPT的双千亿级大语言模型

115 查看详情

效果评估

与Colossal-AI或HuggingFace-DDP等现有系统相比，DeepSpeed-Chat具有超过一个数量级的吞吐量，能够在相同的延迟预算下训练更大的演员模型或以更低的成本训练相似大小的模型。

例如，在单个GPU上，DeepSpeed使RLHF训练的吞吐量提高了10倍以上。虽然CAI-Coati和HF-DDP都可以运行1.3B的模型，但DeepSpeed可以在相同的硬件上运行6.5B模型，直接高出5倍。

在单个节点的多个GPU上，DeepSpeed-Chat在系统吞吐量方面比CAI-Coati提速6-19倍，HF-DDP提速1.4-10.5倍。

团队表示，DeepSpeed-Chat能够获得如此优异的结果，关键原因之一便是混合引擎在生成阶段提供的加速。

以上就是人手一个ChatGPT！微软DeepSpeed Chat震撼发布，一键RLHF训练千亿级大模型的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/559808.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

自媒体如何利用短视频平台引流_利用短视频平台引流的自媒体技巧

上一篇 2025年11月10日 00:32:05

Linux Aliases命令有什么作用

下一篇 2025年11月10日 00:32:08

好文分享

如何添加html运行框_在网页中添加HTML代码运行框【添加】

可实时运行HTML代码的交互式编辑框可通过三种方案实现：一、CodeMirror+iframe动态执行，用document.write渲染；二、JSFiddle风格iframe沙箱，用srcdoc属性加载；三、Monaco Editor+Blob URL，提供专业编辑体验。如果您希望在网页中嵌入一…

程序猿
2025年12月23日
0000
好文分享

优化@font-face配置：确保自定义字体在移动设备上的兼容性与显示

本文深入探讨了自定义字体通过@font-face规则在移动设备上无法正确显示的问题，并提供了详细的解决方案。核心在于优化字体格式的声明顺序，强调优先使用ttf、woff2和woff等广泛支持的字体格式，以提升跨平台兼容性，确保自定义字体在包括各类移动设备在内的所有环境中均能稳定渲染。理解@font…

程序猿
2025年12月23日
0000
好文分享

解决移动设备上 @font-face 字体不显示的兼容性指南

移动设备上 @font-face 字体显示异常，常见原因是字体格式优先级配置不当。本文将深入探讨不同字体格式的兼容性，并提供一套优化后的 @font-face 声明最佳实践，确保自定义字体在各类设备和浏览器上都能稳定加载与显示。在现代网页设计中，自定义字体通过 @font-face 规则提供了丰富…

程序猿
2025年12月23日
0000
好文分享

vs中的html怎么运行环境_vs配置html运行环境步骤【指南】

在 Visual Studio 中运行 HTML 需通过 Web 项目模板并借助 IIS Express 服务。1. 安装 VS 时勾选“ASP.NET 和 Web 开发”工作负载；2. 创建 ASP.NET 项目，添加 HTML 页面；3. 编写代码后设为起始页，点击 IIS Express 运行…

程序猿
2025年12月23日
0000
好文分享

ai做html怎么运行_AI生成html运行步骤【教程】

答案是使用AI生成HTML代码后，将其保存为.html文件并用浏览器打开即可运行。具体步骤为：1. 在AI工具中输入需求生成HTML代码；2. 将代码复制到文本编辑器并另存为index.html，编码选UTF-8，类型选“所有文件”；3. 双击该文件用浏览器打开，若无法正常显示需检查文件后缀、编码及…

程序猿
2025年12月23日
0000
好文分享

HTML文本在span中怎么设置样式_HTML文本在span中如何局部调整字体与颜色

使用span标签结合style属性可对文本局部设置颜色、字体等样式；2. 推荐通过CSS类统一管理多处相同样式，提升可维护性；3. 中文建议设置Microsoft YaHei等常用字体并提供备选，颜色推荐十六进制值；4. 避免过多内联样式，保持结构与表现分离。在HTML中，标签常用于对文本的局部进…

程序猿
2025年12月23日
0000
好文分享

HTML文本与CSS怎么结合使用_HTML文本与CSS怎么结合实现丰富排版效果

HTML提供结构，CSS负责样式，二者结合可实现美观布局。1. 内联样式通过style属性直接设置，适用于单元素调整但难复用；2. 内部样式表置于head中，用style标签定义，适合单页统一排版；3. 外部样式表将CSS独立为文件，通过link引入，利于多页共享与维护，推荐使用；4. 关键CSS属…

程序猿
2025年12月23日
0000
好文分享

网站根目录下的神秘HTML文件：识别与管理域名所有权验证文件

网站根目录下发现的随机命名html文件，通常是用于验证域名或网站所有权的工具。本文将深入探讨这类文件的常见来源、作用及其在google search console等服务中的应用，并提供识别与管理建议，帮助网站管理员理解并妥善处理这些看似“多余”的文件。 1. 这类文件的神秘面纱在维护或更新一个既…

程序猿
2025年12月23日
0000
好文分享

Windows OneDrive同步HTML+CSS项目到多台电脑

使用OneDrive同步HTML+CSS项目可行，需将项目放入OneDrive文件夹并登录同一账号实现多端同步。应采用英文命名、避免特殊字符，使用相对路径引用资源，如href=”css/style.css”。推荐结构：my-website/下分设css、js、images目录…

程序猿
2025年12月23日
0000
好文分享

html代码怎么设置字体_html字体标签与CSS字体样式设置方法

可通过HTML标签或CSS样式自定义网页文字效果：一、使用标签设置字体名称、大小、颜色；二、利用内联style属性设置font-family、font-size、color等；三、在中用定义内部样式表；四、通过link引入外部CSS文件实现样式分离；五、使用@font-face引入Web字体，确保跨…

程序猿
2025年12月23日
0000
好文分享

Windows11 Widgets显示当前HTML使用的CSS文件数

Windows 11 Widgets 不提供网页技术统计功能，无法显示当前HTML使用的CSS文件数，其面板由系统应用渲染，仅支持通过任务栏或快捷键打开、添加组件、调整布局及个性化设置。 Windows 11 Widgets 功能本身是一个操作系统层面的界面组件，它不直接提供“显示当前HTML使用的…

程序猿
2025年12月23日
0000
好文分享

html如何改变字_HTML文字（字体/大小/颜色）修改方法

推荐使用CSS设置文字样式，通过style属性或样式表定义font-family、font-size和color；2. 可在标签内用style直接设置，或在style标签及外部文件中统一管理；3. 避免使用已废弃的font标签。在HTML中修改文字的字体、大小和颜色，主要通过内联样式（style属…

程序猿
2025年12月23日
1000
好文分享

OneDrive跨设备同步，HTML+CSS走到哪写到哪！

OneDrive通过云同步实现HTML和CSS代码跨设备实时协作。将项目存于OneDrive文件夹并登录账户，可自动同步至所有设备；在Surface Pro 9运行Windows 11环境下，使用Visual Studio Code打开OneDrive中的项目目录，保存即触发后台同步；移动端安装On…

程序猿
2025年12月23日
1000
好文分享

HTA中VBScript实现动态图像定位教程

本教程详细讲解如何在HTML应用程序（HTA）中利用VBScript动态控制HTML图像元素的位置。文章将阐述VBScript与DOM（文档对象模型）的交互机制，通过实际代码示例展示如何监听用户输入并实时更新图像的`top`和`left`样式属性，从而实现无需按钮即可响应式调整图像位置的功能。 HT…

程序猿
2025年12月23日
0000
html如何改字体_HTML字体样式（font-family/size）修改方法

通过CSS的font-family和font-size属性可设置网页字体类型与大小，示例包括使用Arial、微软雅黑等字体及px、em等单位，建议结合多个字体备选并用引号包裹中文字体名，推荐在style标签中全局统一设置以保持页面风格一致。在HTML中修改字体样式，主要通过CSS的font-fam…

程序猿
2025年12月23日 • 好文分享
1000
好文分享

html如何加入ppt_HTML内容嵌入PowerPoint演示文稿方法

可通过图片、插件、PDF或OneNote四种方式在PPT中嵌入HTML内容。1. 转为图片插入兼容性好但不可编辑；2. 用Web Viewer插件嵌入实时网页需联网且依赖插件；3. 导出为PDF再插入可保留排版与链接；4. 借助OneNote中转格式还原度高，支持富文本。根据需求选择合适方案即可实现…

程序猿
2025年12月23日
1000
好文分享

网站根目录中神秘HTML文件的真相：域名所有权验证指南

在网站根目录发现一个随机命名且内容单一的`.html`文件，这通常是用于证明域名所有权的验证文件。这类文件由google search console、bing webmaster tools等服务在网站设置时要求创建，以确认您对域名的控制权，是网站管理中的常见实践。理解网站根目录下的未知HTML…

程序猿
2025年12月23日
0000
好文分享

html 如何设置中文_HTML中文编码（UTF-8）与字体设置方法

首先设置HTML字符%ignore_a_1%为UTF-8，在head中添加meta标签；接着通过CSS的font-family指定微软雅黑、宋体等中文字体；若本地无字体则用@font-face引入网络字体；最后配置服务器发送Content-Type头包含charset=UTF-8以确保正确解析。如…

程序猿
2025年12月23日
0000
好文分享

如何用HTML插入标签云组件_HTML CSS3变换与随机颜色生成算法

使用HTML构建标签结构，CSS3添加旋转与过渡效果，JavaScript生成随机HSL颜色并设置字体大小，实现动态交互的标签云组件。要在网页中实现一个动态的标签云组件，结合 HTML、CSS3 变换和随机颜色生成算法，可以按照以下步骤操作。这个组件不仅能提升页面视觉效果，还能通过色彩和旋转增加交…

程序猿
2025年12月23日
0000
好文分享

html如何调用vbscript_HTML调用VBScript（脚本嵌入）方法

VBScript通过标签嵌入HTML，仅在IE中支持，现代浏览器已淘汰该技术。在HTML中调用VBScript，是通过将VBScript代码嵌入到HTML页面的标签中实现的。VBScript 是微软开发的一种脚本语言，主要在 Internet Explorer 浏览器中支持，因此该方法仅适用于I…

程序猿
2025年12月23日
0000