回顾NeurIPS 2023: 清华ToT推动大型模型成为焦点

程序猿 • 2025年11月7日 13:19:05 • 科技 • 阅读 0

近日，作为美国前十的科技博客，Latent Space对于刚刚过去的NeurIPS 2023大会进行了精选回顾总结。

在NeurIPS会议中，共有3586篇论文被接受，其中6篇获奖。虽然这些获奖论文备受关注，但其他论文同样具备出色的质量和潜力。实际上，这些论文甚至可能预示着AI领域的下一个重大突破。

那就让我们来一起看看吧！

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文题目：qlora: efficient finetuning of quantized llms

论文地址：https://openreview.net/pdf?id=OUIFPHEgJU

这篇论文提出了QLoRA，这是LoRA的一种更省内存但速度较慢的版本，它使用了几种优化技巧来节省内存。

总体而言，QLoRA使得在对大型语言模型进行微调时可以使用更少的GPU内存。

他们对一个新模型进行了微调，命名为Guanaco，仅用一个GPU进行了为期24小时的训练，结果在Vicuna基准测试中表现优于之前的模型。

与此同时，研究人员还开发了其他方法，如4-bit LoRA量化，其效果相似。

论文题目：DataComp: In search of the next generation of multimodal datasets

论文地址：https://openreview.net/pdf?id=dVaWCDMBof

多模态数据集在最近的突破中扮演着关键角色，如CLIP、Stable Diffusion和GPT-4，但与模型架构或训练算法相比，它们的设计并没有得到同等的研究关注。

为了解决这一机器学习生态系统中的不足，研究人员引入了DataComp，这是一个围绕Common Crawl的新候选池中的128亿个图文对进行数据集实验的测试平台。

使用者可以通过DataComp进行实验，设计新的过滤技术或精心策划新的数据源，并通过运行标准化的CLIP训练代码，以及在38个下游测试集上测试生成的模型，来评估他们的新数据集。

结果显示，最佳基准DataComp-1B，允许从头开始训练一个CLIP ViT-L/14模型，其在ImageNet上的零样本准确度达到了79.2%，比OpenAI的CLIP ViT-L/14模型高出3.7个百分点，以此证明DataComp工作流程可以产生更好的训练集。

论文题目：Visual Instruction Tuning

论文地址：https://www.php.cn/link/c0db7643410e1a667d5e01868827a9af

在这篇论文中，研究人员提出了首次尝试使用仅依赖语言的GPT-4生成多模态语言-图像指令跟随数据的方法。

通过在这种生成的数据上进行指令调整，引入了LLaVA：Large Language and Vision Assistant，这是一个端到端训练的大型多模态模型，连接了一个视觉编码器和LLM，用于通用的视觉和语言理解。

早期实验证明LLaVA展示了令人印象深刻的多模态聊天能力，有时展现出多模态GPT-4在未见过的图像/指令上的行为，并在合成的多模态指令跟随数据集上与GPT-4相比取得了85.1%的相对分数。

在对科学问答进行微调时，LLaVA和GPT-4的协同作用实现了92.53%的新的最先进准确性。

论文题目：Tree of Thoughts: Deliberate Problem Solving with Large Language Models

论文地址：https://arxiv.org/pdf/2305.10601.pdf

语言模型越来越多地被用于广泛的任务中进行一般性问题解决，但在推理过程中仍受限于标记级别、从左到右的决策过程。这意味着它们在需要探索、战略前瞻或初始决策起关键作用的任务中可能表现不佳。

为了克服这些挑战，研究人员引入了一种新的语言模型推理框架，Tree of Thoughts（ToT），它在促使语言模型方面推广了流行的Chain of Thought方法，并允许在一致的文本单元（思想）上进行探索，这些单元作为解决问题的中间步骤。

ToT使语言模型能够通过考虑多条不同的推理路径和自我评估选择来做出刻意的决策，以决定下一步行动，并在必要时展望或回溯以做出全局性的选择。

实验证明，ToT显著提高了语言模型在需要非平凡规划或搜索的三个新任务上的问题解决能力：24点游戏、创意写作和迷你填字游戏。例如，在24点游戏中，虽然使用Chain of Thought提示的GPT-4只解决了4%的任务，但ToT实现了74%的成功率。

论文题目：Toolformer: Language Models Can Teach Themselves to Use Tools

论文地址：https://arxiv.org/pdf/2302.04761.pdf

盘古大模型

华为云推出的一系列高性能人工智能大模型

35 查看详情

语言模型表现出在从少量示例或文本指令中解决新任务方面的显著能力，尤其是在大规模情境下。然而，令人矛盾的是，它们在基本功能方面（如算术或事实查找），相较于更简单且规模较小的专门模型，却表现出困难。

在这篇论文中，研究人员展示了语言模型可以通过简单的API自学使用外部工具，并实现两者的最佳结合。

他们引入了Toolformer，这个模型经过训练能够决定调用哪些API、何时调用它们、传递什么参数以及如何最佳地将结果合并到未来的token预测中。

这是以自监督的方式完成的，每个API只需要少量演示即可。他们整合了各种工具，包括计算器、问答系统、搜索引擎、翻译系统和日历等。

Toolformer在与更大模型竞争的时候，在各种下游任务中取得了明显改善的零样本性能，而不会牺牲其核心语言建模能力。

论文题目：Voyager: An Open-Ended Embodied Agent with Large Language Models

论文地址：https://arxiv.org/pdf/2305.16291.pdf

该论文介绍了Voyager，这是第一个由大型语言模型（LLM）驱动的，可以在Minecraft中连续探索世界、获取多样化技能并进行独立发现的learning agent。

Voyager包含三个关键组成部分：

自动课程，旨在最大程度地推动探索，

不断增长的可执行代码技能库，用于存储和检索复杂行为，

新的迭代提示机制，整合了环境反馈、执行错误和自我验证以改进程序。

Voyager通过黑盒查询与GPT-4进行交互，避免了对模型参数进行微调的需求。

根据实证研究，Voyager展现出强大的环境上下文中的终身学习能力，并在玩Minecraft方面表现出卓越的熟练度。

它获得了比先前技术水平高出3.3倍的独特物品，行进距离更长2.3倍，并且解锁关键技术树里程碑的速度比先前技术水平快15.3倍。

不过，虽然Voyager能够在新的Minecraft世界中利用学到的技能库从零开始解决新颖任务，但其他技术则难以泛化。

论文题目：Evaluating Cognitive Maps and Planning in Large Language Models with CogEval

论文地址：https://openreview.net/pdf?id=VtkGvGcGe3

该论文首先提出了CogEval，这是一个受认知科学启发的系统评估大型语言模型认知能力的协议。

其次，论文使用CogEval系统评估了八个LLMs（OpenAI GPT-4、GPT-3.5-turbo-175B、davinci-003-175B、Google Bard、Cohere-xlarge-52.4B、Anthropic Claude-1-52B、LLaMA-13B和Alpaca-7B）的认知地图和规划能力。任务提示基于人类实验，并且不在LLM训练集中存在。

研究发现，虽然LLMs在一些结构较简单的规划任务中显示出明显的能力，但一旦任务变得复杂，LLMs就会陷入盲区，包括对无效轨迹的幻觉和陷入循环。

这些发现不支持LLMs具有即插即用的规划能力的观点。可能是因为LLMs不理解规划问题背后的潜在关系结构，即认知地图，并在根据基础结构展开目标导向轨迹时出现问题。

论文题目：Mamba: Linear-Time Sequence Modeling with Selective State Spaces

论文地址：https://openreview.net/pdf?id=AL1fq05o7H

作者指出了目前许多次线性时间架构，如线性注意力、门控卷积和循环模型，以及结构化状态空间模型（SSMs），旨在解决Transformer在处理长序列时的计算效率低下问题。然而，这些模型在重要的语言等领域上并没有像注意力模型那样表现出色。作者认为这些

型的一个关键弱点是它们无法进行基于内容的推理，并进行了一些改进。

首先，简单地让 SSM 参数作为输入的函数，可以解决其离散模态的弱点，允许模型根据当前标记选择性地沿序列长度维度传播或忘记信息。

其次，尽管这种变化阻止了高效卷积的使用，但作者在循环模式下设计了一种硬件感知的并行算法。将这些选择性 SSM 集成到简化的端到端神经网络架构中，无需注意力机制，甚至不需要 MLP 模块 (Mamba)。

Mamba在推理速度上表现出色（比Transformers高5倍），并且在序列长度上呈线性缩放，在真实数据上的性能提高了，达到了百万长度序列。

作为一种通用的序列模型骨干，Mamba在语言、音频和基因组学等多个领域取得了最先进的性能。在语言建模方面，Mamba-1.4B模型在预训练和下游评估中均优于相同大小的Transformers模型，与其两倍大小的Transformers模型相匹敌。

虽然这些论文在2023年没有获得奖项，但比如Mamba，作为一种能够革新语言模型架构的技术模型，评估其影响还为时过早。

明年NeurIPS会如何走向，2024的人工智能和神经信息系统领域又会如何发展，虽然目前众说纷纭，但又有谁能打包票呢？让我们拭目以待。

以上就是回顾NeurIPS 2023: 清华ToT推动大型模型成为焦点的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/429862.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

ICLR为什么没有接受Mamba论文？AI社区掀起了大讨论

上一篇 2025年11月7日 13:18:32

近调查：45%求职者借助AI生成和提升简历

下一篇 2025年11月7日 13:19:34

好文分享

动态生成HTML表格：优化JavaScript数据展示与导出

本文旨在解决JavaScript中动态生成HTML表格时遇到的代码冗余和样式控制难题。通过引入数据驱动的编程思想，我们将数据与视图逻辑分离，首先将表格内容组织为JavaScript对象数组，然后利用一个通用的函数将这些结构化数据渲染为可读性强、易于维护且支持灵活样式的HTML表格字符串。这种方法不仅…

程序猿
2025年12月23日
0000
好文分享

HTML5性能优化怎么实现_HTML5新特性在性能优化方面的应用方法

HTML5通过语义化标签、Web Storage、Canvas/SVG、Service Worker和原生媒体支持等技术提升性能：1. 语义化标签优化渲染效率；2. Web Storage减少网络请求；3. Canvas/SVG降低资源加载量；4. Service Worker实现离线缓存；5. 原…

程序猿
2025年12月23日
0000
好文分享

利用UTM参数与GTM优化链接点击来源追踪

本文详细阐述了如何通过UTM参数精准追踪营销链接的点击来源，并深入探讨了Google Tag Manager (GTM) 在此过程中的高级应用。文章首先介绍了UTM参数的构成、生成方法及其在Google Analytics中的自动解析机制，强调其在识别流量来源方面的核心作用。随后，探讨了GTM如何通…

程序猿
2025年12月23日
0000
好文分享

如何通过HTML在线展示数据_HTML在线数据展示实现与可视化方案

网页展示数据需结合HTML、CSS与JavaScript，首选table展示结构化数据，配合Chart.js等库实现可视化图表，通过fetch加载远程JSON动态渲染内容，并利用响应式设计与交互优化提升用户体验。在网页中展示数据，核心是将结构化信息清晰、直观地呈现给用户。HTML本身是内容载体，结…

程序猿
2025年12月23日
0000
好文分享

html在线几何图形绘制 html在线SVG应用实战教程

使用HTML与SVG结合可高效绘制几何图形。SVG基于XML，支持圆形、矩形、多边形、路径等，在任意分辨率下清晰。1. 基础元素包括rect、circle、ellipse、line、polygon、polyline和path。2. 实战示例：用polygon绘制三角形，path绘制五角星和弧线仪表盘…

程序猿
2025年12月23日
0000
好文分享

单页应用（SPA）中特定分类数据的API直链访问与性能考量

针对单页应用（SPA），本文探讨了如何通过URL直接访问特定分类数据，而非依赖客户端UI交互。文章揭示了SPA在初始加载时已获取所有数据，因此客户端分类选择对数据加载量无影响。核心策略是绕过前端界面，直接调用后端API获取所需数据，从而实现高效且精准的数据访问，并提供了具体API示例。理解单页应用…

程序猿
2025年12月23日
1000
好文分享

jQuery循环中动态表格数据访问与比较教程

本文详细介绍了在jQuery循环中处理动态生成表格数据时常见的挑战与解决方案。我们将探讨如何正确使用.find()代替.children()来定位嵌套元素，解决.data()方法返回数字类型导致比较错误的问题，并提供一个基于事件监听的实用示例，以实现对用户修改数据的实时检测和保存。动态表格数据处理…

程序猿
2025年12月22日
0000
揭秘canvas技术在数据可视化中的独特威力

发现Canvas技术在数据可视化中的独特作用随着数据时代的到来，数据可视化成为了一种重要的方式来呈现大量的数据。在数据可视化中，Canvas技术以其独特的优势在各个领域展示了巨大的潜力。本文将着重介绍Canvas技术在数据可视化中的独特作用，并给出具体的代码示例。 Canvas是HTML5中的一个…

程序猿
好文分享 2025年12月21日
0000
好文分享

使用localstorage存储数据所需的包有哪些？

localstorage是HTML5中的一项重要技术，它可以用来在客户端本地存储数据。在使用localstorage存储数据之前，我们需要确保在代码中引入合适的包来操作这个功能。在使用localstorage之前，我们需要在HTML文件中添加以下代码来引入localstorage的相关包：在以上…

程序猿
2025年12月21日
0000
好文分享

无法将数据保存到localstorage，为什么？

为什么我的数据无法保存到localstorage中？本文将详细讨论为何在某些情况下，数据无法保存到本地存储(localstorage)中。同时，我将提供一些具体的代码示例以帮助您解决这个问题。首先，让我们来了解一下什么是localstorage。localstorage是HTML5中引入的一种W…

程序猿
2025年12月21日
0000
好文分享

如何将HTML表单数据作为文本并发送到html2pdf？

html2pdf 是一个 JavaScript 包，允许开发人员将 html 转换为 canvas、pdf、图像等。它将 html 作为参数并将其添加到 pdf 或所需文档中。此外，它还允许用户在添加 html 内容后下载该文档。在这里，我们将访问表单并使用html2pdf npm包将其添加到pd…

程序猿
2025年12月21日
0000
HTML中如何用post提交数据

http/1.1 协议规定的 http 请求方法有 options、get、head、post、put、delete、trace、connect 这几种。其中 post 一般用来向服务端提交数据，本文主要讨论 post 提交数据的几种方式 http/1.1 协议规定的 http 请求方法有 opti…

程序猿
好文分享 2025年12月21日
0000
服务端主动发送数据回客户端在H5里的实现步奏

我们知道，在server sent event里，通过eventsource对象接收服务器发送事件的通知是有三个事件的，message, open, error这三种，今天就给大家演示一下服务端主动发送数据回客户端在h5里的实现步奏。 Server Sent Event Server Sent Ev…

程序猿
好文分享 2025年12月21日
0000
好文分享

可视化图表制作_javascript数据展示

答案是使用JavaScript库如Chart.js、D3.js和ECharts可实现交互式数据可视化；其中Chart.js适合快速集成常见图表，D3.js适用于高度自定义的复杂图形，ECharts支持高级图表且中文文档完善；以Chart.js创建柱状图需引入库、添加canvas容器并初始化Chart…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS：深入理解订单与现金支付明细并高效调试

本教程旨在指导odoo 14 pos开发者如何准确读取销售会话中的订单及其现金支付明细，并计算总现金支付金额。文章将详细介绍odoo前端数据模型的访问方法，并着重强调利用浏览器开发者工具和`debugger`关键字进行运行时对象结构检查与调试的最佳实践，帮助开发者高效解决数据访问中的常见问题。 Od…

程序猿
2025年12月21日
0000
好文分享

Odoo 14 POS会话中现金支付金额的准确获取与调试指南

针对odoo 14 pos会话中读取订单并计算现金支付总额的需求，本文将详细指导如何正确访问支付明细对象属性。重点介绍利用浏览器开发者工具设置断点进行实时调试的方法，帮助开发者深入理解数据结构，从而高效准确地实现功能，避免因属性名称不匹配而导致的常见问题。 1. 理解Odoo POS数据模型在Od…

程序猿
2025年12月21日
0000
好文分享

javascript_如何实现数据可视化

JavaScript实现数据可视化需将数据转为图形，常用Chart.js、D3.js等库快速构建图表，或用Canvas/SVG原生绘图；通过fetch获取数据并动态更新视图，如Chart.js调用update()刷新，最终实现交互式可视化。 JavaScript 实现数据可视化，核心是将数据转换成图…

程序猿
2025年12月21日
0000
好文分享

Ionic 应用在浏览器刷新时状态持久化策略

当 ionic 应用在浏览器中被刷新时，浏览器会执行完整的页面重载，导致应用状态和数据丢失。本文旨在阐明为何无法阻止浏览器进行全面重载，并提供一个专业的解决方案：利用 capacitor preferences 等客户端存储机制来持久化关键应用状态和数据，确保在浏览器刷新后也能恢复应用到预期状态，从…

程序猿
2025年12月21日
1000
好文分享

Node.js中高效移除文本文件中的制表符（）

本文详细探讨了在node.js环境中从文本文件移除制表符（“）的有效方法。文章首先解释了为何常见的字符串替换尝试可能失败，强调了“和`t`在正则表达式中的区别。随后，提供了两种实用解决方案：直接使用正确正则表达式进行替换，以及通过按行处理数据实现更精细的控制。文章还包含了示例…

程序猿
2025年12月21日
0000
好文分享

Google 饼图数据格式化：如何在切片值中显示百分比符号

本文将详细介绍如何在 google 饼图的切片值和工具提示中正确显示百分比符号。通过利用 google charts 提供的 google.visualization.numberformat 类，开发者可以精确控制数值的显示格式，避免直接在后端数据库查询中进行字符串拼接，从而确保图表的正确渲染和数…

程序猿
2025年12月20日
0000

发表回复

登录后才能评论

回顾NeurIPS 2023: 清华ToT推动大型模型成为焦点

关于作者

相关推荐

发表回复