Transformer的开创性作品被反对，ICLR评审引发质疑！公众指责暗箱操作，LeCun透露类似经历

程序猿 • 2025年11月7日 13:19:48 • 用户投稿 • 阅读 0

去年12月，CMU和普林斯顿的2位研究者发布了Mamba架构，瞬间引起AI社区震动！

结果，这篇被众人看好有望「颠覆Transformer霸权」的论文，今天竟曝出疑似被顶会拒收？！

今早，康奈尔大学副教授Sasha Rush最先发现，这篇有望成为奠基之作的论文似乎要被ICLR 2024拒之门外。

并表示，「说实话，我不理解。如果它被拒绝了，我们还有什么机会」。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

在OpenReview上可以看到，四位审稿人给出的分数是3、6、8、8。

虽然这个分数未必会让论文被拒收，但是3分这样的低分，也是很离谱了。

牛文得3分，LeCun都出来喊冤

这篇由CMU、普林斯顿大学的2位研究人员发表的论文，提出了一种全新的架构Mamba。

这种SSM架构在语言建模上与Transformers不相上下，而且还能线性扩展，同时具有5倍的推理吞吐量！

论文地址：https://arxiv.org/pdf/2312.00752.pdf

当时论文一出，直接炸翻了AI社区，许多人纷纷表示推翻Transformer的架构终于诞生了。

而现在，Mamba论文有被拒可能性，让许多人无法理解。

就连图灵巨头LeCun也下场参与了这波讨论，表示遭遇过类似的「冤屈」。

「想当年，我被引数最多，仅在Arxiv提交的论文被引超过了1880次的论文，从未被接收」。

LeCun正是以使用卷积神经网络（CNN）在光学字符识别和计算机视觉方面的工作而闻名的，也因此在2019年获得了图灵奖。

不过他的这篇发表于2015年的《基于图结构数据的深度卷积网络》的论文，却从未被顶会接收。

论文地址：https://arxiv.org/pdf/1506.05163.pdf

深度学习AI研究员Sebastian Raschka称，尽管如此，Mamba在AI社区带来了深刻的影响。

近来一大波研究，都是基于Mamba架构衍生出来的，比如MoE-Mamba、Vision Mamba。

有趣的是，爆料Mamba被打低分的Sasha Rush，也在今天发表了一篇基于这样研究的新论文——MambaByte。

事实上，Mamba架构已经有了「星星之火可以燎原」的架势，在学术圈的影响力越来越广。

有网友表示，Mamba论文将开始占领arXiv。

「举个例子，我刚看到这篇论文提出了MambaByte，一种无token的选择性状态空间模型。基本上，它调整了Mamba SSM，直接从原始token中学习。」

Mamba论文的Tri Dao今天也转发了这篇研究。

如此大火的论文却被打出低分，有人表示，看来同行评审是真不关注营销的声音有多大啊。

Mamba论文被打3分的理由

给Mamba论文打低分的原因究竟是什么呢？

可以看到给打3分的审稿人，置信度还是5，说明自己对这个评分也是非常肯定。

在review中，他提出的问题分为两个部分：一是对模型设计的质疑，另一个是对实验提出疑问。

模型设计

– Mamba的设计动机是解决循环模型的缺点，同时提高基于Transformer模型的效率。有很多研究都是沿着这个方向进行的：S4-diagonal [1]、SGConv [2]、MEGA [3]、SPADE [4]，以及许多高效的Transformer 模型（如[5]）。这些模型都达到了接近线性的复杂度，作者需要在模型性能和效率方面将Mamba与这些作品进行比较。关于模型性能，一些简单的实验（如在Wikitext-103上进行语言建模）就足够了。

– 许多基于注意力的Transformer模型都展现出长度泛化的能力，即模型可以在较短的序列长度上进行训练，然后在较长的序列长度上进行测试。一些例子包括相对位置编码（T5）和 Alibi [6]。由于SSM一般都是连续的，那么Mamba是否具有这种长度泛化能力呢？

实验

– 作者需要与更强的基线进行比较。作者承认H3被用作模型架构的动机。然而，他们并没有在实验中与H3进行比较。从 [7] 的表4中可以看出，在Pile数据集上，H3的ppl分别为8.8（125M）、7.1（355M）和 6.0（1.3B），大大优于 Mamba。作者需要展示与H3的比较。

– 对于预训练模型，作者只展示了零样本推理的结果。这种设置相当有限，结果不能很好地证明Mamba的有效性。我建议作者进行更多的长序列实验，比如文档摘要，在这种情况下，输入序列自然会很长（例如，arXiv数据集的平均序列长度大于8k）。

– 作者声称其主要贡献之一是长序列建模。作者应该在LRA（Long Range Arena）上与更多基线进行比较，这基本上是长序列理解的标准基准。

– 缺少内存基准。尽管第4.5节的标题是「速度和内存基准」，但只介绍了速度比较。此外，作者应提供图8左侧更详细的设置，如模型层、模型大小、卷积细节等。作者能否提供一些直观的解释，说明为什么当序列长度非常大时FlashAttention的速度最慢（图8左）？

对于审稿人的质疑，作者也是回去做了功课，拿出了一些实验数据去rebuttal。

比如，针对模型设计第一点疑问，作者表示团队有意将重点放在大规模预训练的复杂性上，而不是小规模基准上。

尽管如此，mamba在wikitext-103上的表现还是大大优于所有建议的模型和更多模型，这也是我们在语言方面的一般结果所能预料到的。

首先，我们在与Hyena论文 [Poli, 表 4.3] 完全相同的环境下对Mamba进行了比较。除了他们报告的数据外，我们还调整了自己的强Transformer基线。

然后，我们将模型换成Mamba，它比我们的Transformer提高了1.7 ppl，比原始基线Transformer提高了2.3 ppl。

针对「缺少内存基准」这一点，作者表示：

与大多数深度序列模型（包括FlashAttention）一样，内存使用量只是激活张量的大小。事实上，Mamba的内存效率非常高；我们还额外测量了125M模型在一张A100 80GB GPU上的训练内存需求。每个批由长度为2048的序列组成。我们将其与我们所知的内存效率最高的Transformer实现（使用torch.compile的内核融合和FlashAttention-2）进行了比较。

笔墨写作

一款专注于各类公文写作的AI写作平台

62 查看详情

更多rebuttal细节，请查看https://openreview.net/forum?id=AL1fq05o7H

总的看下来，审稿人的意见，作者都已解决，然而这些rebuttal却被审稿人全部忽略了。

有人从这位审稿人的意见中找出了「华点」：或许他根本不懂什么是rnn？

全程围观网友表示，整个过程读起来太令人痛心了，论文作者给出了如此彻底的回应，但审稿人丝毫没有动摇，不再重新评估。

打出一个置信度为5的3分，还不理会作者有理有据的rebuttal，这种审稿人也太烦人了吧。

而其他三位审稿人，则给出了6、8、8这样的高分。

打6分的审稿人指出，weakness是「该模型在训练期间仍然像Transformer一样需要二次内存」。

打出8分的审稿人表示，文章的weakness只是「缺乏对一些相关著作的引用」。

另一位给8分的审稿人对论文大加赞赏，称「实证部分非常透彻，结果很强」。

甚至没发现任何Weakness。

分歧如此大的分型，应该有一个解释的。但目前还未有meta-reviewer评论。

网友大呼：学术界也衰落了！

在评论区，有人发出了灵魂拷问，究竟是谁打出了3这样的低分？？

显然，这篇论文用很低的参数获得了更好的结果，并且GitHub代码也很清晰，每个人都可以测试，因此已经赢得了坊间公认的赞誉，所以大家才都觉得离谱。

有人干脆大呼WTF，即使Mamba架构不能改变LLM的格局，它也是一个在长序列上有多种用途的可靠模型。竟然得到这个分数，是不是意味着如今的学术界已经衰落了？

大家纷纷感慨道，好在这只是四条评论中的一个，其他审稿人给出的都是高分，目前最终决定尚未做出。

有人猜测，可能是审稿人太累了，失去了判断力。

另外还有一种原因，就是State Space模型这样的全新研究方向，或许会威胁到某些在Transformer领域很有建树的审稿人专家，情况很复杂。

有人说，Mamba论文获得3分，简直就是业界的笑话。

他们如此专注于疯狂比较细颗粒度基准，但其实论文真正有趣的部分，是工程和效率。研究正在消亡，因为我们只关心SOTA，尽管它是在该领域极其狭窄子集的过时基准上。

「理论不够，工程太多。」

目前，这桩「谜案」还未水落石出，全体AI社区都在等一个结果。

以上就是Transformer的开创性作品被反对，ICLR评审引发质疑！公众指责暗箱操作，LeCun透露类似经历的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/429938.html

ai kite 数据

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

为什么VSCode的GitLens扩展很慢？

上一篇 2025年11月7日 13:19:44

Linux如何查看用户登录历史记录

下一篇 2025年11月7日 13:19:52

用户投稿

Golang JSON序列化：控制敏感字段暴露的最佳实践

本教程探讨golang中如何高效控制结构体字段在json序列化时的可见性。当需要将包含敏感信息的结构体数组转换为json响应时，通过利用`encoding/json`包提供的结构体标签，特别是`json:”-“`，可以轻松实现对特定字段的忽略，从而避免敏感数据泄露，确保api…

程序猿
2026年5月10日
0000
用户投稿

比特币新手教程比特币交易平台有哪些

比特币是一种去中心化的数字货币，基于区块链技术实现点对点交易，具有匿名性、有限发行和不可篡改等特点；新手可通过交易所购买，P2P交易获得比特币，常用平台包括Binance、OKX和Huobi；交易流程包括注册账户、实名认证、绑定支付方式、充值法币并下单购买，可选择市价单或限价单；比特币存储方式有交易…

程序猿
2026年5月10日
0000
用户投稿

c++中的SFINAE技术是什么_c++模板编程中的SFINAE原理与应用

SFINAE 是“替换失败不是错误”的原则，指模板实例化时若参数替换导致错误，只要存在其他合法候选，编译器不报错而是继续重载决议。它用于条件启用模板、类型检测等场景，如通过 decltype 或 enable_if 控制函数重载，实现类型特征判断。尽管 C++20 引入 Concepts 简化了部分…

程序猿
2026年5月10日
0000
用户投稿

Go语言mgo查询构建：深入理解bson.M与日期范围查询的正确实践

本文旨在解决go语言mgo库中构建复杂查询时，特别是涉及嵌套`bson.m`和日期范围筛选的常见错误。我们将深入剖析`bson.m`的类型特性，解释为何直接索引`interface{}`会导致“invalid operation”错误，并提供一种推荐的、结构清晰的代码重构方案，以确保查询条件能够正确…

程序猿
2026年5月10日
1000
用户投稿

Golang goroutine与channel调试技巧

使用go run -race检测数据竞争，结合runtime.NumGoroutine监控协程数量，通过pprof分析阻塞调用栈，利用select超时避免永久阻塞，有效排查goroutine泄漏、死锁和数据竞争问题。 Go语言的goroutine和channel是并发编程的核心，但它们也带来了调试上…

程序猿
2026年5月10日
0000
用户投稿

使用 Jupyter Notebook 进行探索性数据分析

Jupyter Notebook通过单元格实现代码与Markdown结合，支持数据导入（pandas）、清洗（fillna）、探索（matplotlib/seaborn可视化）、统计分析（describe/corr）和特征工程，便于记录与分享分析过程。 Jupyter Notebook 是进行探索性…

程序猿
2026年5月10日
0000
《魔兽世界》将于6月11日开启国服回归技术测试

《%ign%ignore_a_1%re_a_1%》官方宣布，将于6月11日开启国服回归技术测试，时间为7天，并称可以在6月内正式开服，玩家们可以访问官网下载战网客户端并预下载“巫妖王之怒”客户端，技术测试详情见下图。 WordAi WordAI是一个AI驱动的内容重写平台 53 查看详情以上就是《…

程序猿
2026年5月10日 • 用户投稿
2000
用户投稿

如何在HTML中插入表单元素_HTML表单控件与输入类型使用指南

HTML表单通过标签构建，包含action和method属性定义数据提交目标与方式，常用input类型如text、password、email等适配不同输入需求，配合label、required、placeholder提升可用性，结合textarea、select、button等控件实现完整交互，是…

程序猿
2026年5月10日
1000
用户投稿

创建指定大小并填充特定数据的Golang文件教程

本文将介绍如何使用Golang创建一个指定大小的文件，并用特定数据填充它。我们将使用 `os` 包提供的函数来创建和截断文件，从而实现快速生成大文件的目的。示例代码展示了如何创建一个10MB的文件，并将其填充为全零数据。掌握这些方法，可以方便地在例如日志系统或磁盘队列等场景中，预先创建测试文件或初始…

程序猿
2026年5月10日
0000
用户投稿

Python命令怎样使用profile分析脚本性能 Python命令性能分析的基础教程

使用Python的cProfile模块分析脚本性能最直接的方式是通过命令行执行python -m cProfile your_script.py，它会输出每个函数的调用次数、总耗时、累积耗时等关键指标，帮助定位性能瓶颈；为进一步分析，可将结果保存为文件python -m cProfile -o ou…

程序猿
2026年5月10日
0000
如何插入查询结果数据_SQL插入Select查询结果方法

使用INSERT INTO…SELECT语句可高效插入数据，通过NOT EXISTS、LEFT JOIN、MERGE语句或唯一约束避免重复；表结构不一致时可通过别名、类型转换、默认值或计算字段处理；结合存储过程可提升可维护性，支持参数化与动态SQL。将查询结果数据插入到另一个表中，可以…

程序猿
2026年5月10日 • 用户投稿
0000
用户投稿

使用 WebCodecs VideoDecoder 实现精确逐帧回退

本文档旨在解决在使用 WebCodecs VideoDecoder 进行视频解码时，实现精确逐帧回退的问题。通过比较帧的时间戳与目标帧的时间戳，可以避免渲染中间帧，从而提高用户体验。本文将提供详细的解决方案和示例代码，帮助开发者实现精确的视频帧控制。在使用 WebCodecs VideoDecod…

程序猿
2026年5月10日
0000
用户投稿

Debian Copilot的社区活跃度如何

debian copilot是codeberg社区维护的ai助手，旨在为debian用户提供服务。尽管搜索结果中没有直接提供关于debian copilot社区支持活跃度的具体数据，但我们可以通过debian社区的整体活跃度和特点来推断其活跃性。 Debian社区的一般情况： Debian拥有详尽的…

程序猿
2026年5月10日
0000
用户投稿

Discord.py 交互按钮超时与持久化解决方案

本教程旨在解决Discord.py中交互按钮在一段时间后出现“This Interaction Failed”错误的问题。我们将深入探讨视图（View）的超时机制，并提供通过正确设置timeout参数以及利用bot.add_view()方法实现按钮持久化的具体方案，确保您的机器人交互功能稳定可靠，即…

程序猿
2026年5月10日
0000
用户投稿

JavaScript 动态菜单点击高亮效果实现教程

本教程详细介绍了如何使用 JavaScript 实现动态菜单的点击高亮功能。通过事件委托和状态管理，当用户点击菜单项时，被点击项会高亮显示（绿色），同时其他菜单项恢复默认样式（白色）。这种方法避免了不必要的DOM操作，提高了性能和代码可维护性，确保了无论点击方向如何，功能都能稳定运行。动态菜单高亮…

程序猿
2026年5月10日
2000
用户投稿

c++如何实现UDP通信_c++基于UDP的网络通信示例

UDP通信基于套接字实现，适用于实时性要求高的场景。1. 流程包括创建套接字、绑定地址（接收方）、发送（sendto）与接收（recvfrom）数据、关闭套接字；2. 服务端监听指定端口，接收客户端消息并回传；3. 客户端发送消息至服务端并接收响应；4. 跨平台需处理Winsock初始化与库链接，编…

程序猿
2026年5月10日
1000
用户投稿

JavaScript函数中插入加载动画（Spinner）的正确方法

本文旨在解决在JavaScript函数中插入加载动画（Spinner）时遇到的异步问题。通过引入async/await和Promise.all，确保在数据处理完成前后正确显示和隐藏加载动画，提升用户体验。我们将提供两种实现方案，并详细解释其原理和优势。在Web开发中，当执行耗时操作时，显示加载动画…

程序猿
2026年5月10日
1000
用户投稿

使用 Pydantic v2 实现条件性必填字段

本文介绍了如何在 Pydantic v2 模型中实现条件性必填字段。通过自定义验证器，可以根据模型中其他字段的值来动态地控制某些字段是否为必填项，从而满足 API 交互中数据验证的复杂需求。本文提供了一个具体的示例，展示了如何确保模型中至少有一个字段被赋值。在 Pydantic v2 中，虽然没有…

程序猿
2026年5月10日
0000
三星不再独享，消息称搭载骁龙 8 Gen 3 领先版处理器新机即将发布

6 月 15 日消息，据博主@肥威今日爆料，搭载骁龙 8 Gen 3 领先版%ign%ignore_a_1%re_a_1%的新机即将发布，把之前的 for Galaxy 改成“for Everybody”。 Pic Copilot AI时代的顶级电商设计师，轻松打造爆款产品图片 158 查看详情 …

程序猿
2026年5月10日 • 用户投稿
1000
用户投稿

动态更新圆形进度条：JavaScript成绩计算器集成指南

本文档旨在指导开发者如何将JavaScript成绩计算系统与动态圆形进度条集成，实现可视化展示平均成绩。我们将详细讲解如何修改现有的JavaScript代码，使其在计算出平均分后，能够动态更新圆形进度条的进度，从而提供更直观的用户体验。本文档包含详细的代码示例和注意事项，帮助开发者轻松实现这一功能。…

程序猿
2026年5月10日
0000