AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

如果面前有两个 ai 助手:一个很聪明但经常不守规矩,另一个很听话但不太聪明,你会怎么选?

最近,上海人工智能实验室与香港中文大学的研究团队发布了论文《Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models》,通过一个全新的评测基准MathIF揭示:

模型越擅长复杂推理,越容易忽略用户的指令要求,”聪明” 和 “听话” 之间存在明显的矛盾。

这项工作的灵感,源自实际使用推理模型(如 o3)过程中的一个意外发现:相比许多经过强化推理训练的大模型,GPT-4o 在执行具体指令时反而更加 ” 听话 ” 。也正是这种 ” 越聪明、越不听话 ” 的真实体验,让研究团队开始系统性地研究推理能力与指令跟随之间的关系。

这一研究也引来知名博主的转发:

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

研究揭示越擅长数学推理的模型反而越难完全遵守指令,同时分析了模型大小与服从性的非正相关现象,强调了推理能力与指令遵循之间的权衡。

MathIF:衡量推理模型 ” 听话程度 ” 的新基准

MathIF 基准专门针对数学推理任务,考察 AI 模型是否严格遵循用户给出的指令要求。这些要求包括格式、语言、长度和特定关键词使用,均可通过程序自动验证。

MathIF 由来自不同难度的数学题目组成,涵盖了从简单的数学问题(GSM8K)到复杂的数学竞赛题目(AIME)。每个题目都会附带具体而明确的指令,比如:” 答案必须以一句中文完整作答,不能有多余解释。”

此外,MathIF 还设计了单一指令、双重指令和三重指令的组合情形,以测试模型在不同约束复杂程度下的表现。模型不仅需要正确解题,还要严格遵守这些指令要求。

自动评分程序会精确检查答案是否符合每个具体的指令标准,分别以硬准确率(HAcc)和软准确率(SAcc)衡量模型的服从程度:HAcc 表示是否全部指令都被满足,而 SAcc 则反映每条指令的平均满足比例。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 1 MathIF 的指令类型越聪明越不听话?实验揭示 ” 聪明 ” 与 ” 听话 ” 的矛盾

研究团队使用 MathIF 评测了23个当前主流的大模型。这些模型包括不同的参数规模和训练方式,涵盖从数十亿到数百亿参数的各种类型。

实验结果令人意外:在数学推理能力表现越出色的模型,反而更难完全遵守用户给定的指令要求。即使是表现最佳的模型Qwen3-14B,也只能成功遵守一半的指令提示。

此外,模型的大小与其遵守指令的能力并不呈正相关,甚至有时会出现负相关——即更大的模型并不一定更守规矩。一些较小的模型反而更善于严格执行用户的指令。

指令遵循(instruction-following)与数学推理能力(mathematical reasoning)之间存在一种权衡关系(trade-off)。也就是说,当模型在推理能力上表现得更强时,它往往更容易忽略或违反用户的具体指令。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 2 23 个大推理模型在 MathIF 上的表现

模型按服从性(HAcc + SAcc)表现从高到低排序。表中符号表示该模型仅通过监督微调(SFT)训练,未使用推理导向的强化学习方法。粗体 + 下划线标记则分别代表各列指标中的前两名与后两名。

为什么聪明模型更 ” 不听话 “?

研究团队进一步分析了这个现象背后的原因:

原因一:推理导向的训练模式

研究发现,旨在强化模型推理能力的训练方式(如监督微调(SFT)和强化学习(RL)),虽然显著提升了模型的 ” 智力 “,却在一定程度上削弱了其对具体指令的敏感性。

这类模型往往更专注于如何准确解题,而容易忽视诸如格式、字数等细节要求。正如图 3 所示,无论是 SFT 还是 RL,推理导向训练虽然提升了解题表现,却普遍导致模型在指令遵循能力(HAcc 与 SAcc)上的下降。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 3 推理导向训练策略的对比

其中 Avg. Acc. 表示在所有基准任务上的平均表现。绿色和红色背景分别表示相较于基础模型性能的提升和下降。

原因二:长推理链降低服从性

模型输出的推理过程越长(” 链式思考 ” 越复杂),越容易 ” 忘记 ” 指令要求。长段的复杂推理过程,容易让模型注意力分散,最后导致违背用户指令。如下图,将模型的推理结果按照长度进行分桶,推理长度越长,模型的指令遵循准确率越低。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 4 不同推理链长度区间下的 HAcc 和 SAcc 表现

长度分桶编号越大表示生成的推理链越长。

研究团队通过实验进一步验证了这一现象:当模型被引导生成更长的推理过程时,其遵循指令的准确率会明显下降。

具体做法是,在模型推理结束前人为添加 “wait” 等提示,迫使其继续延长思考过程,从而生成更长的推理链。如下图所示,” 思考越多 “,模型对指令的执行反而越不准确。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 5 模型指令跟随能力的变化趋势

此外,研究团队还通过在训练阶段控制模型的推理长度,进一步观察其指令跟随能力的变化。

具体而言,他们在强化学习(RL)的 rollout 阶段设置最大生成长度限制,超过该长度的回复将无法获得奖励,从而间接压缩模型的推理链长度。

从下图可以看出,限制推理长度有助于显著提升模型的指令遵循能力(HAcc 和 SAcc)。当最大长度控制在 1k 以内时,模型在服从性方面的表现甚至超过了原始基线模型。

然而,这种提升也带来了代价:模型的数学推理能力明显下降,表现出 ” 听话 ” 和 ” 聪明 ” 之间的权衡关系。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 6 RL 训练中最大响应长度的影响

红色区域表示相较于基础模型(Original)性能下降,颜色越深表示下降幅度越大。

这些现象进一步印证了研究团队的结论:偏向生成更长推理链的推理导向训练,往往会在无意中削弱模型对指令的遵循能力,凸显了推理能力与指令服从性之间长期存在的权衡关系。

小技巧:让模型更 ” 听话 ” 的简单方法

研究者也尝试了一个简单的方法改善模型的 ” 听话程度 “:在模型推理结束后,输出答案之前,再次重复一遍指令要求。

结果显示,这种方法拉近了指令和回复的距离,确实有效提升了模型的指令遵守能力,但同时也稍微降低了模型回答问题的准确率。模型为了遵守规则,不得不牺牲一点自己的数学推理能力。

AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%

△图表 7 通过在推理后重复指令提升指令遵循能力。

当前主流的推理导向训练方式,虽然显著提升了模型的解题能力,却不可避免地削弱了其对指令的遵循能力。AI 的 ” 聪明 ” 与 ” 听话 ” 之间,正面临一场难以调和的矛盾。

未来,MathIF 基准有望构建既能深入思考,又能严格守规矩的大模型。

论文地址:https://arxiv.org/pdf/2505.14810

Github 地址:https://github.com/TingchenFu/MathIF

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

点亮星标

科技前沿进展每日见

以上就是AI 越聪明越不听话!新研究:最强推理模型指令遵循率仅 50%的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/150169.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
SQL Manager修改数据库表行格式的方法
上一篇 2025年12月3日 05:33:05
四步实现视频会议协同功能
下一篇 2025年12月3日 05:33:57

相关推荐

  • 小米Civi 3前置摄像头像素是多少 小米Civi 3自拍模式优化技巧

    小米Civi 3前置双3200万像素摄像头,配备78°f/2.0光圈主摄和100°超广角镜头,支持AF对焦与AI畸变矫正;通过切换镜头、开启4K拍摄、调节美颜、优化光线及启用EIS防抖,可显著提升自拍与Vlog画质表现。 小米Civi 3的前置摄像头配置在同级别中非常突出,自拍表现力强,配合一些使用…

    2026年9月20日
    100
  • 美篇如何添加背景音乐

    首先通过美篇内置音乐库或本地导入音频添加背景音乐,再调整自动播放与音量设置,确保阅读体验沉浸且不突兀。 如果您在编辑美篇文章时希望增加背景音乐以提升阅读体验,但不清楚具体操作步骤,可以按照以下方法进行设置。背景音乐能够为图文内容增添氛围,使读者获得更沉浸的浏览感受。 本文运行环境:iPad Air,…

    2026年9月20日
    100
  • Java类的初始化顺序是怎样的 静态代码块和构造代码块先后

    Java类初始化顺序为:父类静态成员→子类静态成员→父类实例成员→父类构造函数→子类实例成员→子类构造函数,静态代码块仅加载时执行一次,构造代码块每次创建对象时执行,且均按书写顺序运行。 Java类的初始化顺序遵循一定的规则,理解这些顺序对掌握对象创建过程非常重要。当一个类被加载并创建实例时,各个代…

    2026年9月20日
    100
  • 淘宝收藏商品降价自动提醒怎么设置?如何收藏商品呢?淘宝收藏商品降价提醒这样设!1年能省3000+!手把手教你捡漏神操作!

    在淘宝琳琅满目的商品中,是否曾因价格偏高而犹豫下单?收藏并开启降价自动提醒功能,正是帮你抓住最佳入手时机的秘密武器。无论你是刚需采购,还是长期观望心仪好物,只需简单设置,系统便会在商品降价时通过淘宝消息中心、短信或app推送第一时间通知你,轻松实现“低价入手,省心又省钱”。 一、为什么你需要降价提醒…

    2026年9月20日
    100
  • Java从文本文件随机读取多行连续内容的教程

    本教程旨在指导java开发者如何高效地从文本文件中随机读取并打印指定数量(例如5行)的连续内容,尤其适用于处理结构化文本块(如诗歌)。我们将探讨如何避免仅读取文件开头固定行数的局限,通过将文件内容一次性加载到内存并结合随机数生成器来精确选取所需的文本块,从而实现真正的随机性与灵活性。 引言与问题分析…

    2026年9月20日
    200
  • Workerman与WebAssembly(Wasm)的交互实践

    workerman和wasm结合使用是为了在高性能服务器环境中引入wasm的沙箱化和跨平台能力,实现更灵活、安全和高效的服务端应用。1) wasm模块的编译与加载:使用编译工具链将wasm模块编译成二进制文件并在workerman中加载。2) wasm模块的调用:通过php扩展或外部程序(如exec…

    2026年9月20日
    000
  • 如何调整VSCode的设置以获得最佳性能?

    合理配置VSCode可显著提升性能。1. 禁用不必要扩展,减少后台资源占用;2. 在settings.json中设置files.watcherExclude和search.exclude以降低CPU负载;3. 启用editor.renderLineHighlight和largeFileOptimiz…

    2026年9月20日
    500
  • ChatGPT代码会出错吗_AI编程中5个常见错误及解决方法

    AI编程中常见错误包括语法不匹配、逻辑遗漏、API误用、安全漏洞和集成困难,需通过版本明确、测试验证、文档核对、安全扫描和上下文补充等方式解决,结合人工审查与测试才能确保代码质量。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ ChatGP…

    2026年9月20日
    100
  • 或为《刺客信条:起源》相关!巴耶克与艾雅动捕同框

    面容虽被遮挡,但魅力依旧啊!AI 伴学 + 轻薄便携,联想小新平板 12.1,开售啦! 帅是帅,就是比较废指头 FK阿凯 1.4万 0 《刺客信条:起源》的粉丝们近日惊喜地发现,曾为巴耶克与艾雅配音并进行面部捕捉的演员——阿布巴卡尔·萨利姆(Abubakar Salim)与艾莉克斯·威尔顿·里根(A…

    2026年9月20日
    000
  • RBAC(基于角色的权限控制)实现方案

    rbac重要,因为它通过角色管理权限,简化了权限管理,提高了系统安全和管理效率。实现rbac时:1.设计数据库结构,定义用户、角色、权限表及中间表;2.在代码中实现权限检查和角色、权限的动态管理;3.优化性能,防止权限泄露,管理角色膨胀。 在探讨RBAC(基于角色的权限控制)实现方案之前,让我们先来…

    2026年9月20日
    000
  • 腾讯元宝AI便捷体验入口 腾讯元宝网页版在线入口

    腾讯元宝AI便捷体验入口为https://yuanbao.tencent.com,支持网页版、手机APP及微信小程序访问,提供智能问答、文档解析、内容生成等多功能服务。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 腾讯元宝AI便捷体验入口…

    2026年9月20日
    000
  • Android Activity与Fragment通信及视图访问的最佳实践

    本文旨在解决android开发中activity与fragment之间视图访问和数据通信的常见问题,特别是当使用bottom navigation activity模板时。我们将探讨为何不能直接在activity中访问fragment视图,并详细介绍如何利用fragment的生命周期方法(如`onv…

    2026年9月20日
    100
  • Gemini2.5网页版访问入口_Gemini2.5官方网站下载链接

    Gemini 2.5网页版访问入口为 https://gemini.google.com/app,登录谷歌账号后可使用主交互界面、模型切换、文件上传、历史记录及移动端同步等功能。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Gemini2…

    2026年9月20日
    000
  • Java Swing:在类中管理 JFrame 实例的两种策略

    本文探讨在 java swing 应用程序中,如何有效地在不同方法中访问和管理 jframe 实例,避免 this 关键字的限制。我们将介绍两种核心策略:将 jframe 作为类成员变量,或使类直接继承 jframe。同时,强调组件应添加到 jframe 的内容面板,而非直接添加到 jframe。 …

    2026年9月20日
    000
  • VSCode的扩展推荐是怎么工作的?

    VSCode的扩展推荐基于用户行为和项目环境智能生成,当你打开.py文件时会推荐Python相关工具,打开.ts、.vue等文件则触发对应语言插件;系统通过分析package.json、requirements.txt等依赖文件识别技术栈,推荐Docker、ESLint等匹配扩展;同时记录常用操作如…

    2026年9月20日
    000
  • Linux怎么查看进程使用的端口号

    答案是使用netstat、ss或lsof命令可查看Linux进程占用的端口。首先推荐ss命令,如ss -tulnp | grep 8080,能快速显示监听端口及对应进程;其次netstat -tulnp | grep 8080用法类似,但速度较慢;lsof -i :8080可精确查看指定端口的进程信…

    2026年9月20日
    000
  • 内存占用过高的优化方法

    优化内存占用的方法包括:1. 遵循基本内存管理原则,避免不必要的对象创建,使用合适的数据结构,及时释放资源;2. 优化数据结构,如从arraylist切换到hashmap;3. 检测并修复内存泄漏,通过定期清理不再需要的数据;4. 使用对象池减少对象的创建和销毁;5. 遵循性能优化与最佳实践,避免频…

    2026年9月20日
    000
  • iPhone命名或跳过19

    iPhone命名或跳过19 近日,科技圈内流传着一个引人瞩目的猜测:苹果公司在为其未来产品命名时,可能会选择直接跳过“iphone 19”这个名称。这一传闻并非空穴来风,而是基于苹果公司以往的命名策略、行业发展趋势以及对品牌形象的整体考量。如果成真,这将是iphone命名史上一个值得记录的时刻。 历…

    2026年9月20日
    100
  • 2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    10月17日,有调研机构发布了2025中国汽车品牌口碑指数nps。其中,小米汽车与aito问界品牌的nps(净推荐值)均仅为44分,远低于行业头部品牌。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 小米汽车 报告显示,新能源汽车主流品牌的…

    2026年9月20日 用户投稿
    000
  • 当VSCode启动或运行变慢时,有哪些系统性的排查和优化步骤?

    答案:VSCode变慢主要由扩展、文件监控和设置引起。先以安全模式启动排查扩展影响,使用内置性能工具分析启动耗时,优化工作区的文件监听与搜索范围,调整渲染设置并清理缓存,可显著提升运行效率。 VSCode 启动或运行变慢通常涉及扩展、设置、系统资源或文件索引等问题。以下是系统性的排查与优化步骤,帮助…

    2026年9月20日
    000

发表回复

登录后才能评论
关注微信