首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

推理模型常表现出类似自我反思的行为,但它们是否真的能有效探索新策略?

对此,西北大学与 Google、谷歌 DeepMind 团队对传统强化学习与反思的关系提出质疑,并提出了贝叶斯适应的强化学习方法,首次解释了为何、如何以及何时应进行反思和探索。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

通过对比采用传统强化学习和新方法训练的模型,研究人员发现:

在完成“模型需在3步内输出三个连续相同字符”的合成任务中,传统RL往往一条道走到黑,而新方法懂得排除无效假设并适时切换策略。

此外,在数学推理任务中,新方法在大多数基准和模型上均获得了更高的准确率,且解题所耗token数更少。

更有趣的是,团队发现反思次数并非决定性能的唯一因素,部分基础模型虽有大量徒劳的反思,但并未带来实质性信息增益。

以下详细展开。

贝叶斯自适应强化学习激发反思性探索

直观来看,测试时的试错步骤仅在能带来信息增益时才有益,然而现有强化学习并未告知模型试错和反思带来的信息增益。

实际上,基于马尔可夫假设的传统强化学习范式存在局限——探索仅发生于训练阶段,代理在部署时通常只利用训练中学到的确定性策略。

马尔可夫假设使RL代理仅依据当前状态做决策,历史信息(如试错并回溯的思考过程)对策略的影响都被压缩至当前状态表示中。

研究者指出,这种传统范式可能导致模型通过记忆训练解答获得高分,而无需真正学会反思;模型内部思考的试错也无法提供信息增益。

那么,测试时的反思性探索真的有用吗?如何才能学到有效的反思性探索策略呢?

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

为了解决上述问题,研究者研究了与传统RL不同的贝叶斯自适应RL框架,简称BARL。

其核心思想是将LLM的反思性探索转化为贝叶斯自适应强化学习问题处理,通过引入对环境不确定性的建模,让模型在推理过程中自适应地进行探索。

简而言之,BARL不再局限于传统RL的马尔可夫假设,而是考虑了MDP的不确定性(如不同策略对一道题的有效性),因此需要将所有历史观察(包括奖励反馈)纳入决策中。

这种框架天然平衡了奖励最大化的利用和信息获取的探索。

具体而言,在BARL中,团队假设模型面对的是一个存在未知要素的任务,可以用一组假设的MDP(马尔可夫决策过程)来描述这些不确定性。

模型对每个假设MDP保持一个后验概率(belief),随着推理过程不断更新。

每当模型选择一个动作(如生成下一个思维步骤),都会根据观察到的结果更新对各个假设的信念。

BARL的目标策略并非针对单一确定环境优化,而是直接优化在后验分布下的期望累积回报。这意味着模型在决策时会考虑“这样做收益是多少,同时这样的行动能多大程度减少不确定性?”。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

BARL明确将测试时的表现纳入优化目标,通过最大化后验下的期望回报鼓励模型考虑未知情况。

模型明白只有主动探索才能在未知情境下保持高收益,因此反思是为了获取关键信息,避免一条路走错到底。

简而言之,BARL让模型意识到——

适时反思、多一种尝试可能带来更高的回报,这正是反思行为得以涌现的动机。

全新推理模型强化学习算法

研究者针对推理模型给出了BARL决策的数学形式,其中核心是如何计算后验的期望值:

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

该公式针对多个候选答案(如best-of-N中的N个答案)计算了预期回报加权求和,权重一方面是模型认为该候选答案的好坏,另一方面还包含了一个“校正项”——用来衡量实际观察结果与模型预期的偏差。

正是这个校正项充当了反思信号:如果某个策略原本被模型高度看好,但奖励反馈结果不尽如人意,那这个差异会迅速降低该假设的权重,提醒模型“也许该换一种思路了”,这正回答了模型应该何时进行反思和探索。

通过这种机制,BARL的决策公式指导模型在每个步骤判断是否需要反思、何时切换策略。

这也是BARL反思性决策的精髓——让模型基于贝叶斯后验来权衡“继续当前思路”还是“尝试新思路”。

这种更新过程鼓励模型拼接和切换不同的推理策略,就像把多条可能的解题思路串联起来,并在中途发现某条思路行不通时迅速切换到另一条。

BARL通过端到端的RL优化自动实现了这一点,可谓以原则化的方式赋予了LLM在推理过程中的“何时反思、如何反思”的指南,达到了以一条长CoT线性化best-of-N的效果。

合成任务案例:更清楚的对比RL和BARL

为了直观展示BARL如何在测试时展现反思探索能力,作者设计了一个合成任务:模型需要在3步内输出三个连续相同的字符(0/1/2),才能获得奖励。

训练阶段,提示(prompt)字符只会是0或1,模型学会了对应输出000或111来拿到奖励;但测试时,提示字符变为了2。

直觉上,训练时学到的确定性策略在遇到新字符时将不再有效,需要模型即时探索正确的输出模式。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

让两个模型来挑战这个任务:一个用传统马尔可夫RL训练,另一个用BARL方法训练。

Markovian RL很快便最大化了训练准确率,几乎将这些答案背了下来。

BARL在训练中同样学会了正确输出模式,但更有趣的是,它同时学会了根据不确定性来调整策略——这一点要等到测试才能看出差别。

测试阶段揭示了截然不同的行为。即当提示变为新字符2时,Markovian RL由于在训练中只记住了固定的输出(000/111)无法泛化,因此几乎总是答错,测试准确率接近于零。

而BARL代理则展现出“反思”能力。它会先尝试某个策略,如果初步尝试未获得奖励,就迅速反思切换,尝试另一种可能的序列。

下图形象说明了Markov RL和BARL在该合成任务中的决策差异——

Markov策略一条路走到黑,BARL策略则懂得排除无效假设,适时切换新策略。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

可以看到,左图中马尔可夫RL模型训练时成绩很快逼近100%,但测试时几乎完全失败,中图的BARL模型则不仅训练表现提升,在测试时也取得了显著的高准确率。

值得注意的是,右图显示如果事先给予BARL一些关于任务结构的先验知识(如“奖励模式就是某个字符重复三次”),它的收敛速度和最终成绩还会更好。

这说明了候选策略既要有多样性以覆盖未知情况,又要有合理的可信度以不至于无谓浪费精力。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

数学推理任务:性能全面提升,显著节省Token

研究人员还将BARL应用于LLM的数学推理领域,并比对了GRPO和“Progress”奖励基线(给予正确答案概率的分步奖励)。

BARL在大部分基准和模型上均取得了更高的准确率。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

不仅如此,BARL还展现出更高的效率优势。

作者特别度量了每种方法为解出题目所耗费的token数量,结果发现在达到同等甚至更高准确率的情况下,BARL生成的内容要短得多。

 首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

这意味着,BARL模型并不会为了“多反思几次”而付出冗长啰嗦的代价,反而因为每次反思都更有针对性、更有效。

作者还观察到另一个有趣的现象:反思次数本身并非决定性能的唯一因素。

基础模型往往出现很多徒劳的反思,并没有带来实质的信息增益。相比之下,BARL的反思行为更加“有目的性”。

![](/uploads/2025060

以上就是首次解释 LLM 如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/85389.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
怎么关闭客户管理优惠券
上一篇 2025年11月17日 05:10:28
管理客户助手怎么用不了
下一篇 2025年11月17日 05:10:55

相关推荐

  • 前7月新能源SUV累计销量榜:理想L6第四 增长73.5%

    乘联会数据显示,2025年1-7月我国新能源suv累计销量达304.1万辆,同比增长28.5%。其中,7月单月零售量为46.5万辆,尽管环比下降15.2%,但同比仍保持强劲增长,市场整体发展势头良好。从销量top100榜单来看,新能源suv市场呈现出几大显著特征: ☞☞☞AI 智能聊天, 问答助手,…

    2026年9月21日
    100
  • 《哈迪斯2》95分年度必玩!外媒锐评”独立游戏崛起”

    《哈迪斯2》95分年度必玩!外媒锐评”独立游戏崛起”《哈迪斯2》95分年度必玩!外媒锐评”独立游戏崛起”《哈迪斯2》95分年度必玩!外媒锐评”独立游戏崛起”《哈迪斯2》95分年度必玩!外媒锐评”独立游戏崛起”

    外媒comicbook报道,2025年是游戏界的辉煌之年,多款新作在metacritic上评分突破90分,并获得“必玩”徽章。 《哈迪斯2》以95分的成绩成为本年度评分最高的游戏,强势领跑年度最佳游戏(GOTY)的激烈竞争,独立游戏的全面崛起也成为今年最瞩目的行业亮点。 《哈迪斯2》:95分封神,战…

    2026年9月21日 用户投稿
    100
  • mac怎么用命令行定时关机_Mac命令行定时关机方法

    使用shutdown命令可设定Mac在指定时间或相对分钟后关机;2. 通过pmset命令能创建每周重复的定时关机任务;3. 可用pmset -g sched查看计划,sudo pmset repeat cancel取消重复任务,kill终止一次性关机。 如果您希望在离开电脑后让Mac在特定时间自动关…

    2026年9月21日
    100
  • 外媒盘点即将上线的开放世界大作!哪款让你最心动?

    外媒盘点即将上线的开放世界大作!哪款让你最心动?外媒盘点即将上线的开放世界大作!哪款让你最心动?外媒盘点即将上线的开放世界大作!哪款让你最心动?外媒盘点即将上线的开放世界大作!哪款让你最心动?

    外媒gamerant近日整理了即将在2025至2026年上线的开放世界游戏大作,这些作品不仅在玩法上推陈出新,更凭借顶级视觉表现重新定义沉浸式体验。 1. 《红色沙漠》(Crimson Desert) 特色:独立动作RPG,虽出自《黑色沙漠》团队之手,但剧情与系统全面独立,主打类似格斗游戏的精准战斗…

    2026年9月21日 用户投稿
    100
  • 2025年10月1日至12日全国批发54.6万辆 同比下降11%

    2025年10月1日至12日,全国乘用车市场呈现先抑后扬的发展趋势。根据乘用车市场信息联席会(乘联分会)最新发布的数据,该时间段内乘用车厂家批发销量为54.6万辆,同比下滑11%,较9月同期减少15%;市场零售销量达68.6万辆,同比下降8%,但相较上月同期增长12%。今年累计来看,乘用车批发总量已…

    2026年9月21日
    100
  • 微软 Windows 10 停服在即,官方升级工具却突然罢工

    10月13日,随着Windows 10的官方支持即将于次日(10月14日)正式终止,微软近期加大了对Windows 11的宣传力度,频繁推出广告和推广活动,强调新系统的多项升级与优势,吸引了不少用户考虑迁移至Windows 11。 然而颇具讽刺意味的是,在这一关键节点,微软自家的关键工具却出现了故障…

    2026年9月21日
    100
  • 新装备新任务!《怪物猎人:荒野》限时举办活动“梦灯之仪”

    新装备新任务!《怪物猎人:荒野》限时举办活动“梦灯之仪”新装备新任务!《怪物猎人:荒野》限时举办活动“梦灯之仪”新装备新任务!《怪物猎人:荒野》限时举办活动“梦灯之仪”新装备新任务!《怪物猎人:荒野》限时举办活动“梦灯之仪”

    近日,《怪物猎人:荒野》官方宣布,将于2025年10月22日至11月12日限时开启季节性活动“交流祭典【梦灯之仪】”。同时,活动宣传预告片也已正式发布,一起来看看精彩内容吧! 宣传预告片: 大集会所将换上充满神秘与奇异氛围的全新装潢,迎接每一位猎人的到来。在活动期间,玩家可通过收集限定票券来获取专属…

    2026年9月21日 用户投稿
    000
  • 电脑电源选择指南:功率计算与品牌推荐

    选电源要匹配配置并留升级空间,核心是留足余量和选靠谱品牌。整机功耗主要由CPU和显卡决定,实际功率应按(CPU峰值+显卡峰值)×1.3~1.5计算,如i5-14600K+RTX5070约需650W~750W。超频建议余量200W以上,ATX3.0电源更适配新显卡瞬时高负载。80PLUS金牌认证提升转…

    2026年9月21日
    100
  • 百度AI开发者大会何时举行_百度AI开发者大会参与指南

    2025百度AI开发者大会于4月25日在武汉体育中心举办,主题为“模型的世界,应用的天下”,发布了两大模型及多款AI应用,参会需通过官网注册报名,审核后获取电子凭证,同时提供线上直播及会后视频回看。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜…

    2026年9月21日
    000
  • 卖不动!iPhone Air暂时停产!库存已经够用了

    据数码博主“定焦数码”透露,苹果iphone air目前已暂停生产。此次调整主要受两方面因素影响:一是该机型在海外市场销量未达预期;二是中国大陆地区的上市时间有所推迟。不过,由于前期已储备了充足的整机库存,当前市场供应不受影响,未来将根据订单积累情况再决定恢复生产的时机。 这一产能变动与此前投资机构…

    2026年9月21日
    000
  • 苹果痛失AI大将,Siri关键负责人转投Meta

    苹果痛失AI大将,Siri关键负责人转投Meta苹果痛失AI大将,Siri关键负责人转投Meta苹果痛失AI大将,Siri关键负责人转投Meta苹果痛失AI大将,Siri关键负责人转投Meta

    近日有消息显示,%ignore_a_1%公司负责siri改革的关键高管ke yang已确认离职,并将加入竞争对手meta。这一变动不仅为苹果雄心勃勃的ai计划蒙上了一层阴影,也再次凸显了其在留住顶尖人才方面面临的严峻挑战。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 Dee…

    2026年9月21日 用户投稿
    200
  • 如何快速在大量文件中进行全局搜索和替换?

    修改文件内容用Word或Notepad++批量替换,改文件名则用星优或核烁等重命名工具,结合Everything快速定位,提升效率。 面对大量文件时,全局搜索和替换的关键是选对工具。手动一个一个处理效率太低,用对方法能省下大量时间。核心思路是:根据你要改的是“文件里的文字”还是“文件的名字”,选择不…

    2026年9月21日
    200
  • 零跑D16官宣 增程版配80度超大电池 明年上半年上市

      10月16日,零跑汽车正式公布其全新旗舰车型零跑d19的内饰设计与核心技术信息。作为基于零跑自研“旗舰d平台”打造的高端车型,零跑d19计划于2025年第四季度完成内饰解密,2026年上半年开启预售并正式上市。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSee…

    2026年9月20日
    100
  • time函数处理时间在mysql中如何操作

    MySQL中的时间函数用于处理时间数据,如获取当前时间用NOW()或CURTIME(),提取时间部分用TIME(),格式化输出用TIME_FORMAT(),时间计算可用TIMEADD()、TIMEDIFF()等函数,支持加减和差值运算,需注意字段类型与格式匹配。 在 MySQL 中,time 函数和…

    2026年9月20日
    100
  • 静脉注射2兑换码有什么 静脉注射2最新2025兑换码分享

    静脉注射2最新通用兑换码包括:iv2888、venom2025等,可在游戏内直接使用,领取黄金注射器皮肤、夜视药剂×5以及1000经验奖励,限时有效,先到先得!此外,通过修改器还可解锁更多特权福利。 无限物品畅玩|游戏作弊工具推荐: 2025年最新静脉注射2兑换码汇总如下: IV2888:可兑换限定…

    2026年9月20日
    000
  • Gemini2.5网页版访问入口_Gemini2.5官方网站下载链接

    Gemini 2.5网页版访问入口为 https://gemini.google.com/app,登录谷歌账号后可使用主交互界面、模型切换、文件上传、历史记录及移动端同步等功能。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Gemini2…

    2026年9月20日
    000
  • Steam新品节最热玩前50公布!

    Steam新品节最热玩前50公布!Steam新品节最热玩前50公布!Steam新品节最热玩前50公布!Steam新品节最热玩前50公布!

    steam公布了2025年10月版steam新品节最热玩游戏的前50名,本文为您简单整理如下,完整榜单请点此>>> 第1-第10: 第11-第20: 第21-第30: 第31-第40: 第41-第50: 以上就是Steam新品节最热玩前50公布!的详细内容,更多请关注创想鸟其它相关…

    2026年9月20日 用户投稿
    100
  • iPhone命名或跳过19

    iPhone命名或跳过19 近日,科技圈内流传着一个引人瞩目的猜测:苹果公司在为其未来产品命名时,可能会选择直接跳过“iphone 19”这个名称。这一传闻并非空穴来风,而是基于苹果公司以往的命名策略、行业发展趋势以及对品牌形象的整体考量。如果成真,这将是iphone命名史上一个值得记录的时刻。 历…

    2026年9月20日
    100
  • 2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    10月17日,有调研机构发布了2025中国汽车品牌口碑指数nps。其中,小米汽车与aito问界品牌的nps(净推荐值)均仅为44分,远低于行业头部品牌。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 小米汽车 报告显示,新能源汽车主流品牌的…

    2026年9月20日 用户投稿
    000
  • 三大新势力新增订单曝光:鸿蒙智行爆单 尊界热度不减

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 9月1日,车fans创始人孙少军公布了多家造车新势力在上周(8月25日至8月31日)的新增订单情况: 鸿蒙智行(涵盖问界、智界、享界、尊界、尚界五大品牌)上周新增订单约3.5万份,其中尊界品牌的…

    2026年9月20日
    200

发表回复

登录后才能评论
关注微信