仅靠逻辑题,AI数学竞赛能力飙升!微软、九坤投资:7B小模型也能逼近o3-mini

仅靠逻辑益智题,竟能让AI数学竞赛水平大幅提升?DeepSeek R1的秘密武器

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

继中国大模型在技术领域取得突破后,国内团队再次带来惊喜!这项研究揭秘了DeepSeek R1模型背后的秘密:通过少量合成数据和强化学习,一个7B参数的小模型在逻辑推理测试中超越了OpenAI的o1模型,甚至逼近o3-mini-high的水平。更令人瞩目的是,在从未见过的美国数学奥林匹克(AIME)测试中,其推理能力提升了惊人的125%!

研究成果:

论文标题: Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning论文链接: https://www.php.cn/link/971c6340495b40cce8b7ef650650a599Github链接: https://www.php.cn/link/fb1f13df81c7bee04d8a083204858880

该研究由微软亚洲研究院和九坤投资等机构的研究人员共同完成,是首个对类似R1强化学习模型训练过程进行全面深入分析的研究。 值得强调的是,该团队不仅完整开源了全部代码,还公开了详细的参数设置、训练数据和经验总结。

研究目标:

研究团队试图解答以下关键问题:

GRPO是否是强化学习的最佳算法?如何进行参数调整以实现稳定训练?循序渐进的课程学习是否仍然有效?基于基础模型进行强化学习与完全冷启动训练有何区别?哪种方式更优?模型输出长度的线性增长规律是否与推理能力的提升直接相关?模型频繁使用“verify”、“check”等反思性词汇是否意味着推理能力增强?哪些词语能够可靠地反映推理能力的提升?强化学习是否真正掌握了抽象推理能力,还是仅仅依赖于模式记忆?与传统的监督微调相比,强化学习的优势在哪里?模型在推理过程中混用中英文是否对性能提升有帮助,甚至可能是有害的?

图片

研究方法:

数据选择: 为了更好地分析推理模型机制,研究人员选择使用程序生成的逻辑谜题作为训练数据,例如经典的“骑士与骗子”问题。这种方法的优势在于:

数据是全新的,可以有效测试模型的泛化能力。通过调整参数,可以控制谜题的难度。每个谜题都有明确的答案,减少了奖励作弊的风险。消除了自然语言任务中的模糊性,方便区分真正的推理能力和简单的模式记忆。

图片

逻辑智能 逻辑智能

InsiderX:打造每个团队都能轻松定制的智能体员工

逻辑智能 83 查看详情 逻辑智能

奖励机制: 研究人员设计了一个基于规则的奖励系统,几乎杜绝了作弊行为,主要包括格式奖励和答案奖励两种。

实验结果:

经过大量的对比实验,研究团队最终选择REINFORCE++算法,并对其进行了改进。 在经过约3600步训练后,7B参数的模型在逻辑推理测试中超越了OpenAI o1模型两倍,性能逼近o3-mini-high。

图片

有趣的发现:

“思考”词语与推理能力: 研究发现,“verify”、“check”等词语的出现与推理性能提升相关,但并非所有与思考相关的词语都能带来性能提升。“recheck”的出现反而会降低性能。语言混用: 中英文混用会降低模型性能。“顿悟时刻”的缺失: 模型性能的提升是逐步进行的,并非突然出现“顿悟时刻”。强化学习与监督微调的对比: 强化学习的泛化能力更强,对数据的依赖性更低。输出长度与性能: 输出长度的增长并不一定代表推理能力的提升。

图片图片图片图片

更多细节,请参考论文原文。 这项研究为大模型的推理能力提升提供了新的思路,也为未来AI发展提供了宝贵的经验。

以上就是仅靠逻辑题,AI数学竞赛能力飙升!微软、九坤投资:7B小模型也能逼近o3-mini的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/278264.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
公司网站被黑应该怎么处理?(解决方法)
上一篇 2025年11月4日 15:32:11
Laravel API认证:Passport vs Sanctum
下一篇 2025年11月4日 15:32:18

相关推荐

  • 告别支付集成难题:MONEI PHP SDK 助力高效支付

    在最近的项目中,我们需要集成一个安全的、高效的支付网关。起初,我们计划自己开发支付流程,这听起来似乎可行,但很快我们发现自己陷入了困境。首先,确保支付流程的安全性是一项艰巨的任务,需要处理各种潜在的安全漏洞。其次,我们需要支持多种支付方式,这需要大量的代码编写和测试工作,以确保与各种支付提供商的兼容…

    用户投稿 2026年9月4日
    000
  • C++中如何用Lambda函数实现私有函数仅供公有函数调用?

    C++中使用Lambda函数模拟私有函数,仅供公有函数调用 问题:如何在C++中实现类似于其他语言中“私有函数仅供公有函数调用”的特性? 解决方法:虽然C++没有直接的“私有函数”概念像Java或C#那样,但我们可以巧妙地利用Lambda表达式来模拟这种行为。Lambda表达式创建的匿名函数,其作用…

    2026年9月4日
    000
  • 美信科技:湾区总部工业园预计今年上半年投入使用

    美信科技湾区总部工业园预计上半年投入使用,积极应对市场挑战。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 美信科技近日在投资者互动平台透露,其位于湾区总部的工业园区目前正在装修,计划于今年上半年正式投入运营。 面对严峻的市场竞争,公司持续…

    2026年9月4日
    000
  • 豆包电脑版上线AI播客功能,支持一键生成播客

    据悉,6月17日,豆包电脑版已全面上线ai播客功能。用户只需上传pdf文件或网页链接,即可一键生成双人对话形式的播客节目,语音效果高度拟人化,对话自然流畅。 参与内测的用户反馈称,他们会将一些较长的学习资料发送给豆包,通过一键转换为语音内容,实现随时随地“轻松听长文”。生成的AI播客在音色上与真人非…

    2026年9月4日
    000
  • 《双点博物馆》首次加入促销阵容 “SEGA年中大促”进行中

    《双点博物馆》首次加入促销阵容 “SEGA年中大促”进行中《双点博物馆》首次加入促销阵容 “SEGA年中大促”进行中《双点博物馆》首次加入促销阵容 “SEGA年中大促”进行中《双点博物馆》首次加入促销阵容 “SEGA年中大促”进行中

    “sega年中大促”活动正式启动,playstationstore和nintendo eshop的部分在售游戏推出限时折扣。本次活动将持续至2025年7月2日。 “双点”系列的最新作品——博物馆经营模拟游戏《双点博物馆:探索者版》以8折优惠首次亮相促销活动。此外,《人中之龙8外传 Pirates i…

    2026年9月4日 用户投稿
    000
  • 怎么更换VSCode的语言_VSCode界面语言切换与本地化设置教程

    更改VSCode语言需安装对应语言包并配置显示语言,重启生效;2. 语言包安装失败可检查网络、清缓存或手动安装.vsix文件;3. 界面语言与文件编码无关,前者影响UI显示,后者决定字符存储解析;4. 扩展语言问题多因不支持多语言或设置不同步,可检查扩展设置或系统语言。 VSCode更改语言其实非常…

    2026年9月4日
    100
  • 2024年中国各大城市新能源汽车销量排行榜 深圳第三

      近日,中汽数研发布了2024年中国各大城市新能源汽车销量排行榜(篇幅有限,仅展示top50),数据显示,中国新能源汽车市场持续蓬勃发展,各大城市销量大都有所增长。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜   四川省成都市以3097…

    2026年9月4日
    000
  • LLM自主发现发表在Nature上的科学假设?ICLR 2025 论文MOOSE-Chem深度解析

    LLM自主发现发表在Nature上的科学假设?ICLR 2025 论文MOOSE-Chem深度解析LLM自主发现发表在Nature上的科学假设?ICLR 2025 论文MOOSE-Chem深度解析LLM自主发现发表在Nature上的科学假设?ICLR 2025 论文MOOSE-Chem深度解析LLM自主发现发表在Nature上的科学假设?ICLR 2025 论文MOOSE-Chem深度解析

    人工智能的下一个前沿:引领科学发现 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | ScienceAI 人工智能(AI)在自然语言处理和计算机视觉领域的成功有目共睹,但它能否推动科学理论的突破性发现? ICLR 2025 接收论文《…

    2026年9月4日 用户投稿
    100
  • 腾讯混元3D 2.1全链路开源,3D材质生成迈入“工业级”新阶段

    腾讯混元3D 2.1全链路开源,3D材质生成迈入“工业级”新阶段腾讯混元3D 2.1全链路开源,3D材质生成迈入“工业级”新阶段腾讯混元3D 2.1全链路开源,3D材质生成迈入“工业级”新阶段腾讯混元3D 2.1全链路开源,3D材质生成迈入“工业级”新阶段

    腾讯首次将开源发布会带入国际顶尖学术会议现场。 北京时间6月14日,在计算机视觉领域顶级会议CVPR 2025上,腾讯宣布混元3D 2.1大模型正式对外开源。这是首个实现全链路开源的工业级3D生成大模型,其性能已达到闭源模型水平。 相比社区广泛使用的混元3D 2.0版本,2.1版本在几何生成质量方面…

    2026年9月4日 用户投稿
    000
  • 告别代码混乱:使用 Composer 和 headsnet/grumphp-conventions 提升代码规范

    作为一名开发者,我深知保持一致的代码风格和高质量的代码的重要性。然而,在团队协作中,每个成员可能都有自己偏好的代码风格,这会导致代码库混乱不堪,难以维护。 更糟糕的是,一些潜在的错误在代码审查时常常被忽略,导致上线后出现问题。 为了解决这个问题,我尝试过制定严格的代码规范文档,并要求团队成员严格遵守…

    用户投稿 2026年9月4日
    100
  • 《无法成眠的伊达键 – From AI:梦境档案》 连续五周发布短篇动画《伊达键的放轻松小剧场》

    《无法成眠的伊达键 – From AI:梦境档案》   连续五周发布短篇动画《伊达键的放轻松小剧场》《无法成眠的伊达键 – From AI:梦境档案》   连续五周发布短篇动画《伊达键的放轻松小剧场》《无法成眠的伊达键 – From AI:梦境档案》   连续五周发布短篇动画《伊达键的放轻松小剧场》《无法成眠的伊达键 – From AI:梦境档案》   连续五周发布短篇动画《伊达键的放轻松小剧场》

    spike chunsoft co., ltd. 宣布将于2025年7月25日在nintendo switch 2 / nintendo switch 及steam平台推出冒险游戏《无法成眠的伊达键 – from ai:梦境档案》。与此同时,即日起将连续五周推出由q版游戏角色主演的短篇动…

    2026年9月4日 用户投稿
    100
  • 手机qq浏览器如何编辑word文档 怎么用手机QQ浏览器编辑word文档

    手机qq浏览器如何编辑word文档 怎么用手机QQ浏览器编辑word文档手机qq浏览器如何编辑word文档 怎么用手机QQ浏览器编辑word文档手机qq浏览器如何编辑word文档 怎么用手机QQ浏览器编辑word文档手机qq浏览器如何编辑word文档 怎么用手机QQ浏览器编辑word文档

    qq浏览器,通常也被称为腾讯浏览器、手机qq浏览器或qq手机浏览器。全新上线的ai助手功能,能够帮助你提炼内容要点、选词解读、ai问答、随手摘录,同时还支持边看边聊和跨设备同步。搜索“qq浏览器ai助手”,开启全新的阅读体验。 如何使用手机QQ浏览器编辑Word文档? 打开【QQ浏览器】应用。 进入…

    2026年9月4日 用户投稿
    100
  • MySQL索引选择性与性能关系_MySQL高效查询索引设计

    MySQL索引选择性与性能关系_MySQL高效查询索引设计MySQL索引选择性与性能关系_MySQL高效查询索引设计MySQL索引选择性与性能关系_MySQL高效查询索引设计MySQL索引选择性与性能关系_MySQL高效查询索引设计

    mysql索引选择性是索引列中不同值与总行数的比值,决定了索引的查询效率。1. 高选择性列(如用户id、邮箱)应优先建立索引,能快速缩小数据范围;2. 合理使用联合索引,遵循最左前缀原则,提升查询效率;3. 利用覆盖索引避免回表查询,提高性能;4. 避免对低选择性列(如性别、状态)单独建索引;5. …

    2026年9月4日 用户投稿
    100
  • 安全基线检查平台

    安全基线检查平台安全基线检查平台安全基线检查平台安全基线检查平台

    0x01 介绍 最近我在进行安全基线检查相关的工作,网络上的一些代码比较零散;也有一些比较完整的项目,比如OWASP中的安全基线检查项目,但需要付费;还有一些开源且完整的,比如Lynis,但这些都不符合我的需求。 我的需求如下: 最终的效果是什么呢?最好能够达到阿里云里的安全基线检查的样子,即使差一…

    2026年9月4日 用户投稿
    100
  • 当具身智能机器人在养老院「秀」了一把

    机器人似乎正在重构一种崭新的养老图景:具身智能机器人给老人端茶倒水,和老人一起跳舞、奏乐和投篮,为老人叠衣清洁等复杂精细任务…… 这些嵌入了传感器的铁疙瘩,正在悄然改变银发群体的生活。 具身智能机器人在养老场景“上岗” 6月6日,星尘智能的人形机器人陪着深圳市养老护理院的一群老人练八段锦的场景让不少…

    2026年9月4日
    100
  • 70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    人人都在做垂直 AI 产品,为什么要反其道而行? Scaling Laws 是否失灵,这个话题从 2024 年年尾一直讨论至今,也没有定论。 Ilya Sutskever 在 NeurIPS 会上直言:大模型预训练这条路可能已经走到头了。上周的 CES 2025,黄仁勋有提到,在英伟达看来,Scal…

    2026年9月4日 用户投稿
    200
  • 高效获取图片尺寸:告别 getimagesize 的性能瓶颈

    我最近参与了一个项目,需要处理数千张图片,其中包括许多来自远程服务器的图片。最初,我使用了 php 内置的 getimagesize 函数来获取图片尺寸。然而,随着图片数量的增加,程序运行速度变得越来越慢,甚至出现超时错误。这主要是因为 getimagesize 函数需要下载完整的图片文件才能解析其…

    用户投稿 2026年9月4日
    100
  • 告别繁琐支付集成:FasterPay PHP SDK 助力高效支付

    最近,我负责公司电商平台的支付系统升级,需要集成一个新的支付网关——fasterpay。fasterpay 以其便捷的支付流程和强大的安全性吸引了我们,但其官方文档中提供的集成方法过于复杂,需要处理大量的http请求和数据签名,这让我感到非常头疼。我需要一种更简单、更高效的集成方式,才能节省时间和精…

    用户投稿 2026年9月4日
    100
  • 敦煌“数字藏经洞”数据库平台全球上线,腾讯AI技术陪你逛千年图书馆

    5月31日,敦煌研究院宣布“数字藏经洞”数据库平台正式上线,超过9900卷敦煌文书经卷和60700多幅图像的数字化版本面向全球用户开放,内容包括佛经、律典、契约、绢画等多种类型。 腾讯凭借其自主研发的混元大模型和智能检索技术,为该平台提供技术支持,使用户能够更加便捷地访问和理解这些深厚的文化遗产。平…

    2026年9月4日
    500
  • Android APP截图:如何准确判断当前屏幕方向?

    Android应用屏幕方向的精准判断 高质量的应用截图需要准确识别屏幕方向(横屏或竖屏)。本文介绍如何使用Android的WindowManager类实现这一功能。 以下代码片段演示了如何利用adb命令获取屏幕分辨率,并据此判断屏幕方向: import subprocess# 获取设备分辨率cmd …

    2026年9月4日
    100

发表回复

登录后才能评论
关注微信