英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

英伟达 gtc 大会热度飙升。继黄仁勋在英伟达大会上发布基础世界模型 cosmos 引发业内讨论后,英伟达团队近日又发布了一个新的物理世界大模型:cosmos-reason1。

作为 Cosmos 系列的一个大模型,顾名思义,Cosmos-Reason1 更强调模型的“Reason”(即“推理”)能力。这是继 DeepSeek R1 采用纯强化学习方法替代 SFT 之后,思考推理模型在物理世界中的进一步探索;且据论文介绍,其取得了不错的成果。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

论文地址:https://arxiv.org/abs/2503.15558

与 DeepSeek 跑在云端不同,Cosmos-Reason1 致力于解决的是人工智能系统与物理世界交互的问题——这要求跑在物理世界中的 AI 大模型要同时具备感知、理解与执行复杂动作的三个基本能力,即当前具身智能领域主流的研究热词“VLA”,或“具身大脑”。

根据论文介绍,Cosmos-Reason1 可以理解物理世界,并通过长思维链(Long CoT)的推理过程在自然语言中生成适当的行为决策。在这个思路上,英伟达的研究团队开发两个多模态大模型,分别是 80 亿参数的 Cosmos-Reason1-8B 和 560 亿参数的 Cosmos-Reason1-56B。

他们分四个阶段来进行数据收集与模型训练,分别是:视觉预训练、通用 SFT、物理 AI SFT、以及物理 AI 强化学习后训练。为了评估模型效果,他们分别在物理常识与具身推理两个方向上制定了 Benchmark,并取得了不错的表现。

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

Cosmos-Reason1 技术路线图概览

当前 Cosmos-Reason1 已开源,具身智能先锋研究者宋舒然等人也参与其中。

物理世界的 AGI 有何不同?

业内一直有观点认为,AGI 的发展会天然地分为云端 AGI 与端侧 AGI,物理世界中的 AGI 即属于后者。

但相比云端 AGI 模型(如 DeepSeek R1 等),能够与物理世界进行有效交互的 AGI 却突破缓慢,因其难度更大,不仅要具备云端 AGI 的理解、推理能力,还需要感知、决策。即使是推理环节,云端大模型的训练主要基于互联网上的大量文本数据,也难以迁移到与物理世界的互动知识中。

物理世界中的 AGI 需要具备什么能力?

英伟达团队认为,与设计擅长解决编码和数学问题的大模型不同,物理世界的大模型应该具备物理世界常识与基于物理世界的具体推理能力。这包含两方面:

一是物理常识应分为三个主要类别:空间、时间和基础物理,同时这三个类别又会被进一步划分为 16 个细粒度的子类别。这关乎到物理世界如何在物理定律下运行,以及 AI 如何与物理世界进行交互;

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

图注:物理常识的 16 个子类别,空间包含关系、合理性、可供性与环境;时间包含规划、相机、因果、指令、行为;基础物理包括反重力、热力学、电磁、机械学、客体永恒性、状态、属性。

二是他们认为,要为具身推理引入一个二维的知识体系,其包含跨越 5 类具身智能体的 4 种关键推理能力。这样有助于 AI 智能体在物理世界中的理解与规划。

具体而言,具身推理需要具备以下能力:

处理复杂的感官输入。与处理清晰数据表示的符号推理不同,具身推理必须从原始的、往往不完整且模糊的感官输入中提取有意义的模式。

预测行动效果。行动会产生物理后果,有效的推理需要直观地掌握因果关系。AI 系统必须预测一个物体对力会有怎样的反应,一个机器人的身体将如何与周围环境相互作用,或者一辆车辆的移动将如何受到地形和物理规律的影响。

遵循物理约束。与通常涉及优化离散选择的抽象问题解决不同,具身推理必须考虑现实世界的物理因素,如惯性、摩擦力和材料属性。它要求 AI 生成在物理约束条件下可行的长期行动规划,以确保执行过程中的稳定性、效率和安全性。

从交互中学习。在物理 AI 中,行动不是孤立发生的;每一个动作或决策都会影响环境并产生反馈。具身推理必须基于这些交互不断更新其理解,使系统能够动态地改进其行为。

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

在这个过程中,Cosmos-Reason1 的目标之一是使多模态大模型生成更多符合物理世界要求的反应。在视觉世界中,模型对世界的理解会被表示为视频形式,然后通过视频输入感知、理解与推理物理世界,再用自然语言将模型的反应表达出来。他们采用的是纯解码的多模态大模型架构,以及混合的 Mamba-MLP-Transformer 架构。

值得注意的是,Transformer 架构此前一直被诟病虽然擅长长序列表达、但无法高效实现空间理解,而 Mamba 架构是典型的非 Transformer 架构,英伟达团队采用 Mamba 混合或许就是为了中和 Transformer 在物理世界大模型中的短板。

可图大模型 可图大模型

可图大模型(Kolors)是快手大模型团队自研打造的文生图AI大模型

可图大模型 32 查看详情 可图大模型

他们使用张量并行度为 4 来训练 Cosmos-Reason1-8B 模型,而 Cosmos-Reason1-56B 模型则使用张量并行度为 8 和流水线并行度为 2来进行训练,以支持更长的视频训练。

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

为了提高模型的通用能力,在数据采集上,英伟达团队一共采用了总计 120M 的图像、视频与交互数据用于数据预训练,8M 的图像和视频数据用于通用的 SFT。

在大模型的推理中,基于规则的、可验证的大规模奖励(即强化学习方法)对解决数学、编码问题起了很大的作用。受此启发,英伟达团队也在 Cosmos-Reason1 中使用了强化学习方法来训练模型在物理世界中的推理能力。

他们探索了两种多项选择题回答的奖励类型,一种是基于人工注释的 MCQ,另一种是受视频自监督学习的启发,自动生成基于视频数据结构的 MCQ,比如用打乱的时空视频补丁来解谜题、预测视频向前或向后播放的时间箭头等。

Cosmos-Reason1 的效果

为了测试 Cosmos-Reason1 的效果,英伟达团队制定了以下基准:

在物理常识上,他们制定了 3 个基准(空间、时间与基础物理),包含了来自 426 个视频中的 604 个问题。

在具身推理上,他们建立了 6 个基准测试、包含来自 600 个视频的 612 个问题,覆盖了包括人体、机械臂、人形机器人与自动驾驶等多个构型的物理具身。

他们将 Cosmos-Reason1 与其他的大模型进行了对比,结果如下:

在物理常识的基准上,Cosmos-Reason1-8B 与 56B 的效果都显著提升,尤其是 56B 的效果全面超过 Qwen2.5-VL-7B 与 72B、Gemini 2.0 Flash 与 GPT-4o,只稍逊于 OpenAI 的 o1:

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

在具身推理上,显著强于其他 VLM 模型,效果提升超 10%:

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

为了测试模型的直观推理能力,他们为三个任务(时间箭头、空间谜题与物体持久性)中的每一个任务都策划了 100 个视频,并生成 100 个问题。

结果显示,现有的许多 VLM 模型在时间箭头与物理持久性的任务上表现不佳,GPT-4o 与 OpenAI o1 处理空间谜题比随机猜测强。但 Cosmos-Reason1-8B 在三个任务中都得到了显著改进:

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

时间箭头例子:

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

时间箭头例子:

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

参考文献:https://arxiv.org/pdf/2503.15558

英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

以上就是英伟达团队发布最新具身模型 Cosmos-Reason1,在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/340154.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月5日 17:53:07
下一篇 2025年11月5日 17:53:52

相关推荐

  • 加密币最新行情预测(2025年-2030年)

    本文旨在探索2025年至2030年期间,主要加密资产的长期价格潜力。通过分析技术发展路线、市场周期性规律以及宏观经济影响,我们为关注数字资产未来的读者提供一个前瞻性的参考框架。 2025-2030年市场宏观展望 进入2025年后,加密市场预计将进一步走向成熟。机构投资者的参与度加深、监管框架的逐步清…

    2025年12月8日
    000
  • 一个稳定币多少美元

    稳定币的价值通常与美元挂钩,旨在保持与美元 1:1 的等价关系,即 1 枚稳定币理论上约等于 1 美元。常见的 USDT、USDC、DAI 等美元稳定币,均是如此。 但受市场供需关系、投资者信心及稳定币发行方储备资产状况等因素影响,稳定币价格会在 1 美元左右波动5。例如 2018 年 USDT 因…

    2025年12月8日 好文分享
    000
  • 虚拟货币排名前十主流币

    以下是虚拟货币排名前十的主流币: 1. Binance 币安是全球领先的虚拟货币交易平台之一,提供广泛的数字资产交易对。该平台以高流动性和丰富的交易产品而闻名。币安的生态系统涵盖了多种服务,包括交易、质押、借贷等。用户界面友好,适合不同经验水平的交易者。 2. OKX OKX是另一个主要的全球虚拟货…

    2025年12月8日 好文分享
    000
  • 全球排名Top20虚拟货币交易所排行榜(现货)

    选择可靠的虚拟货币交易所应根据自身需求综合评估。1. Binance以资产多样性和市场深度著称;2. Coinbase强调合规与安全,适合新手;3. Kraken以顶级安全措施和稳健运营赢得信赖;4. OKX提供全面的现货与衍生品交易及Web3生态入口;5. Bybit具备强大交易引擎和数百个交易对…

    2025年12月8日
    000
  • 2025稳定币推荐_2025哪些稳定币会升值

    【权威推荐】2025主流数字货币交易平台合集 Binance币安 官网直达: 安卓安装包下载: 欧易OKX ️ 官网直达: 安卓安装包下载: Huobi火币️ 官网直达: 安卓安装包下载: 2025稳定币推荐:2025年哪些稳定币值得关注 稳定币在加密货币生态中扮演着桥梁和储值的双重角色,其价值锚定…

    2025年12月8日
    100
  • 稳定币是骗局吗_稳定币是假的吗

    【权威推荐】2025主流数字货币交易平台合集 Binance币安 官网直达: 安卓安装包下载: 欧易OKX ️ 官网直达: 安卓安装包下载: Huobi火币️ 官网直达: 安卓安装包下载: 稳定币是骗局吗?稳定币是假的吗? 稳定币(Stablecoin)是一种锚定法币或其他资产价值的加密货币,目的是…

    2025年12月8日
    000
  • 七月份百倍币推荐_七月份哪些加密货币会翻倍

    【权威推荐】2025主流数字货币交易平台合集 Binance币安 官网直达: 安卓安装包下载: 欧易OKX ️ 官网直达: 安卓安装包下载: Huobi火币️ 官网直达: 安卓安装包下载: 七月份百倍币推荐:七月可能翻倍的热门加密货币分析 进入2025年7月,部分小市值加密资产因技术亮点、社区活跃度…

    2025年12月8日
    000
  • 7月11日Bianca空投项目有哪些

    7月11日前后,币安平台潜在空投项目可通过Megadrop、Launchpool和空投中心参与。1.Megadrop需锁仓BNB或完成Web3任务获取奖励;2.Launchpool通过投入BNB或FDUSD稳定获得代币;3.空投中心针对特定用户不定期发放空投。值得关注的项目包括:Zephyr Pro…

    2025年12月8日
    000
  • 加密货币25年会不会像21年的行情重演

    2025年数字资产市场难以复制2021年的行情,但将呈现新的结构性牛市。1.宏观经济环境不同,利率较高使市场更依赖内生价值驱动;2.市场参与者结构变化,比特币ETF获批将带来系统性机构资金;3.技术与叙事热点迭代,Layer-2、现实资产代币化和AI+Crypto成为新热点;4.监管环境趋于清晰,推…

    2025年12月8日
    000
  • 比特币、以太坊和其他加密资产的区别

    选择安全可靠的加密货币交易平台需综合考量多个维度,本文推荐币安、欧易、Gate.io、火币和KuCoin五大交易所。1. 币安交易量最大,产品丰富,适合各类投资者;2. 欧易以合约交易和多元金融产品著称,移动端体验佳;3. Gate.io上币种类多,适合挖掘潜力项目。 选择一个安全可靠的加密货币交易…

    2025年12月8日
    000
  • BTC破11万后会不会形成山寨季

    山寨季是指比特币涨幅放缓后,资金轮动推升山寨币价格显著超越比特币的市场现象。其核心逻辑在于:1)比特币上涨吸引资金入场并形成财富效应,2)获利资金转向风险偏好更高的山寨币,3)BTC.D指标下降成为山寨季开启的信号,4)当前市场分化明显,资金更倾向选择性流入DeFi、Layer2、Meme币、AI与…

    2025年12月8日
    000
  • 跨链通信板块的加密货币有哪些

    跨链通信技术旨在解决区块链孤岛问题,为构建互联互通的价值互联网奠定基础。1. Polkadot采用共享安全的中继链模型,通过中继链保障所有平行链的安全;2. Cosmos强调独立主权,利用IBC协议实现标准化跨链通信;3. Avalanche凭借独特子网架构和高速共识机制,支持定制化区块链网络;4.…

    2025年12月8日
    000
  • 稳定币真的靠谱吗

    稳定币的可靠性取决于其类型和管理机制,1.法币抵押型依赖储备透明度,2.加密抵押型依赖智能合约与清算机制,3.算法型则依赖供需调节但风险较高。潜在风险包括抵押品质量、监管变化、中心化控制、技术漏洞及脱钩可能。为安全使用,应选择信誉良好、储备透明、流动性高的稳定币,并通过主流交易所交易,在转账时严格核…

    2025年12月8日
    000
  • iPepe、模因币与Web3改革:数字文化的新时代?

    探索模因币领域的最新动态,聚焦 ipepe 与 pop social 的战略合作,以及以 little pepe 为代表的具备实用价值的模因币崛起趋势。 模因币市场正经历快速创新,而 iPepe 处于这一浪潮的前沿。通过战略联盟和对 Web3 集成的重视,模因币已不再仅仅是炒作驱动的产物。接下来,我…

    2025年12月8日
    000
  • PrompTale AI(TALE币)是什么?作用是什么?是一项好的投资吗?

    目录 摘要框(简要事实)PrompTale AI(TALE)是什么?有多少个 TALE 代币?TALE 的作用是什么?TALE 与以太坊:重点比较PrompTale AI背后的技术团队与起源重要新闻与事件TALE 是一项好的投资吗?潜在优势:潜在风险:结论 在加密货币和人工智能快速发展的领域中,一个…

    2025年12月8日
    000
  • Ripple稳定币RLUSD流通量破5亿大关!纽约梅隆银行独家托管铸就合规标杆

    由Ripple推出的美元锚定稳定币RLUSD,在发行七个月内,其流通总量已超过五亿美元。 与此同时,Ripple宣布纽约梅隆银行(BNY)将负责管理支持该稳定币的美元现金和国债资产,这一消息也象征着Ripple正式获得传统金融领域重要机构的认可。 RLUSD流通规模突破五亿美元 RLUSD是依据纽约…

    2025年12月8日
    000
  • 实用代币与安全代币是什么?有什么区别?

    目录 什么是实用代币?实用代币示例加密货币中的安全令牌是什么?安全令牌示例实用型代币与安全型代币:主要区别目的:获取途径与投资监管:宽松监管 vs. 严格合规法律框架:豪威测试的实际应用流动性:交易便利性与限制法规如何定义实用型代币与证券型代币如何识别代币的类型?探索加密世界中的代币 实用型代币、安…

    2025年12月8日
    000
  • 币圈十大交易所Top10

    数字资产交易所在加密货币生态系统中扮演着至关重要的角色,它们是连接用户与各类加密货币的桥梁。随着行业的快速发展,涌现出众多提供加密资产交易服务的平台。这些平台在交易量、用户基数、安全性、交易对丰富度以及服务质量等方面存在差异。了解并选择一个合适的交易所对于参与加密货币交易至关重要。以下是根据当前市场…

    2025年12月8日 好文分享
    000
  • 解读您的电表:内罗毕居民的KPLC错误修复指南

    遇到预付费电表故障?这份指南助内罗毕居民排查常见问题,保障电力持续供应 读懂你的预付费电表:KPLC官方故障排查手册(内罗毕用户适用) 你是否遇到过这样的情况:账户余额充足,但家中却突然断电?这并非个例。肯尼亚电力照明公司(KPLC)的预付费电表有时会出现一些小问题,影响正常供电。为此,KPLC推出…

    2025年12月8日
    000
  • 瑞波币、稳定币与托管:数字金融的未来已经到来,宝贝!

    瑞波(ripple)正在稳定币市场加速布局,推出rlusd并不断实现关键进展,同时与道富环球(bny mellon)等行业巨头建立合作关系。这对加密货币的未来意味着什么? 瑞波并非浅尝辄止地涉足这一领域,而是致力于构建一个数字金融生态。其推出的RLUSD稳定币正在逐步引起关注,并凭借一系列战略合作重…

    2025年12月8日
    000

发表回复

登录后才能评论
关注微信