李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

不百分百还原出虚拟场景,效果反而更好。
我们很多人都听说过数字孪生(digital twin),在英伟达等公司的大力推动下,这种高效运营工作流程的方法已经在很多工业场景中得到应用。
但你听说过数字表亲(digital cousin)吗?
近日,斯坦福大学李飞飞团队就做出了一个这样的研究,其可有效地将真实数据变成适用于机器人学习的模拟数据 —— 在降低真实转模拟成本的同时还能提升学习的泛化性能。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

简单来说,你只需拍一张照片,就能将照片中的物体变成虚拟版本,并且这个数字虚拟版本还不是照片中物体的一比一复刻,而是存在一定的变化。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

我们知道,在真实世界中训练机器人并不安全,而且成本很高,难以大规模扩展。这就是模拟的用武之地,其成本低,并且可以源源不断地获取训练数据。但是,模拟的问题也很明显,模拟环境和真实环境总归不一样,存在含义和物理机制上的差异。
为了解决这种差异,数字孪生的概念诞生了。简单来说,数字孪生就是为真实场景构建一个虚拟副本,但其成本很高,并且难以实现跨域泛化。
为了解决这些局限,李飞飞团队提出了数字表亲(digital cousin)的概念。不同于数字孪生,数字表亲并不是真实物体的虚拟对应,而只是具有相似的几何和语义特质和属性。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

论文标题:ACDC: Automated Creation of Digital Cousins for Robust Policy Learning
论文链接:https://arxiv.org/abs/2410.07408
项目地址:https://digital-cousins.github.io/
如此一来,数字表亲既能降低生成相似的虚拟环境的成本,还能通过提供相似训练场景的分布而实现更好的跨域泛化。基于数字表亲,该团队提出了一种用于自动创建数字表亲的全新方法,该方法就叫做自动数字表亲创建(Automatic Creation of Digital Cousins),简称 ACDC。
他们还提出了一种全自动的「真实→虚拟→真实」流程,可用于生成完全可交互的场景以及训练可以零样本方式部署在原始场景中的机器人策略。
结果表明,ACDC 得到的数字表亲可以成功保留几何与语义特质和属性,同时训练得到的机器人策略也优于使用数字孪生得到的策略:在零样本虚拟→真实迁移条件下,能以 90% 的成功率胜过数字孪生的 25%。
方法概述
ACDC 由三个连续步骤构成:
首先,从输入的 RGB 图像中提取出每个物体的相关信息。
接下来,基于一个资产数据集,使用该信息来为每个检测到的输入物体匹配数字表亲。
最后,对选取的数字表亲进行后处理,生成一个完全可交互的模拟场景。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

实验
该团队进行一系列实验,试图解答以下研究问题:
问题 1:ACDC 能否得到高质量的数字表亲场景?给定一张 RGB 图像,ACDC 能否捕获原始场景中固有的高层级语义和空间细节? 
问题 2:当在原始设置上进行评估时,基于数字表亲训练得到的策略能否与基于数字孪生得到的策略相媲美?
问题 3:相比于基于数字孪生训练得到的策略,基于数字表亲训练得到的策略是否更加稳健
问题 4:基于数字表亲训练得到的策略能否实现零样本「虚拟→真实」策略迁移
通过 ACDC 进行场景重建

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                                       在模拟 – 模拟场景中,ACDC 对场景重建进行定量和定性评估。
其中,「Scale」是输入场景中两个物体的边界框之间的最大距离。「Cat.」表示正确分类的物体与场景中物体总数的比例。「Mod.」显示正确建模的物体与场景中物体总数的比例。「L2 Dist.」提供输入和重建场景中边界框中心之间的欧几里得距离的平均值和标准差。「Ori. Diff.」表示每个中心对称物体的方向幅度差异的平均值和标准差。「Bbox IoU」表示资产 3D 边界框的交并比 (IoU)。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                                      定性 ACDC 真实 – 模拟场景重建结果。针对给定场景显示多个表亲。
基于这些结果,我们可以放心地回答问题 1:ACDC 确实可以保留输入场景的语义和空间细节,从单个 RGB 图像生成现实世界对象的表亲,这些表亲可以准确定位和扩展,以匹配原始场景。
使用数字表亲进行模拟 – 模拟策略学习

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

怪兽AI数字人 怪兽AI数字人

数字人短视频创作,数字人直播,实时驱动数字人

怪兽AI数字人 44 查看详情 怪兽AI数字人

                                     模拟-模拟策略结果。
在精确孪生、不同数量的表亲和三个最近类别的所有资产上训练的策略的汇总成功率。策略在四种设置上进行测试:精确数字孪生和三种越来越不相似的设置(以 DINOv2 嵌入距离为衡量标准)以探测零样本泛化。请注意,对于任务 3,使任务可行的橱柜模型要少得多,因此这里仅比较数字孪生和 8 个表亲的策略。
使用数字表亲进行模拟-真实策略学习

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                                         数字孪生与数字表亲策略的零样本真实世界评估。任务是打开宜家橱柜的门,衡量标准是成功率:模拟 / 真实结果在 50/20 次试验中取平均值。
真实-模拟-真实的场景生成和策略学习

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                        全自动数字表亲生成。ACDC 的无剪切视频完全自动执行,为真实厨房场景生成了多个数字表亲。ACDC 步骤 1 末尾的轴对齐边界框无需加速即可做到可视化。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                                      零样本模拟到真实世界策略迁移。专门从上面生成的四个数字表亲训练的模拟策略,我们可以零样本迁移到相应的真实厨房场景。
基于这些结果,我们可以放心地回答问题 2、3、4:与在数字孪生上训练的策略相比,使用数字表亲训练的策略表现出相当的分布内性能和更稳健的分布外性能,并且可以实现零样本模拟到真实策略迁移。

李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景

                                    一些失败的案例。
结论
作为一种全自动管道,ACDC 用于快速生成与单个现实世界 RGB 图像相对应的完全交互式数字表亲场景。我们可以发现,利用这些数字表亲训练的策略比在数字孪生上训练的策略更稳健,具有可媲美的域内性能和卓越的域外泛化能力,同时也支持零样本模拟到现实的策略转移。

以上就是李飞飞:不要数字孪生,要数字表兄弟,一张照片生成机器人训练场景的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/416590.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月7日 01:34:21
下一篇 2025年11月7日 01:36:24

相关推荐

  • TikTok视频无法下载怎么办 TikTok视频下载异常修复方法

    先检查链接格式、网络设置及工具版本。复制以https://www.tiktok.com/@或vm.tiktok.com开头的链接,删除?后参数,尝试短链接;确保网络畅通,可切换地区节点或关闭防火墙;更新工具至最新版,优先选用yt-dlp等持续维护的工具。 遇到TikTok视频下载不了的情况,别急着换…

    2025年12月6日 软件教程
    100
  • Vue.js应用中配置环境变量:灵活管理后端通信地址

    在%ignore_a_1%应用中,灵活配置后端api地址等参数是开发与部署的关键。本文将详细介绍两种主要的环境变量配置方法:推荐使用的`.env`文件,以及通过`cross-env`库在命令行中设置环境变量。通过这些方法,开发者可以轻松实现开发、测试、生产等不同环境下配置的动态切换,提高应用的可维护…

    2025年12月6日 web前端
    000
  • VSCode性能分析与瓶颈诊断技术

    首先通过资源监控定位异常进程,再利用开发者工具分析性能瓶颈,结合禁用扩展、优化语言服务器配置及项目设置,可有效解决VSCode卡顿问题。 VSCode作为主流的代码编辑器,虽然轻量高效,但在处理大型项目或配置复杂扩展时可能出现卡顿、响应延迟等问题。要解决这些性能问题,需要系统性地进行性能分析与瓶颈诊…

    2025年12月6日 开发工具
    000
  • VSCode插件:GitLens使用详解

    GitLens是VSCode中强大的Git增强插件,提供行级代码追踪、提交历史浏览、版本对比、跨文件导航及与GitHub等平台集成;通过启用Current Line Blame和In-Line Blame,可实时查看每行代码的作者与修改时间;支持按分支、作者过滤提交记录,比较差异,并利用Go Bac…

    2025年12月6日 开发工具
    000
  • mysql如何备份存储过程和函数

    最直接且推荐的方式是使用mysqldump工具并添加–routines参数,可完整导出存储过程和函数;若需跨版本迁移,应结合–triggers、处理DEFINER用户、验证SQL_MODE,并在测试环境充分验证恢复与兼容性。 MySQL备份存储过程和函数,最直接且推荐的方式是…

    2025年12月6日 数据库
    000
  • VSCode界面优化:精简布局与元素

    通过隐藏冗余组件和调整视觉元素可提升VSCode专注度。依次操作:1. 用Ctrl+B和Ctrl+J快捷键或设置隐藏侧边栏与面板;2. 在设置中关闭活动栏显示,并在settings.json中设置”window.titleBarStyle”: “inline&#8…

    2025年12月6日 开发工具
    000
  • JavaScript持续集成与部署

    持续集成与部署(CI/CD)通过自动化测试、构建和部署提升JavaScript项目交付效率。1. CI指频繁合并代码并自动运行测试以快速发现错误;2. CD在CI通过后自动将应用部署至生产环境;3. 常用工具包括GitHub Actions、GitLab CI/CD、CircleCI和Jenkins…

    2025年12月6日 web前端
    000
  • 谷歌浏览器标签页分组颜色怎么修改_谷歌浏览器标签分组个性化设置指南

    可通过右键菜单、拖拽建组或扩展程序修改谷歌浏览器标签分组颜色。首先右键分组圆点选新颜色;其次拖动标签创建分组时选择配色;最后可用“Tab Modifier”等扩展按规则自动着色。 如果您在使用谷歌浏览器时创建了标签页分组,但希望调整其颜色以便更好地区分不同任务或项目,则可以通过内置功能直接修改。以下…

    2025年12月6日 电脑教程
    000
  • 如何管理和同步VSCode的扩展配置,以便在新设备上快速恢复开发环境?

    使用 Settings Sync 是最快方式,通过 GitHub 账号同步扩展、设置、快捷键和代码片段;也可手动导出扩展列表(code –list-extensions > extensions.txt)并在新设备安装,结合备份 settings.json 等配置文件实现环境快速恢…

    2025年12月6日 开发工具
    000
  • 键盘背光模式设置

    键盘背光设置需根据设备类型选择方法:1. 先了解支持的背光模式,如常亮、呼吸、波浪等;2. 多数键盘可通过Fn组合键快捷切换亮度或模式,具体按键因品牌而异;3. 品牌机械键盘建议使用官方软件(如iCUE、Synapse)进行精细自定义;4. 笔记本通常用Fn加功能键调节,部分可在系统或厂商工具中设置…

    2025年12月6日 电脑教程
    000
  • VS Code扩展生态剖析:API设计与商店发布全流程指南

    VS Code扩展成功源于其插件化架构与丰富API。通过Activation Events、Contribution Points和Extension Host实现高效稳定的功能扩展,结合vscode.commands、languages、window、workspace等核心API提供完整开发支持…

    2025年12月6日 开发工具
    000
  • VSCode时间线:文件修改历史与代码追溯系统

    时间线功能是VSCode内置的代码追溯工具,通过整合Git历史记录提供文件修改的时间轴视图。用户可查看提交哈希、作者、时间、提交信息及变更行数,点击记录预览差异并还原版本。该功能依赖Git仓库,支持查看某行修改者、对比历史版本、恢复误删代码等操作,未启用Git时仅显示本地保存点。结合GitLens等…

    2025年12月6日 开发工具
    000
  • 蛐蛐 (QuQu)— 开源的桌面端语音输入与文本处理工具

    蛐蛐 (QuQu)是什么 蛐蛐(ququ)是一款专为中文用户打造的桌面语音输入与文本处理工具,旨在提供一个开源且免费的 wispr flow 替代方案。该工具集成了阿里巴巴的 funasr paraformer 模型,支持本地化部署与运行,有效保障用户隐私安全。同时融合先进 ai 技术,实现高精度语…

    2025年12月6日 科技
    000
  • VS Code源代码管理:变更跟踪与分支可视化操作解析

    VS Code内置Git功能提升开发效率:通过源代码管理视图实时跟踪文件变更,支持差异对比与部分暂存;借助Git图表可视化分支演进,直观管理提交历史;整合拉取、推送、分支切换等常用操作,简化协作流程。 VS Code 内置的源代码管理功能让开发者可以直接在编辑器中高效处理 Git 变更与分支操作,无…

    2025年12月6日 开发工具
    000
  • 数毛社实测PS5节能省电模式:功耗暴降55%

    近日,著名技术评测机构数毛社(digital foundry)对ps5最新系统固件中引入的“省电模式”展开深入实测。结果显示,虽然该功能对当前主机用户的实际意义较为有限,但其背后的技术方向或许正为索尼下一代便携式ps6设备铺路。 实机测试: 本次测试选用了两款已适配省电模式的游戏作品——《恶魔之魂》…

    2025年12月6日 游戏教程
    000
  • 美团 LongCat 团队发布 LongCat-Video 探索世界模型

    美团longcat团队近日正式推出全新视频生成模型longcat-video,致力于通过视频生成技术路径深入探索“世界模型”的构建,为自动驾驶、具身智能等前沿应用场景提供坚实的技术支撑。 该模型基于DiT(Diffusion in Time)架构设计,创新性地以“条件帧数量”作为任务区分标准,原生支…

    2025年12月6日 行业动态
    000
  • 探索VSCode云端开发环境搭建与配置方案

    首选GitHub Codespaces实现便捷云端开发,其次通过VSCode+SSH连接云服务器提升控制权,或采用Dev Containers确保环境一致性,结合性能优化与安全措施,满足不同场景下的高效协作需求。 在现代开发场景中,将VSCode与云端环境结合已成为提升协作效率、实现跨设备开发的重要…

    2025年12月6日 开发工具
    000
  • PHP/HTML代码格式化工具实践:以PHP-CS-Fixer为例

    本文针对php和html代码的自动化格式化需求,推荐并详细介绍了php-cs-fixer工具。它不仅能检查代码标准,还能自动修复格式问题,支持自定义规则集和ci/cd集成,是确保团队代码风格一致性的高效解决方案。通过本文,您将了解其安装、配置、使用及在持续集成环境中的应用。 在现代软件开发流程中,代…

    2025年12月6日 后端开发
    000
  • VSCode智能补全:配置基于AI的代码建议与自动完成功能

    首先安装 GitHub Copilot 插件并登录账号,启用内联建议与快捷设置,通过清晰命名和注释提升补全准确率,审查生成代码并提交反馈以优化模型,从而显著提升编码效率。 VSCode 的智能补全功能可以通过集成基于 AI 的工具显著提升编码效率。目前最成熟且广泛使用的 AI 驱动代码补全是 Git…

    2025年12月6日 开发工具
    000
  • php新手怎么找工作_PHP新手求职方向、平台选择与实战建议

    答案是通过项目证明能力并主动拓展求职渠道。先做PHP+MySQL项目如商城后台,发布到GitHub并写好README;再从小公司需求、技术社区、开源项目中找机会;面试时重点准备PHP基础、MySQL操作和项目讲解,突出解决问题的能力。 刚学完PHP怎么找工作?这是很多新手都会问的问题。答案其实不复杂…

    2025年12月6日 后端开发
    000

发表回复

登录后才能评论
关注微信