人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

不用提前熟悉环境,一声令下,就能让宇树机器人坐在椅子上、桌子上、箱子上!

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

还能直接解锁 ” 跨过箱子 “、” 敲门 ” 等任务 ~

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

这是来自 UC 伯克利、卡内基梅隆大学等团队的最新研究成果LeVERB 框架——

基于模拟数据训练实现零样本部署,让人形机器人通过感知新环境,理解语言指令就能直接完成全身动作。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

传统人形机器人要么 ” 能看懂指令却动不了 “(缺乏全身控制能力),要么 ” 只能机械执行动作却读不懂环境 “(依赖人工预设动作库)。

LeVERB 首次打通了视觉语义理解与物理运动两者之间的断层,让机器人能像人类一样从 ” 想 ” 到 ” 做 “,自动感知环境,直接遵循指令完成动作。

上面展示的 ” 坐下 ” 动作就是通过 ” 相机感知环境 +’ 坐在 [ 椅子 / 盒子 / 桌子 ] 上 ‘ 指令 ” 完成的:

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

团队还推出了配套基准:LeVERB-Bench。

这是首个面向人形机器人 WBC(全身控制)的 ” 仿真到真实 ” 视觉 – 语言闭环基准,包含 10 类超 150 个任务。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

团队将该框架部署在宇树 G1 机器人上进行基准测试,结果显示:

在简单视觉导航任务中零样本成功率达 80%,整体任务成功率58.5%,比朴素分层 VLA(视觉 – 语言 – 动作)方案的性能强 7.8 倍。

目前,LeVERB-Bench 数据集已在 LeRobot 格式中开源,项目的完整代码也即将发布。

双层系统实现从 ” 想 ” 到 ” 做 ” 的全身动作

多数视觉 – 语言 – 动作(VLA)模型在控制机器人时,依赖手工设计的底层动作 ” 词汇 “(如末端执行器姿势、根部速度等)。

这使得它们只能处理准静态任务,无法应对人形机器人全身控制(WBC)所需的灵活全身动作。

简单来说,以前的机器人要么高层直接控制细节(就像大脑同时管走路和思考,效率低),要么底层不懂语义(就像四肢只听简单命令,复杂任务做不了)。

而人形机器人是高维非线性动态系统,需要高频控制与低频规划结合,传统方法缺乏对视觉和语言语义的有效整合。

于是,团队提出将高层的视觉 – 语言指令压缩映射为一个动作向量,也就是一个抽象指令,这种指令能够被底层的动作模块识别并执行。

在 LeVERB 框架中,这个抽象指令被称为” 潜在动作词汇 “。

LeVERB 框架由分层双系统组成,这两层系统以 ” 潜在动作词汇 ” 作为接口。

该方法的最终目标是使两层的 ” 潜在动作词汇 ” 保持一致,让高层专注 ” 理解任务 “,底层专注 ” 做好动作 “,各取所长。

LeVERB 框架

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

高层LeVERB-VL(想):一个基于 Transformer 的 102.6M 视觉语言主干,将语言指令和视觉上下文转换为潜在动词,运行频率 10Hz。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

LeVERB-VL 负责理解 ” 看到的东西 ” 和 ” 听到的话 “。比如看到 ” 去坐蓝色椅子 “,它会先分析 ” 蓝色椅子在哪 “” 怎么过去 “,但不直接控制动作细节,而是把想法转化成一种 ” 抽象指令 “。

它通过 VLA 先验模块、运动学编码器、残差潜在空间、运动学解码器和判别器等组件,将视觉和语言输入映射到平滑规则的潜在词汇空间,为运动控制生成潜在动作计划。

训练时,通过轨迹重建、分布对齐和对抗分类三部分优化模型,同时采用数据混合策略增强数据多样性,并对超参数进行精细设置,以实现对视觉 – 语言信息的高效处理和准确决策 。

底层LeVERB-A(做):一个基于 Transformer 的 1.1M 全身动作专家,利用强化学习训练的 WBC 策略,接收高层的潜在动作指令,将潜在动词解码为动力学级的人形动作输出,运行频率 50Hz。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

这部分作用是将 LeVERB-VL 生成的潜在指令转化为机器人可执行的动力学级动作。

训练时,先通过近端策略优化算法训练与视觉 – 语言无关的教师策略,再使用 DAgger 算法和 Huber 损失函数将教师策略的动作蒸馏到以潜在命令为条件的学生策略(即 LeVERB-A)中。

运行时,LeVERB-A 接收本体感受信息和潜在向量,采用 Transformer 架构输出经重新参数化的扭矩级关节位置动作指令,并在机器人板载 CPU 上用 C++ 实现实时推理,完成人形机器人的全身控制 。

LeVERB-Bench

无法衡量就无法展开下一步工作,团队还专门提出了一个人形机器人视觉 – 语言全身控制(WBC)任务的配套基准 LeVERB-Bench。

在人形机器人 WBC 领域,用于训练 VLA 模型的演示数据稀缺。现有基准存在诸多问题,如仅关注 locomotion、在状态空间中无视觉、渲染不真实导致仿真与现实差距大等,无法满足研究需求。

LeVERB-Bench 在仿真中重放重定向的动作捕捉(MoCap)运动,收集逼真的轨迹数据。这种方式无需在数据收集时进行可靠的动态控制,运动学姿势能提供任务级语义,还支持使用互联网视频等来源的重定向人形数据。

采用 IsaacSim 中的光线追踪渲染技术,能更准确地模拟场景光照和阴影,减轻以往合成数据中因光照不真实导致的仿真与现实差距问题。

通过程序生成管道,对每个轨迹进行缩放和随机化处理,随机化场景背景、物体属性、任务设置、相机视图,并对部分演示进行镜像,以确保数据的多样性和语义丰富性。

手动或使用 VLM 为数据标注以自我为中心的文本命令。同时,利用 VLM 为仅包含运动的对标注文本指令,增加仅语言数据,扩大数据覆盖范围。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

LeVERB-Bench 包含多种任务类别,如导航(Navigation)、走向目标(Towards)、绕物体移动(Around)、移动(Locomotion)、坐下(Sitting)、伸手够物(Reaching)等。

从视觉 – 语言任务和仅语言任务两个维度进行分类,共涵盖 154 个视觉 – 语言任务轨迹和 460 个仅语言任务轨迹,每个轨迹经过多次随机化后生成大量演示数据。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

通过 154 条轨迹,每条随机化 100 次,生成了 17.1 小时的逼真运动轨迹数据。此外,还增加了 2.7 小时的仅语言数据,覆盖 500 条不同轨迹,进一步丰富了数据集。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

在评估时,会在 20 个随机环境中进行,每个任务类别的场景纹理和物体属性完全随机化且在训练数据中未出现过,同时对第三人称相机角度进行局部随机化,确保评估任务在视觉上未在训练集中出现,以此检验模型的泛化能力。

实验结果

团队将 LeVERB 框架部署在 Unitree G1 机器人上,测试其在真实场景中的零样本闭环控制能力,让机器人执行如 ” 走向椅子坐下 ” 等任务。验证了 LeVERB 从仿真到真实的迁移能力,证明该框架在实际应用中的可行性。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

通过在 LeVERB-Bench 基准上评估,LeVERB 框架表现出色,简单视觉导航任务零样本成功率达 80%,整体任务成功率为 58.5% ,比朴素分层 VLA 方案高出 7.8 倍。这表明 LeVERB 能有效处理复杂视觉 – 语言任务,在不同场景下具备良好的泛化能力。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

还对 LeVERB 框架的关键组件进行消融实验,探究各组件对性能的影响,例如去掉判别器(ND)、运动学编码器(NE)等组件进行测试。

去掉判别器(ND)会导致性能显著下降,表明其在对齐潜在空间、增强模型泛化能力方面的重要性;去掉运动学编码器(NE)也会使性能降低,证明运动学编码器对补充运动细节信息的必要性。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

团队成员半数为华人

LeVERB 团队有半数成员是来自 UC 伯克利、卡内基梅隆大学(CMU)等的华人学者。

该项目的主要负责人薛浩儒硕士毕业于卡内基梅隆大学(CMU),现于 UC 伯克利攻读博士学位。

他曾在 MPC Lab、LeCAR 实验室实验室进行机器人研究,现在 NVIDIA GEAR 实验室实习。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

2021 年至 2024 年,他领导了 AI Racing Tech 项目——一个价值数百万美元的自动驾驶赛车研究项目。

该项目在 F1 级自动驾驶赛车上部署了真实世界的机器人学习,最高时速达到 160 英里。

AI Racing Tech 在 2022 年的美国印第安纳波利斯自动驾驶挑战赛中夺得亚军,在 2023 年夺得季军。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

另一位负责人廖启源本科毕业于广东工业大学机电工程专业,目前是 UC 伯克利机械工程专业的博士研究生。

他的研究方向专注于开发新型机器和驱动方式、结合学习和基于模型的方法、协同设计硬件、学习和控制。

目前,他在波士顿动力公司实习。

 人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示

感兴趣的朋友可以到原文中查看更多细节。

项目地址:https://ember-lab-berkeley.github.io/LeVERB-Website/

论文地址:https://arxiv.org/abs/2506.13751

参考链接:

https://x.com/HaoruXue/status/1937216452983160863

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

量子位 AI 主题策划正在征集中!欢迎参与专题365 行 AI 落地方案,一千零一个 AI 应用,或与我们分享你在寻找的 AI 产品,或发现的AI 新动向。

也欢迎你加入量子位每日 AI 交流群,一起来畅聊 AI 吧~

一键关注 点亮星标

科技前沿进展每日见

以上就是人形机器人首次打通视觉感知与运动断层,UC 伯克利华人博士让宇树 G1 现场演示的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/148343.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
ASF转MP4:简单转换方法
上一篇 2025年12月2日 19:55:00
HTML,CSS和JavaScript基础知识的最终初学者指南
下一篇 2025年12月2日 19:55:05

相关推荐

  • edge浏览器”编写”功能(Copilot)怎么帮你润色文案_edge浏览器AI写作助手使用教程

    答案:通过Edge浏览器内置Copilot可实现文案润色。依次开启AI功能、登录账户,在文本框右键选择“使用Copilot改写”,可选正式、简短等语气风格,或通过侧边栏批量处理内容,提升写作效率。 如果您在撰写网页内容或文档时希望获得智能建议和语言优化,可以借助 Microsoft Edge 浏览器…

    2026年9月20日
    000
  • 小米Civi 3前置摄像头像素是多少 小米Civi 3自拍模式优化技巧

    小米Civi 3前置双3200万像素摄像头,配备78°f/2.0光圈主摄和100°超广角镜头,支持AF对焦与AI畸变矫正;通过切换镜头、开启4K拍摄、调节美颜、优化光线及启用EIS防抖,可显著提升自拍与Vlog画质表现。 小米Civi 3的前置摄像头配置在同级别中非常突出,自拍表现力强,配合一些使用…

    2026年9月20日
    100
  • 美篇如何添加背景音乐

    首先通过美篇内置音乐库或本地导入音频添加背景音乐,再调整自动播放与音量设置,确保阅读体验沉浸且不突兀。 如果您在编辑美篇文章时希望增加背景音乐以提升阅读体验,但不清楚具体操作步骤,可以按照以下方法进行设置。背景音乐能够为图文内容增添氛围,使读者获得更沉浸的浏览感受。 本文运行环境:iPad Air,…

    2026年9月20日
    100
  • Java类的初始化顺序是怎样的 静态代码块和构造代码块先后

    Java类初始化顺序为:父类静态成员→子类静态成员→父类实例成员→父类构造函数→子类实例成员→子类构造函数,静态代码块仅加载时执行一次,构造代码块每次创建对象时执行,且均按书写顺序运行。 Java类的初始化顺序遵循一定的规则,理解这些顺序对掌握对象创建过程非常重要。当一个类被加载并创建实例时,各个代…

    2026年9月20日
    100
  • Java从文本文件随机读取多行连续内容的教程

    本教程旨在指导java开发者如何高效地从文本文件中随机读取并打印指定数量(例如5行)的连续内容,尤其适用于处理结构化文本块(如诗歌)。我们将探讨如何避免仅读取文件开头固定行数的局限,通过将文件内容一次性加载到内存并结合随机数生成器来精确选取所需的文本块,从而实现真正的随机性与灵活性。 引言与问题分析…

    2026年9月20日
    200
  • 如何调整VSCode的设置以获得最佳性能?

    合理配置VSCode可显著提升性能。1. 禁用不必要扩展,减少后台资源占用;2. 在settings.json中设置files.watcherExclude和search.exclude以降低CPU负载;3. 启用editor.renderLineHighlight和largeFileOptimiz…

    2026年9月20日
    500
  • ChatGPT代码会出错吗_AI编程中5个常见错误及解决方法

    AI编程中常见错误包括语法不匹配、逻辑遗漏、API误用、安全漏洞和集成困难,需通过版本明确、测试验证、文档核对、安全扫描和上下文补充等方式解决,结合人工审查与测试才能确保代码质量。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ ChatGP…

    2026年9月20日
    100
  • 或为《刺客信条:起源》相关!巴耶克与艾雅动捕同框

    面容虽被遮挡,但魅力依旧啊!AI 伴学 + 轻薄便携,联想小新平板 12.1,开售啦! 帅是帅,就是比较废指头 FK阿凯 1.4万 0 《刺客信条:起源》的粉丝们近日惊喜地发现,曾为巴耶克与艾雅配音并进行面部捕捉的演员——阿布巴卡尔·萨利姆(Abubakar Salim)与艾莉克斯·威尔顿·里根(A…

    2026年9月20日
    000
  • RBAC(基于角色的权限控制)实现方案

    rbac重要,因为它通过角色管理权限,简化了权限管理,提高了系统安全和管理效率。实现rbac时:1.设计数据库结构,定义用户、角色、权限表及中间表;2.在代码中实现权限检查和角色、权限的动态管理;3.优化性能,防止权限泄露,管理角色膨胀。 在探讨RBAC(基于角色的权限控制)实现方案之前,让我们先来…

    2026年9月20日
    000
  • 腾讯元宝AI便捷体验入口 腾讯元宝网页版在线入口

    腾讯元宝AI便捷体验入口为https://yuanbao.tencent.com,支持网页版、手机APP及微信小程序访问,提供智能问答、文档解析、内容生成等多功能服务。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 腾讯元宝AI便捷体验入口…

    2026年9月20日
    000
  • Android Activity与Fragment通信及视图访问的最佳实践

    本文旨在解决android开发中activity与fragment之间视图访问和数据通信的常见问题,特别是当使用bottom navigation activity模板时。我们将探讨为何不能直接在activity中访问fragment视图,并详细介绍如何利用fragment的生命周期方法(如`onv…

    2026年9月20日
    100
  • Gemini2.5网页版访问入口_Gemini2.5官方网站下载链接

    Gemini 2.5网页版访问入口为 https://gemini.google.com/app,登录谷歌账号后可使用主交互界面、模型切换、文件上传、历史记录及移动端同步等功能。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Gemini2…

    2026年9月20日
    000
  • Java Swing:在类中管理 JFrame 实例的两种策略

    本文探讨在 java swing 应用程序中,如何有效地在不同方法中访问和管理 jframe 实例,避免 this 关键字的限制。我们将介绍两种核心策略:将 jframe 作为类成员变量,或使类直接继承 jframe。同时,强调组件应添加到 jframe 的内容面板,而非直接添加到 jframe。 …

    2026年9月20日
    000
  • VSCode的扩展推荐是怎么工作的?

    VSCode的扩展推荐基于用户行为和项目环境智能生成,当你打开.py文件时会推荐Python相关工具,打开.ts、.vue等文件则触发对应语言插件;系统通过分析package.json、requirements.txt等依赖文件识别技术栈,推荐Docker、ESLint等匹配扩展;同时记录常用操作如…

    2026年9月20日
    000
  • 内存占用过高的优化方法

    优化内存占用的方法包括:1. 遵循基本内存管理原则,避免不必要的对象创建,使用合适的数据结构,及时释放资源;2. 优化数据结构,如从arraylist切换到hashmap;3. 检测并修复内存泄漏,通过定期清理不再需要的数据;4. 使用对象池减少对象的创建和销毁;5. 遵循性能优化与最佳实践,避免频…

    2026年9月20日
    000
  • iPhone命名或跳过19

    iPhone命名或跳过19 近日,科技圈内流传着一个引人瞩目的猜测:苹果公司在为其未来产品命名时,可能会选择直接跳过“iphone 19”这个名称。这一传闻并非空穴来风,而是基于苹果公司以往的命名策略、行业发展趋势以及对品牌形象的整体考量。如果成真,这将是iphone命名史上一个值得记录的时刻。 历…

    2026年9月20日
    100
  • 2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分2025汽车品牌口碑指数NPS公布:小米、问界仅44分

    10月17日,有调研机构发布了2025中国汽车品牌口碑指数nps。其中,小米汽车与aito问界品牌的nps(净推荐值)均仅为44分,远低于行业头部品牌。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 小米汽车 报告显示,新能源汽车主流品牌的…

    2026年9月20日 用户投稿
    000
  • 当VSCode启动或运行变慢时,有哪些系统性的排查和优化步骤?

    答案:VSCode变慢主要由扩展、文件监控和设置引起。先以安全模式启动排查扩展影响,使用内置性能工具分析启动耗时,优化工作区的文件监听与搜索范围,调整渲染设置并清理缓存,可显著提升运行效率。 VSCode 启动或运行变慢通常涉及扩展、设置、系统资源或文件索引等问题。以下是系统性的排查与优化步骤,帮助…

    2026年9月20日
    000
  • 拼多多砍价咨询处理难题?晓多方言识别技术提升30%订单转化!方言咨询不再“听不懂”!「别担心」有晓多来帮你

    在拼多多的砍价活动中,每天有超500万条来自全国各地的方言咨询涌入商家后台。“这个价咋个砍嘛?”“阿妹帮我看下这价啷个算?”面对五湖四海的方言提问,传统客服系统频频“崩溃”。晓多科技推出的方言识别技术矩阵,融合xpt大模型与先进声学算法,成功将订单转化率提升30%,为电商行业解决了长期存在的服务瓶颈…

    2026年9月20日
    000
  • Figure人形机器人全面升级 阿里/微美全息构筑竞争护城河抢占行业先机!

    Figure人形机器人全面升级  阿里/微美全息构筑竞争护城河抢占行业先机!Figure人形机器人全面升级  阿里/微美全息构筑竞争护城河抢占行业先机!Figure人形机器人全面升级  阿里/微美全息构筑竞争护城河抢占行业先机!Figure人形机器人全面升级  阿里/微美全息构筑竞争护城河抢占行业先机!

    获悉,日前,全球工业自动化领域迎来一场颠覆性变革。10月8日,abb集团正式宣布,将其机器人业务单元以53.75亿美元的企业价值出售给日本软银集团。 此次交易不仅彻底改变了工业机器人“四大家族”的竞争版图,也凸显出AI巨头向实体制造领域深度布局的战略野心。背后动因在于,当前工业机器人行业正处于关键转…

    2026年9月20日 用户投稿
    200

发表回复

登录后才能评论
关注微信