PyTorch中查找张量B元素在张量A中所有索引位置的内存优化方案

PyTorch中查找张量B元素在张量A中所有索引位置的内存优化方案

本文探讨了PyTorch中高效查找张量B元素在张量A中所有索引位置的策略,尤其针对大规模张量避免广播内存限制。提供了结合部分广播与Python循环的混合方案,以及纯Python循环迭代方案,旨在优化内存并生成结构化索引。文章将指导开发者根据场景选择最佳方法。

引言:大规模张量索引查找的挑战

pytorch深度学习框架中,我们经常需要处理张量(tensor)数据。一个常见的需求是,给定两个张量a和b,找出张量b中每个值在张量a中所有出现的位置(即索引)。例如,如果张量a为 [1,2,3,3,2,1,4,5,9],张量b为 [1,2,3,9],我们期望的输出是 [[0,5], [1,4], [2,3], [8]],其中每个子列表对应b中一个值在a中的所有索引。

对于小型张量,通过广播(broadcasting)进行元素比较是一种直观且简洁的方法。然而,当张量A和B的规模非常大时,直接使用广播操作(例如 A[:, None] == B)可能会导致中间张量占用巨大的内存,从而引发内存溢出问题。因此,寻找内存高效的解决方案变得至关重要。

广播方法的局限性

最初,开发者可能会尝试使用如下的广播逻辑:

import torchdef vectorized_find_indices_broadcast(A, B):    # 扩展A的维度以与B进行广播比较    # A_expanded = A[:, None, None] # 原始问题中的三重扩展可能并非必需,但原理相同    # mask = (B == A_expanded)    # ... 后续操作    pass

这种方法的核心在于创建一个与 A 和 B 元素数量乘积大小相近的布尔掩码(或索引张量)。对于 A 的大小为 N,B 的大小为 M,中间张量的大小将是 N x M。当 N 和 M 都非常大时,例如达到数百万甚至数亿时,N * M 的元素数量将远远超出可用内存,使得这种完全广播的方案不可行。

方案一:混合式索引查找(部分广播 + Python循环)

为了在一定程度上利用PyTorch的并行计算能力,同时避免完全广播带来的内存问题,可以采用一种混合方法:首先进行部分广播以识别匹配位置,然后使用Python循环将结果组织成所需的结构。

这种方法的核心思想是利用 (a.unsqueeze(1) == b).nonzero() 来获取所有匹配的 (A_index, B_index) 对。a.unsqueeze(1) 将张量 a 变为 (N, 1) 的形状,与 b(形状为 (M,))进行比较时,会广播成 (N, M) 的布尔张量。然后 nonzero() 函数会立即将这个 (N, M) 的布尔张量转换为一个 (K, 2) 的索引张量,其中 K 是匹配的总数量,这大大减少了内存占用

import torchdef find_indices_hybrid(a: torch.Tensor, b: torch.Tensor):    """    使用部分广播和Python循环查找张量B中元素在张量A中的所有索引。    Args:        a (torch.Tensor): 目标张量A。        b (torch.Tensor): 待查找值的张量B。    Returns:        list[list[int]]: 一个列表的列表,其中每个子列表包含B中对应值在A中的索引。    """    if a.ndim != 1 or b.ndim != 1:        raise ValueError("输入张量a和b必须是一维张量。")    # 步骤1: 使用unsqueeze和nonzero获取所有匹配的(a_idx, b_idx)对    # (a.unsqueeze(1) == b) 会创建一个 N x M 的布尔张量,    # 其中 (i, j) 为 True 表示 a[i] == b[j]。    # nonzero() 将其转换为一个 K x 2 的张量,K是匹配的总数,    # 每行 [a_idx, b_idx] 表示 a[a_idx] == b[b_idx]。    overlap_idxs = (a.unsqueeze(1) == b).nonzero()    # 步骤2: 初始化结果列表,为B中的每个元素预留一个子列表    output = [[] for _ in b]    # 步骤3: 遍历匹配对,将A的索引添加到B对应值的列表中    for (a_idx, b_idx) in overlap_idxs:        output[b_idx.item()].append(a_idx.item())    return output# 示例A_tensor = torch.tensor([1, 2, 3, 3, 2, 1, 4, 5, 9])B_tensor = torch.tensor([1, 2, 3, 9])result_hybrid = find_indices_hybrid(A_tensor, B_tensor)print(f"混合方法结果: {result_hybrid}")# 预期输出: [[0, 5], [1, 4], [2, 3], [8]]

优点:

nonzero() 操作能有效减少内存占用,因为它只存储 True 值的位置,而非整个 N x M 的布尔矩阵。初始的比较操作在PyTorch后端进行,具有一定的并行性。

缺点:

a.unsqueeze(1) == b 这一步仍然会生成一个 N x M 的布尔张量,尽管 nonzero() 紧随其后,但这个中间张量在某些极端情况下(N 和 M 都非常大,但匹配数量 K 相对较小)仍可能导致内存峰值。最终结果的构建依赖于Python循环,这在大规模匹配对 K 的情况下可能会较慢。

方案二:纯Python循环迭代查找

为了彻底避免任何大规模的中间张量,我们可以采用纯Python循环的方式,逐个处理张量B中的每个元素。这种方法牺牲了部分PyTorch的并行性,但在内存使用上最为保守。

import torchdef find_indices_pure_loop(a: torch.Tensor, b: torch.Tensor):    """    使用纯Python循环查找张量B中元素在张量A中的所有索引。    Args:        a (torch.Tensor): 目标张量A。        b (torch.Tensor): 待查找值的张量B。    Returns:        list[list[int]]: 一个列表的列表,其中每个子列表包含B中对应值在A中的索引。    """    if a.ndim != 1 or b.ndim != 1:        raise ValueError("输入张量a和b必须是一维张量。")    output = []    for _b_val in b:        # 对于B中的每个值,在A中查找其所有索引        # (a == _b_val) 会生成一个 N 长度的布尔张量        # .nonzero() 找到所有为True的索引        # .squeeze() 移除不必要的维度(例如,如果只有一个索引,结果是(1,)而不是(1,1))        # .tolist() 转换为Python列表        idxs = (a == _b_val).nonzero().squeeze().tolist()        # 确保结果是列表形式,即使只有一个或没有匹配        if not isinstance(idxs, list):            idxs = [idxs] # 如果只有一个匹配,squeeze().tolist()可能返回一个int        output.append(idxs)    return output# 示例A_tensor = torch.tensor([1, 2, 3, 3, 2, 1, 4, 5, 9])B_tensor = torch.tensor([1, 2, 3, 9])result_pure_loop = find_indices_pure_loop(A_tensor, B_tensor)print(f"纯循环方法结果: {result_pure_loop}")# 预期输出: [[0, 5], [1, 4], [2, 3], [8]]

优点:

内存使用最为优化。在任何时刻,只处理 A 与 B 中单个元素的比较,中间张量的大小始终是 N(A 的长度),避免了 N x M 级别的内存开销。对于内存极其受限的场景,这是最稳妥的选择。

缺点:

由于外部循环是Python循环,其执行效率通常低于PyTorch的完全向量化操作。当 B 的长度 M 非常大时,性能可能会成为瓶颈。

性能与内存考量及选择

选择哪种方法取决于具体的应用场景:

内存优先级最高: 如果你的张量A和B都非常大,以至于 N x M 的布尔张量绝对无法在内存中创建,那么纯Python循环迭代查找(方案二)是唯一的选择。它以牺牲计算速度为代价,换取了最小的内存占用。性能与内存平衡: 如果 N x M 的布尔张量虽然大但其 nonzero() 后的结果 K x 2 张量可以接受,并且你希望利用PyTorch的并行性,那么混合式索引查找(方案一)可能是一个不错的折衷方案。它在 nonzero() 之前存在一个内存峰值,但之后内存占用会迅速下降。小规模张量: 对于 N 和 M 都不太大的情况,直接使用完全广播的向量化方法(如 (A[…, None] == B).any(-1).nonzero() 的变体或原始问题中提及的 vectorized_find_indices 的优化版本)可能是最快和最简洁的。然而,本文主要关注大规模张量的内存优化。

注意事项:

上述两种方案都将返回一个列表的列表。如果 B 中的某个值在 A 中不存在,对应的子列表将为空。确保输入张量是一维的,如果不是,可能需要先进行 flatten() 或其他重塑操作。在实际应用中,可以通过对 B 进行去重处理(B.unique())来优化,减少不必要的重复查找,但需要额外的逻辑来将结果映射回原始 B 的结构。

总结

高效查找大规模张量中元素的索引是一个常见的挑战,尤其是在内存受限的环境中。本文介绍了两种内存优化的策略:一种是结合部分广播和Python循环的混合方法,它通过 nonzero() 及时减少内存占用;另一种是纯Python循环迭代的方法,它以最保守的内存使用方式,逐个处理元素。开发者应根据其张量规模、内存预算和性能要求,权衡利弊,选择最适合的解决方案。理解这些方法的内存和性能特性,是构建健壮且高效PyTorch应用的关键。

以上就是PyTorch中查找张量B元素在张量A中所有索引位置的内存优化方案的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1375735.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
解决 Pyfolio 与 Pandas 2.0+ 兼容性问题的教程
上一篇 2025年12月14日 15:16:44
解决 Kivy BuilderException:理解 KV 文件重复加载机制
下一篇 2025年12月14日 15:16:57

相关推荐

  • 怎么在mysql中创建一个表 mysql新建数据表步骤教程

    在 mysql 中创建表的步骤和建议包括:1. 明确业务需求,设计表结构;2. 使用 create table 语句创建表,选择合适的数据类型和设置主键、索引;3. 考虑大数据量时使用分区;4. 设置正确的字符集和排序规则;5. 谨慎使用索引;6. 使用 if not exists 避免重复创建表。…

    2026年9月24日
    000
  • 主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?

    主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?

    答案是旗舰芯片组主板超频功能更强,具体取决于平台和型号。Intel的Z系列与AMD的X/B650E等高端主板提供完整超频选项,而B/H/A系列则限制较多;微星MPOWER系列在主流芯片组上提供越级超频工具;华硕、微星、技嘉三大品牌在BIOS设计上兼顾易用性与专业性,各具特色;最终选择需结合CPU支持…

    2026年9月24日 用户投稿
    000
  • 百度搜索app如何设置默认搜索引擎_百度搜索app搜索引擎切换的详细步骤

    百度搜索app如何设置默认搜索引擎_百度搜索app搜索引擎切换的详细步骤百度搜索app如何设置默认搜索引擎_百度搜索app搜索引擎切换的详细步骤百度搜索app如何设置默认搜索引擎_百度搜索app搜索引擎切换的详细步骤百度搜索app如何设置默认搜索引擎_百度搜索app搜索引擎切换的详细步骤

    百度App不支持更换默认搜索引擎,用户需通过系统浏览器或第三方浏览器设置。首先检查百度App内“我的-设置”是否有搜索引擎选项;若无,可进入手机系统设置中修改默认浏览器的搜索引擎;或下载如Kiwi Browser、Firefox等支持自定义搜索引擎的浏览器,将其默认搜索设为百度,实现灵活搜索体验。 …

    2026年9月24日 用户投稿
    000
  • Spring Boot @Nested 测试中属性覆盖与隔离策略

    Spring Boot @Nested 测试中属性覆盖与隔离策略Spring Boot @Nested 测试中属性覆盖与隔离策略Spring Boot @Nested 测试中属性覆盖与隔离策略Spring Boot @Nested 测试中属性覆盖与隔离策略

    本文深入探讨了在Spring Boot集成测试中,如何利用@Nested注解结合@TestPropertySource实现细粒度的属性配置和隔离。通过详细的示例代码,展示了外部测试类和嵌套测试类如何定义各自的属性集,以及这些属性在不同测试上下文中的继承与覆盖机制,从而确保测试环境的精确控制和独立性。…

    2026年9月24日 用户投稿
    000
  • 2025拼多多双11力度大吗?2025拼多多新版本

    2025拼多多双11力度大吗?2025拼多多新版本2025拼多多双11力度大吗?2025拼多多新版本2025拼多多双11力度大吗?2025拼多多新版本2025拼多多双11力度大吗?2025拼多多新版本

    拼多多2025年双11延续低价策略,升级百亿补贴、推出超级拼团2.0、发放直播神券、启用AR购物空间并扩容会员特权,覆盖iPhone、家电、美妆等品类,叠加多重优惠与互动玩法提升用户体验。 如果您计划在2025年双11期间购物,可能会关注拼多多此次大促的优惠幅度是否足够吸引人。今年拼多多延续了其“低…

    2026年9月24日 用户投稿
    000
  • sublime怎么安装字体并应用_sublime更换与应用新字体方法

    sublime怎么安装字体并应用_sublime更换与应用新字体方法sublime怎么安装字体并应用_sublime更换与应用新字体方法sublime怎么安装字体并应用_sublime更换与应用新字体方法sublime怎么安装字体并应用_sublime更换与应用新字体方法

    先在操作系统安装字体文件,再通过Sublime Text设置中的font_face指定字体名称即可应用。1. 将.ttf或.otf字体文件安装到系统:Windows右键安装,macOS双击后点击“安装字体”,Linux复制到~/.fonts并运行fc-cache -fv更新缓存。2. 重启Subli…

    2026年9月24日 用户投稿
    000
  • 新增Pro Max旗舰 Civi定位调整:小米手机大变阵为哪般?

    新增Pro Max旗舰 Civi定位调整:小米手机大变阵为哪般?新增Pro Max旗舰 Civi定位调整:小米手机大变阵为哪般?新增Pro Max旗舰 Civi定位调整:小米手机大变阵为哪般?新增Pro Max旗舰 Civi定位调整:小米手机大变阵为哪般?

    2025年,全球智能手机行业步入深度变革阶段。中国信通院最新研究数据显示,今年上半年,国内用户平均换机周期已接近33个月。在市场趋于饱和、增长乏力的背景下,头部手机厂商纷纷开启战略性调整,从产品结构优化到发布节奏重构,一场涵盖苹果、小米、vivo等品牌的“集体转型”正在悄然展开。 据悉,苹果拟对iP…

    2026年9月24日 用户投稿
    000
  • 苹果手机怎么截长图 苹果手机截长图的方法

    苹果手机怎么截长图 苹果手机截长图的方法苹果手机怎么截长图 苹果手机截长图的方法苹果手机怎么截长图 苹果手机截长图的方法苹果手机怎么截长图 苹果手机截长图的方法

    苹果手机截取长图的方法有两种:一是滚动截屏,二是使用第三方应用程序如 Tailor、Stitch It! 或 Scrolling Screenshot。 苹果手机截长图的方法 苹果手机提供了两种截取长图的方法: 方法一:滚动截屏 截取屏幕的第一部分。点击并按住屏幕截图预览。轻扫手指到想要截取的区域末…

    2026年9月24日 用户投稿
    100
  • 快手账号如何实名认证_快手账号实名认证的步骤与要求

    快手账号如何实名认证_快手账号实名认证的步骤与要求快手账号如何实名认证_快手账号实名认证的步骤与要求快手账号如何实名认证_快手账号实名认证的步骤与要求快手账号如何实名认证_快手账号实名认证的步骤与要求

    未完成实名认证将限制快手直播和视频发布功能。个人用户需通过身份证认证并可能配合人脸识别,企业用户则需提交营业执照及完成对公打款验证,审核通过后方可开通权限。 如果您已经注册了快手账号,但发现无法开通直播或发布某些视频,很可能是因为尚未完成实名认证。实名认证是使用快手核心功能的前提,未认证账号将受到多…

    2026年9月24日 用户投稿
    200
  • Android应用中通过下载链接从Firebase Storage下载文件教程

    Android应用中通过下载链接从Firebase Storage下载文件教程Android应用中通过下载链接从Firebase Storage下载文件教程Android应用中通过下载链接从Firebase Storage下载文件教程Android应用中通过下载链接从Firebase Storage下载文件教程

    本教程详细介绍了在Android应用中如何利用文件的下载URL,结合Android DownloadManager将Firebase Storage中的文件下载到用户设备指定目录。内容涵盖必要的运行时权限处理、清单文件配置以及DownloadManager的具体使用方法,旨在帮助开发者实现本地文件存…

    2026年9月24日 用户投稿
    300
  • 163邮箱官网手机免费入口 163免费邮箱移动登录

    163邮箱官网手机免费入口 163免费邮箱移动登录163邮箱官网手机免费入口 163免费邮箱移动登录163邮箱官网手机免费入口 163免费邮箱移动登录163邮箱官网手机免费入口 163免费邮箱移动登录

    163邮箱官网手机免费入口可通过访问mail.163.com自动跳转至移动版,或在应用商店下载“网易邮箱”App登录,支持多账号管理、邮件收发、附件添加、消息推送及多设备同步,并提供登录保护、主题自定义和垃圾邮件过滤等安全与个性化功能。 163邮箱官网手机免费入口在哪里?这是不少网友都关注的,接下来…

    2026年9月24日 用户投稿
    100
  • sublime的session文件是做什么用的_sublime会话文件作用与恢复机制

    sublime的session文件是做什么用的_sublime会话文件作用与恢复机制sublime的session文件是做什么用的_sublime会话文件作用与恢复机制sublime的session文件是做什么用的_sublime会话文件作用与恢复机制sublime的session文件是做什么用的_sublime会话文件作用与恢复机制

    Sublime Text的session文件记录了打开的文件、光标位置、代码折叠状态、窗口布局及未保存内容等信息,位于系统特定目录下的Local文件夹中,以JSON格式存储,通过自动保存机制在重启后恢复编辑状态。 Sublime Text 的 session 文件主要用于保存用户当前编辑环境的状态信…

    2026年9月24日 用户投稿
    000
  • DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成

    DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成

    很多用户好奇,像DeepSeek这样的AI模型能否帮助完成编程任务,特别是那些相对简单的编程需求。答案是肯定的。DeepSeek具备理解自然语言描述并尝试生成相应代码的能力,这使得它成为完成一些简单编程任务的有力工具。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepS…

    2026年9月24日 用户投稿
    100
  • ubuntu如何mount网络驱动器

    在ubuntu中挂载网络驱动器有多种方法,以下是一些常见的方法: 方法一:使用mount命令 确定网络驱动器的地址:例如,如果是Samba共享,地址可能是smb://server/share。如果是NFS共享,地址可能是nfs://server/share。安装必要的软件包:对于Samba共享,安装…

    2026年9月24日
    000
  • Java中双精度浮点数的小数位控制技巧

    Java中双精度浮点数的小数位控制技巧Java中双精度浮点数的小数位控制技巧Java中双精度浮点数的小数位控制技巧Java中双精度浮点数的小数位控制技巧

    本文深入探讨了在Java中有效控制double类型数值小数位数的方法。通过Math.round()函数结合乘除操作,可以实现数值本身的四舍五入并改变其精度;而String.format()则提供了灵活的字符串格式化功能,用于在不修改原始数值的情况下精确控制显示的小数位数。这两种方法分别适用于不同的业…

    2026年9月24日 用户投稿
    100
  • Steam新游周报:经典恐怖游戏新作登场!

    Steam新游周报:经典恐怖游戏新作登场!Steam新游周报:经典恐怖游戏新作登场!Steam新游周报:经典恐怖游戏新作登场!Steam新游周报:经典恐怖游戏新作登场!

    十一国庆前的最后一周,Steam上又有许多令人兴奋的新作发布!本周策略玩家与模拟建设玩家有福了,将有数款新作等着你们,体育爱好者们则能玩到EA一款足球年货游戏,而本周黑马则是一款来自科乐美的经典日式恐怖游戏。让我们进入这周的新游周报吧! 周一(9月22日) 名望(抢先体验) Steam商店页面:名望…

    2026年9月24日 用户投稿
    000
  • 高质量免费logo设计网站 国产免费logo生成工具推荐

    国产免费Logo设计网站推荐即时设计、DesignEvo、牛人设计等,这些平台提供海量模板、支持中文输入与AI智能生成,具备全中文界面、本土化元素和矢量导出功能,适合零基础用户快速制作高质量Logo。 高质量免费logo设计网站国产免费logo生成工具推荐这是不少网友都关注的接下来由PHP小编为大家…

    2026年9月24日
    300
  • 如何通过BIOS调整CPU电压实现节能?

    答案:CPU降压通过BIOS调整Vcore电压,采用Offset模式在保证稳定前提下降低功耗与温度,提升能效;需结合HWiNFO64等工具监控温度、功耗,并用Prime95等压力测试验证稳定性,避免蓝屏或崩溃,合理设置可使CPU在更低温度下维持更高睿频,实现节能且不牺牲性能。 通过BIOS调整CPU…

    2026年9月24日
    700
  • 为什么GPU显存带宽比容量更重要?

    显存带宽比容量更重要,因其直接决定数据传输速度,影响GPU计算单元的利用率。在AI训练和高分辨率渲染中,高带宽可避免“数据饥饿”,确保海量数据高效流转,而HBM技术凭借3D堆叠和宽接口提供远超GDDR的带宽,成为高性能计算的关键。 GPU显存带宽比容量更重要,核心在于现代GPU的工作模式和其处理的数…

    2026年9月24日
    200
  • VSCode如何实现代码热重载 VSCode实时预览开发的高效配置方案

    使用live server扩展实现静态文件的实时预览,保存后浏览器自动刷新;2. 利用现代前端框架(如react、vue)内置的开发服务器(如vite、webpack dev server)实现hmr热模块替换,修改代码后仅更新变动模块而不刷新页面;3. 结合browsersync等工具实现多设备同…

    2026年9月24日
    000

发表回复

登录后才能评论
关注微信