Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
JAX vmap 高效并行化模型集成推理:从列表到结构化数组的转换_创想鸟

JAX vmap 高效并行化模型集成推理:从列表到结构化数组的转换

JAX vmap 高效并行化模型集成推理:从列表到结构化数组的转换

本文探讨了在JAX中利用jax.vmap高效并行化神经网络模型集成推理时遇到的常见问题及解决方案。当尝试对一个由多个网络参数构成的Python列表使用vmap时,常因vmap对输入结构的要求与实际不符而引发ValueError。核心在于将“结构列表”转换为“结构化数组”模式,通过jax.tree_map将分散的参数堆叠成批处理形式,从而正确利用vmap的并行能力。

1. JAX vmap 与模型集成推理的挑战

在机器学习中,模型集成(ensemble learning)是一种常用的提升模型性能和鲁棒性的技术。当需要对一个包含多个神经网络的模型集成进行推理时,顺序执行每个模型的推理过程(如通过for循环)效率低下,尤其是在gpu或tpu等并行计算设备上。jax的jax.vmap函数是解决这类问题的强大工具,它能够自动向量化函数,将批量操作转换为单个函数调用,从而实现高效并行计算。

考虑一个简单的神经网络集成,其损失计算通常如下:

for params in ensemble_params:    loss = mse_loss(params, inputs=x, targets=y)def mse_loss(params, inputs, targets):    preds = batched_predict(params, inputs)    loss = jnp.mean((targets - preds) ** 2)    return loss

这里,ensemble_params是一个包含多个网络参数(PyTree结构)的Python列表。为了避免for循环,我们自然会想到使用jax.vmap:

ensemble_loss = jax.vmap(fun=mse_loss, in_axes=(0, None, None))losses = ensemble_loss(ensemble_params, x, y)

然而,这种尝试通常会导致如下ValueError:

ValueError: vmap got inconsistent sizes for array axes to be mapped:  * most axes (8 of them) had size 3, e.g. axis 0 of argument params[0][0][0] of type float32[3,2];  * some axes (8 of them) had size 4, e.g. axis 0 of argument params[0][1][0] of type float32[4,3]

这个错误信息表明vmap在尝试对输入参数进行映射时,发现某些数组的特定轴尺寸不一致。这揭示了对vmap如何处理复杂数据结构(如PyTree列表)的常见误解。

2. 理解 jax.vmap 的映射机制

jax.vmap 的核心功能是在函数的输入参数上引入一个新的“批处理”维度,并沿着这个维度并行执行函数。它期望接收一个单一的PyTree结构作为输入(对于被映射的参数),其中这个批处理维度作为所有叶子数组(即实际的JAX数组)的第一个轴。

当我们将一个list(例如ensemble_params,它是一个包含多个网络参数PyTree的列表)传递给vmap并指定in_axes=0时,vmap不会自动将这个list的每个元素视为一个独立的批次项。相反,JAX将Python list视为一种特殊的PyTree节点。当vmap尝试对这个PyTree(即我们的ensemble_params列表)应用in_axes=0时,它会深入到这个PyTree的叶子节点。

具体来说,ensemble_params的结构是 [network1_params_pytree, network2_params_pytree, …]。每个network_params_pytree内部又包含多个层的权重和偏置,例如 [[w1, b1], [w2, b2], …]。当vmap试图对ensemble_params的“0轴”进行映射时,它会遍历其所有叶子节点(即每个w和b数组),并期望这些叶子数组的第0轴具有一致的尺寸,以便沿着这个轴进行批处理。

然而,在神经网络的参数PyTree中,不同层的权重矩阵(例如w1和w2)的形状通常是不同的。例如,w1可能是 (dim_out_layer1, dim_in_layer1),而w2可能是 (dim_out_layer2, dim_in_layer2)。这意味着它们的第0轴(dim_out_layer1和dim_out_layer2)尺寸很可能不一致。vmap尝试将这些不一致的第0轴视为要映射的批处理维度,从而导致ValueError。

问题的根本在于:vmap期望的是一个“结构化数组”(Struct-of-Arrays)模式,而不是“结构列表”(List-of-Structs)模式。

结构列表 (List-of-Structs): [model1_params_pytree, model2_params_pytree, …]结构化数组 (Struct-of-Arrays): 一个单一的PyTree,其叶子节点是已经堆叠好的数组,例如 {‘layer1_weights’: jnp.array([w1_model1, w1_model2, …]), ‘layer1_biases’: jnp.array([b1_model1, b1_model2, …]), …}。

3. 解决方案:转换为结构化数组模式

要解决这个问题,我们需要将ensemble_params从“结构列表”转换为“结构化数组”。这意味着,对于集成中的所有模型,它们的相同层、相同类型的参数(例如所有模型的第一个隐藏层的权重)应该被堆叠到一个新的JAX数组中,形成一个新的批处理维度。

jax.tree_map函数是实现这一转换的理想工具。它可以在两个或多个PyTree上并行地应用一个函数,对它们对应的叶子节点进行操作。

ensemble_params_batched = jax.tree_map(lambda *args: jnp.stack(args), *ensemble_params)

这段代码的工作原理如下:

*ensemble_params:将ensemble_params列表中的每个PyTree解包,作为单独的参数传递给jax.tree_map。例如,如果ensemble_params包含两个PyTree P1和P2,那么jax.tree_map会接收P1, P2作为输入。lambda *args: jnp.stack(args):这是一个匿名函数,它接收可变数量的参数(*args)。jax.tree_map会将所有输入PyTree中对应位置的叶子节点作为*args传递给这个lambda函数。jnp.stack(args):这个函数将这些对应的叶子节点(例如,w1_model1, w1_model2, w1_model3)沿一个新的轴(默认是第0轴)堆叠起来,形成一个批处理数组。

经过此转换后,ensemble_params_batched将是一个单一的PyTree,其内部的每个叶子数组都包含所有模型的对应参数,且批处理维度作为其第一个轴。现在,这个PyTree的结构就符合vmap的期望了。

4. 完整示例与验证

让我们将解决方案整合到原始的最小可复现示例中。

import jaxfrom jax import Arrayfrom jax import randomimport jax.numpy as jnp# 辅助函数:初始化单层参数def layer_params(dim_in: int, dim_out: int, key: Array) -> tuple[Array]:    w_key, b_key = random.split(key=key)    weights = random.normal(key=w_key, shape=(dim_out, dim_in))    biases = random.normal(key=b_key, shape=(dim_out,)) # Changed w_key to b_key for bias init    return weights, biases# 辅助函数:初始化单个网络参数PyTreedef init_params(layer_dims: list[int], key: Array) -> list[tuple[Array]]:    keys = random.split(key=key, num=len(layer_dims) - 1) # Split keys for each layer    params = []    for i, (dim_in, dim_out) in enumerate(zip(layer_dims[:-1], layer_dims[1:])):        params.append(layer_params(dim_in=dim_in, dim_out=dim_out, key=keys[i]))    return params# 辅助函数:初始化网络集成(列表形式)def init_ensemble(key: Array, num_models: int, layer_dims: list[int]) -> list:    keys = random.split(key=key, num=num_models)    # ensemble_params 是一个 PyTree 的列表 (list-of-structs)    models = [init_params(layer_dims=layer_dims, key=key) for key in keys]    return models# 激活函数def relu(x):  return jnp.maximum(0, x)# 单个网络的前向传播def predict(params, image):  activations = image  for w, b in params[:-1]:    outputs = jnp.dot(w, activations) + b    activations = relu(outputs)  final_w, final_b = params[-1]  logits = jnp.dot(final_w, activations) + final_b  return logits# 对输入数据进行批处理预测batched_predict = jax.vmap(predict, in_axes=(None, 0))# 均方误差损失函数def mse_loss(params, inputs, targets):    preds = batched_predict(params, inputs)    loss = jnp.mean((targets - preds) ** 2)    return lossif __name__ == "__main__":    num_models = 4    dim_in = 2    dim_out = 4    layer_dims = [dim_in, 3, dim_out] # 示例网络结构    batch_size = 2    key = random.PRNGKey(seed=1)    key, subkey = random.split(key)    # 初始化模型集成,得到 list-of-structs 形式的参数    ensemble_params_list = init_ensemble(key=subkey, num_models=num_models, layer_dims=layer_dims)    key_x, key_y = random.split(key)    x = random.normal(key=key_x, shape=(batch_size, dim_in))    y = random.normal(key=key_y, shape=(batch_size, dim_out))    print("--- 传统 for 循环计算损失 ---")    for params in ensemble_params_list:        loss = mse_loss(params, inputs=x, targets=y)        print(f"{loss = }")    print("n--- 尝试直接 vmap (会报错) ---")    try:        # 这一行会引发 ValueError,因为 ensemble_params_list 是 list-of-structs        ensemble_loss_vmap_fail = jax.vmap(fun=mse_loss, in_axes=(0, None, None))        losses_fail = ensemble_loss_vmap_fail(ensemble_params_list, x, y)        print(f"Failed vmap losses = {losses_fail}")    except ValueError as e:        print(f"捕获到预期错误: {e}")    print("n--- 转换为 Struct-of-Arrays 并使用 vmap ---")    # 关键步骤:将 list-of-structs 转换为 struct-of-arrays    ensemble_params_batched = jax.tree_map(lambda *args: jnp.stack(args), *ensemble_params_list)    # 现在可以正确使用 vmap    ensemble_loss_vmap_success = jax.vmap(fun=mse_loss, in_axes=(0, None, None))    losses_success = ensemble_loss_vmap_success(ensemble_params_batched, x, y)    print(f"{losses_success = }")    # 预期与 for 循环的结果相同

运行结果示例:

--- 传统 for 循环计算损失 ---loss = Array(3.762451, dtype=float32)loss = Array(4.39846, dtype=float32)loss = Array(4.1425314, dtype=float32)loss = Array(6.045669, dtype=float32)--- 尝试直接 vmap (会报错) ---捕获到预期错误: vmap got inconsistent sizes for array axes to be mapped:  * most axes (8 of them) had size 3, e.g. axis 0 of argument params[0][0][0] of type float32[3,2];  * some axes (8 of them) had size 4, e.g. axis 0 of argument params[0][1][0] of type float32[4,3]--- 转换为 Struct-of-Arrays 并使用 vmap ---losses_success = Array([3.762451 , 4.39846  , 4.1425314, 6.045669 ], dtype=float32)

可以看到,经过jax.tree_map转换后,vmap能够成功并行计算所有模型的损失,并且结果与for循环得到的结果一致。

5. 注意

以上就是JAX vmap 高效并行化模型集成推理:从列表到结构化数组的转换的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1369935.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
RESTful API 的设计与实现(FastAPI/Django REST Framework)
上一篇 2025年12月14日 10:05:38
JAX vmap并行化模型集成推理:从列表结构到数组结构的转换技巧
下一篇 2025年12月14日 10:05:54

相关推荐

  • 如何从被调用类中获取调用者文件的命名空间

    本文探讨了在PHP中,如何在不通过参数传递的情况下,从一个被调用的工具类中获取到调用该方法的文件的命名空间。通过结合使用`debug_backtrace()`回溯调用栈以定位调用者文件,并利用`token_get_all()`解析文件内容来提取命名空间声明,提供了一种实用的解决方案。文章详细介绍了实…

    2026年9月21日
    000
  • 构建Spring自定义Kafka配置的注解式解决方案

    本文探讨了在Spring Boot应用中通过自定义注解实现Kafka配置自动化时遇到的挑战,特别是由于Bean注册时机不当导致的依赖注入失败。我们将深入分析问题根源,并提供两种核心解决方案:利用META-INF/spring.factories实现标准化的自动配置发现,以及通过ImportBeanD…

    2026年9月21日
    1100
  • 悟空浏览器开发者工具的控制台怎么用_悟空浏览器Console控制台使用入门教程

    首先启用悟空浏览器开发者工具并进入Console标签,可查看错误、警告等日志信息,通过过滤功能定位问题;支持执行JavaScript代码实时调试,监控网络请求失败及全局异常,还可清空或保存日志以便分析。 如果您在使用悟空浏览器进行网页开发或调试时,发现页面元素未按预期工作或脚本报错,则可以借助开发者…

    2026年9月21日
    700
  • 蝴蝶号无人直播中的AI角色控制技巧与注意事项

    蝴蝶号无人直播中的AI角色控制技巧与注意事项蝴蝶号无人直播中的AI角色控制技巧与注意事项蝴蝶号无人直播中的AI角色控制技巧与注意事项蝴蝶号无人直播中的AI角色控制技巧与注意事项

    要让蝴蝶号ai角色在直播中更具真实感和互动性,关键在于注入“人味儿”,打破“机器感”。首先,声音要有温度,选择有情感起伏的音色,并根据不同语境调整语调、语速,适当加入语气词增强亲切感;其次,确保视觉形象与行为模式统一,动作、表情、眼神与语音内容自然同步,强化人设一致性;第三,建立多层次互动逻辑,ai…

    2026年9月21日 • 用户投稿
    400
  • 美团外卖节日优惠券领取入口_美团节日活动优惠券获取方法

    节日期间可通过美团外卖首页“膨胀红包”、搜索品牌关键词、参与“神抢手”秒杀、邀请好友助力及关注官方社交媒体口令等五种方法领取优惠券,具体包括完成任务积累红包、领取0元饮品券、抢购低价商品券、获取大额免单券和兑换口令红包。 如果您在节日期间准备通过美团外卖订餐,但未能找到可用的优惠券入口,则可能是由于…

    2026年9月21日
    100
  • VSCode整个项目怎么导出_VSCode项目打包与导出为压缩文件的完整教程

    答案:导出VSCode项目可通过手动压缩、终端命令、插件或Git克隆实现,推荐使用终端命令排除node_modules并选择zip格式以兼顾兼容性与效率。 将VSCode整个项目导出,实际上就是将项目文件夹打包成一个压缩文件,方便备份、分享或迁移。下面介绍几种常见的打包导出方法。 解决方案: 手动压…

    2026年9月21日
    000
  • MySQL如何实现数据的实时备份_有哪些高效工具和方法?

    mysql 实时备份主要依赖主从复制、二进制日志(binlog)配合增量备份,以及借助专业工具实现自动化监控与恢复。一、主从复制通过将主库数据变更同步到从库实现“准实时”备份,但存在延迟风险,建议开启 gtid 模式提升一致性;二、结合 binlog 与定时归档实现可回溯的增量备份,配合全量备份可恢…

    2026年9月21日
    000
  • SpringBoot的定时任务

    SpringBoot的定时任务SpringBoot的定时任务SpringBoot的定时任务SpringBoot的定时任务

    大家好,我是你们的老朋友全栈君。我们又见面了。 一、基于注解(@Scheduled)的定时任务 使用SpringBoot的@Scheduled注解来创建定时任务非常简单,只需几行代码就能实现。然而,@Scheduled默认是单线程运行,这意味着当启动多个任务时,一个任务的执行时间可能会影响到下一个任…

    2026年9月21日 • 用户投稿
    400
  • 百度网盘官方网页登录 百度网盘网页版入口快捷

    百度网盘官方网页登录入口是https://pan.baidu.com,用户可直接访问该网址登录账号,主界面布局清晰,支持文件上传下载、智能检索、跨设备同步及在线预览等功能。 百度网盘官方网页登录入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来百度网盘网页版入口快捷方式,感兴趣的网友一起…

    2026年9月21日
    100
  • MAC系统磁盘空间不足怎么办_Mac磁盘空间清理与管理技巧

    Mac存储空间不足时,应先使用系统自带的存储管理工具分析并优化存储,通过“关于本机”进入“管理”界面,启用优化选项;接着手动删除不常用应用及其在Application Support和Caches中的残留文件;再进入资源库清理Caches和Logs中的缓存与日志;随后在“避免杂乱”中查找并删除大型无…

    2026年9月21日
    000
  • DALL-E的AI混合工具如何使用?生成创意图像的详细操作教程

    DALL-E的AI混合工具能将两张图片融合生成新图像,操作简单且支持权重调整与后期编辑,适用于创意激发与艺术探索。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ DALL-E的AI混合工具,简单来说,就是把两张图“缝合”在一起,让AI帮你生…

    2026年9月21日
    000
  • 实现搜索结果的 A-Z 排序:PHP 教程

    本文档旨在指导开发者如何在 PHP 中实现搜索结果的 A-Z 排序功能。通过结合 AJAX 技术和 PHP 函数,可以方便地对通过 POST 方法获取的医生搜索结果进行 A-Z 排序,从而优化用户浏览体验。本文将详细介绍实现步骤,提供可复用的代码示例,并着重强调注意事项,旨在帮助开发者快速掌握并应用…

    2026年9月21日
    000
  • MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南

    MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南

    mysql原生全文搜索功能存在明显局限,需结合外部搜索引擎才能满足复杂需求。1. mysql全文搜索适用于小数据量、简单查询场景,但分词能力弱,尤其对中文支持差,查询功能有限,无法实现模糊查询、纠错等高级功能,且性能随数据量增长显著下降。2. 外部搜索引擎如elasticsearch(es)和sph…

    2026年9月21日 • 用户投稿
    000
  • Android应用中实现游戏循环与UI更新的正确姿势

    本文旨在解决Android应用开发中,开发者尝试使用传统游戏循环(如while(running))导致应用无响应或崩溃的问题。核心内容是阐明Android事件驱动的UI模型,指导开发者如何正确初始化UI组件、设置事件监听器,并通过事件回调机制实现逻辑更新和UI刷新,避免阻塞主线程,确保应用的流畅运行…

    2026年9月21日
    700
  • bilibili客户端如何开启省流量模式_bilibili客户端省流量功能的设置指南

    首先调整默认视频清晰度至“流畅”或“480P”,再开启省流播放模式以优化数据传输,最后关闭自动缓存与预加载功能,从而有效降低B站移动数据消耗。 如果您在使用移动数据网络观看B站视频时发现流量消耗过快,可能是未开启针对性的省流量设置。通过调整客户端内的相关选项,可以有效降低数据使用量。以下是具体的操作…

    2026年9月21日
    000
  • google浏览器“请停用以开发者模式运行的扩展程序”怎么解决_google浏览器开发者模式扩展提示解决方法

    1、关闭开发者模式并移除手动扩展可消除警告;2、替换为官方商店版本扩展避免风险;3、修改注册表或组策略可永久屏蔽提示;4、使用命令行参数临时绕过检查。 如果您在使用Google Chrome浏览器时,看到“请停用以开发者模式运行的扩展程序”的警告提示,这通常是因为当前有通过非应用商店方式加载的扩展程…

    2026年9月21日
    900
  • 如何用AffinityPhoto导出AI生成图片?专业图像保存的详细指南

    答案:AI生成图片导出时,色彩管理确保跨设备色彩一致,避免印刷偏色。需根据用途选择sRGB(网页)或CMYK(印刷)色彩空间,结合DPI、格式和重采样设置优化输出。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Affinity Photo…

    2026年9月21日
    600
  • 蝴蝶号无人直播怎么赚钱?从引流到转化全拆解

    蝴蝶号无人直播要赚钱,核心在于内容策划与流量转化结合。1.内容为王,需优质且有吸引力,如风景、美食、宠物或商品展示;2.引流关键在平台规则运用,包括标题、标签、封面及定时开播;3.变现方式多样,如带货、知识付费、广告等,需与内容高度匹配;4.应对挑战需持续更新内容、多账号运营、增强互动感、防范技术与…

    2026年9月21日
    1000
  • AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!

    AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!

    10月14日最新消息,尽管NVIDIA显卡已普遍采用12V-2×6 16针供电接口,但AMD官方至今未将其纳入标准设计。目前仅有华擎、蓝宝石等少数厂商在非公版产品中尝试使用,而华硕也曾在R9700专业卡上应用过该接口。然而近期接连曝出接口烧毁事件,引发广泛关注。 首例问题出现在华擎的RX …

    2026年9月21日 • 用户投稿
    000
  • MAC的随航(Sidecar)功能怎么使用_MAC Sidecar功能使用教程

    首先确认设备兼容性,确保Mac和iPad满足硬件与系统要求,并登录同一Apple ID。接着开启Wi-Fi和蓝牙,使两设备处于同一网络。通过控制中心“显示器”选项选择iPad名称,无线连接即可建立;或使用数据线进行有线连接以获得更稳定体验。连接后可在“系统设置-显示器-随航”中配置扩展或镜像模式,启…

    2026年9月21日
    000

发表回复

登录后才能评论
关注微信