Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
解决ONNX与TensorRT并行运行时CUDA资源冲突的指南_创想鸟

解决ONNX与TensorRT并行运行时CUDA资源冲突的指南

解决ONNX与TensorRT并行运行时CUDA资源冲突的指南

本文旨在解决在同一Python应用中同时使用ONNX Runtime的CUDA执行提供者和TensorRT时可能遇到的“无效资源句柄”CUDA错误。该错误通常源于PyCUDA自动初始化与TensorRT或其他CUDA库的上下文管理冲突。本教程将详细解释错误原因,并提供通过手动管理CUDA上下文来解决此问题的专业方法,确保两种推理引擎的稳定协同工作。

1. 问题背景与错误分析

在深度学习推理场景中,为了最大化性能,开发者常常需要集成不同的推理引擎。onnx runtime以其灵活性支持多种硬件后端,而nvidia tensorrt则专为nvidia gpu提供极致优化。当尝试在同一个python进程中同时加载并运行onnx runtime(配置为使用cudaexecutionprovider)和tensorrt模型时,可能会遇到以下cuda运行时错误:

[TRT] [E] 1: [convolutionRunner.cpp::execute::391] Error Code 1: Cask (Cask convolution execution)[TRT] [E] 1: [checkMacros.cpp::catchCudaError::272] Error Code 1: Cuda Runtime (invalid resource handle)

这个错误通常表明CUDA上下文或资源管理存在冲突。pycuda.autoinit模块虽然方便,但在复杂的CUDA应用中,尤其是在与其他显式管理CUDA上下文的库(如TensorRT)结合使用时,可能会导致问题。pycuda.autoinit会在导入时自动创建一个默认的CUDA上下文。如果TensorRT或ONNX Runtime的CUDA提供者尝试在不同的方式下管理或创建自己的上下文,或者两者对同一个GPU资源的处理方式不兼容,就可能出现“无效资源句柄”的错误。当单独运行模型或将ONNX Runtime切换到CPUExecutionProvider时问题消失,进一步证实了这是CUDA资源管理层面的冲突。

2. 解决方案:手动CUDA上下文管理

解决此问题的核心在于放弃pycuda.autoinit的自动上下文创建,转而采用pycuda.driver进行手动、显式的CUDA上下文初始化和管理。这使得开发者能够更好地控制CUDA资源的生命周期,避免不同库之间的隐式冲突。

关键步骤:

移除 import pycuda.autoinit: 这是导致冲突的根源之一。手动初始化CUDA并创建上下文: 使用 pycuda.driver.cuda.init() 初始化CUDA驱动,然后选择一个设备并为其创建上下文。上下文的激活与释放: 确保在需要CUDA操作的代码块中激活正确的上下文,并在操作完成后将其弹出(pop)。对于整个应用程序生命周期都需要CUDA的场景,可以创建一个持久的上下文。

3. 示例代码:集成ONNX与TensorRT并解决CUDA冲突

以下是修正后的代码示例,展示了如何通过手动管理CUDA上下文来避免上述错误。

import cv2import numpy as npimport pycuda.driver as cudaimport tensorrt as trtimport onnximport onnxruntime# 解决Numpy版本兼容性问题np.bool = np.bool_# 假设profliing模块可用,否则需要移除或替换from profiling import GlobalProfTime, ProfTimer, mode_to_str# 1. 手动初始化CUDA并创建上下文# 移除 import pycuda.autoinitcuda.init()device = cuda.Device(0) # 选择第一个GPU设备ctx = device.make_context() # 创建CUDA上下文try:    with GlobalProfTime('profile_tensorrt_10_000images') as t:        with ProfTimer('TensorRT basic image profiler') as t:            # TensorRT code            # 加载TensorRT引擎            TRT_ENGINE_PATH = '/app/models/buffalo_l/det_10g640x640.engine'            # 创建运行时,并在创建引擎前激活PyCUDA上下文            # 注意:TensorRT内部会创建自己的CUDA context,但PyCUDA的上下文需要先存在            runtime = trt.Runtime(trt.Logger(trt.Logger.WARNING))            # 反序列化引擎            with open(TRT_ENGINE_PATH, 'rb') as f:                engine_data = f.read()                engine = runtime.deserialize_cuda_engine(engine_data)            assert engine is not None, "TensorRT engine deserialization failed."            # 创建执行上下文            context = engine.create_execution_context()            # 为输入输出分配内存            inputs, outputs, bindings, stream = [], [], [], cuda.Stream()            for binding in engine:                size = trt.volume(engine.get_binding_shape(binding)) * engine.max_batch_size                dtype = trt.nptype(engine.get_binding_dtype(binding))                host_mem = cuda.pagelocked_empty(size, dtype)                device_mem = cuda.mem_alloc(host_mem.nbytes)                bindings.append(int(device_mem))                if engine.binding_is_input(binding):                    inputs.append({'host': host_mem, 'device': device_mem, 'name': binding, 'shape': engine.get_binding_shape(binding), 'type': engine.get_binding_dtype(binding)})                else:                    outputs.append({'host': host_mem, 'device': device_mem, 'name': binding, 'shape': engine.get_binding_shape(binding), 'type': engine.get_binding_dtype(binding)})            # 加载并预处理输入图片            image_path = "/app/models/buffalo_l/image.png"            image = cv2.imread(image_path)            assert image is not None, f"Failed to load image from {image_path}"            image = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)            image = cv2.resize(image, (640, 640))            image = image.astype(np.float32) / 255.0            input_data = np.expand_dims(image.transpose(2, 0, 1), axis=0)            # ONNX code            onnx_model_path = "/app/models/buffalo_l/det_10g.onnx"            # onnx.load(onnx_model_path) # ONNX模型加载不是必须的,InferenceSession会自动加载            # 创建ONNX Runtime Session,指定CUDAExecutionProvider            ort_session = onnxruntime.InferenceSession(onnx_model_path, providers=['CUDAExecutionProvider'])            # TensorRT 推理循环            for _ in range(1):                with ProfTimer('TensorRT per call') as t:                    # 复制输入数据到GPU                    cuda.memcpy_htod_async(inputs[0]['device'], input_data.ravel(), stream)                    # 执行推理                    if context.execute_async(batch_size=1, bindings=bindings, stream_handle=stream.handle) == 0:                        print("Error: Unable to launch TensorRT inference.")                    # 将结果从GPU传回主机                    if cuda.memcpy_dtoh_async(outputs[0]['host'], outputs[0]['device'], stream) == 0:                        print("Error: Unable to copy results from GPU to host.")                    result = outputs[0]['host']                    # 同步流                    stream.synchronize()                    print("Inference TensorRT Results:")                    print(result[:20])            stream.synchronize() # 确保所有TensorRT操作完成            # ONNX 推理循环            for _ in range(1):                with ProfTimer('ONNX(CUDA) per call') as t:                    # 重新加载和预处理图像(如果需要,或使用TensorRT已加载的)                    image_path = "/app/models/buffalo_l/image.png"                    image = cv2.imread(image_path)                    assert image is not None, f"Failed to load image from {image_path}"                    image = cv2.cvtColor(image, cv2.COLOR_BGR2RGB)                    image = cv2.resize(image, (640, 640))                    image = image.astype(np.float32) / 255.0                    input_data_onnx = np.expand_dims(image.transpose(2, 0, 1), axis=0) # 使用独立的变量名避免混淆                    # 运行ONNX推理                    input_name = ort_session.get_inputs()[0].name                    outputs_onnx = ort_session.run(None, {input_name: input_data_onnx})                    print("Inference ONNX Results:")                    print(f"{np.transpose(outputs_onnx[0][:20])}")finally:    # 2. 在程序结束或不再需要CUDA时,显式释放上下文    # 这一步非常重要,确保资源被正确清理,避免潜在的内存泄漏或冲突    if ctx:        ctx.pop()        ctx.detach() # 从当前线程分离上下文

4. 注意事项与最佳实践

CUDA上下文的唯一性: 通常情况下,一个进程应尽量维护一个主CUDA上下文,并让所有CUDA相关的库(如PyCUDA、TensorRT、PyTorch等)在该上下文上操作。手动创建上下文并确保其在整个应用程序生命周期内有效,有助于协调不同库的CUDA操作。资源清理: 务必在应用程序退出前或不再需要CUDA资源时,显式地弹出并分离PyCUDA上下文(ctx.pop() 和 ctx.detach())。这有助于释放GPU内存和资源,避免资源泄漏。错误处理: 在CUDA操作中加入适当的错误检查(如示例中的assert和if context.execute_async(…) == 0)是良好的编程习惯,有助于快速定位问题。PyCUDA版本: 确保PyCUDA、CUDA Toolkit和GPU驱动版本兼容。版本不匹配也可能导致运行时错误。TensorRT与ONNX Runtime的兼容性: 尽管本文解决了CUDA上下文冲突,但仍需确保所使用的TensorRT版本与ONNX Runtime的CUDA提供者版本对ONNX模型格式的支持是兼容的。

5. 总结

在Python中集成多个依赖于CUDA的深度学习推理库(如ONNX Runtime和TensorRT)时,CUDA上下文管理是常见的挑战。通过从pycuda.autoinit转向pycuda.driver进行手动上下文初始化和管理,开发者可以有效地解决“无效资源句柄”等CUDA运行时错误。这种方法提供了对GPU资源更精细的控制,确保了不同推理引擎在共享CUDA环境下的稳定和高效运行。遵循本文提供的指南和最佳实践,将有助于构建更健壮、性能更优的AI应用。

以上就是解决ONNX与TensorRT并行运行时CUDA资源冲突的指南的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1366314.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python如何操作Redis?高效缓存技术指南
上一篇 2025年12月14日 05:05:44
如何使用Python构建注塑成型的产品缺陷分类?
下一篇 2025年12月14日 05:05:55

相关推荐

  • AdobePremierePro的AI混合工具怎么用?简化视频编辑的实用方法

    Adobe Premiere Pro的AI混合工具通过变形剪辑、重混音、自动重构图和颜色匹配等功能,显著提升剪辑效率。变形剪辑智能平滑跳剪,使转场更自然;重混音自动调整音乐长度,适配视频节奏;自动重构图利用AI跟踪主体,快速适配多平台比例;颜色匹配则快速统一多素材色彩基调。这些AI功能虽非万能,但在…

    2026年9月22日
    100
  • 爱应用pc版官方网址入口 爱应用pc版平台访问官网直达链接

    爱应用PC版官方网址是https://www.aiyingyong.com,该平台提供Win10应用推荐、游戏中心及软件下载服务,设有每日精品、分类合集、专题评测等功能板块,并支持用户互动交流与资源更新。 爱应用pc版官方网址入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来爱应用pc版…

    2026年9月22日
    000
  • MySQL执行时间分析与诊断_MySQL性能瓶颈精准定位

    MySQL执行时间分析与诊断_MySQL性能瓶颈精准定位MySQL执行时间分析与诊断_MySQL性能瓶颈精准定位MySQL执行时间分析与诊断_MySQL性能瓶颈精准定位MySQL执行时间分析与诊断_MySQL性能瓶颈精准定位

    mysql性能瓶颈定位与分析需从慢查询日志、执行计划、实时监控等多维度入手。1. 开启慢查询日志,设置slow_query_log=1、指定日志路径及阈值long_query_time,通过mysqldumpslow分析日志找出最慢sql;2. 使用explain命令查看sql执行计划,重点关注ty…

    2026年9月22日 • 用户投稿
    200
  • if sql语句_SQL IF语句介绍和概述

    if sql语句_SQL IF语句介绍和概述if sql语句_SQL IF语句介绍和概述if sql语句_SQL IF语句介绍和概述if sql语句_SQL IF语句介绍和概述

    大家好,又见面了,我是你们的朋友全栈君。 本文将深入探讨SQL Server中实用的SQL IF语句功能。 介绍 (Introduction) 在现实生活中,我们根据条件做出决定。例如,以下情况: 如果我今年获得绩效奖金,我将选择国际度假,否则我将选择国内度假。如果天气变好,我会计划骑自行车旅行,否…

    2026年9月22日 • 用户投稿
    000
  • VSCode连接Modelsim仿真工具(调试技巧分享,波形分析指南)

    首先确保Modelsim路径加入系统PATH,安装VSCode的HDL扩展,配置tasks.json定义编译、仿真任务,并编写Tcl脚本自动化add wave、run等操作,通过问题匹配器解析错误,利用Tcl实现参数化仿真与自动化测试,结合Makefile或脚本提升大型项目管理效率。 将VSCode…

    2026年9月22日
    400
  • Invideo的AI混合工具怎么用?快速生成专业视频的实用教程

    Invideo的AI混合工具通过智能生成视频初稿并允许创作者精细调整,显著降低制作门槛、提升效率,其优势在于快速生成、易用性强、激发创意,用户可通过优化输入、替换素材、注入个性声音和保持风格统一来最大化潜力,同时需应对素材模式化、理解偏差等挑战。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索,…

    2026年9月22日
    500
  • Java并发编程中Runnable接口使用方法

    Runnable接口用于定义线程任务,通过实现run()方法封装执行逻辑,不返回结果且不能抛出受检异常;可直接传给Thread实例启动线程,也可用Lambda表达式简化代码;推荐结合ExecutorService线程池使用,提升资源利用率;需注意无返回值、异常处理在内部完成、共享变量线程安全等问题。…

    2026年9月22日
    100
  • ChatExcel进行数据分类_ChatExcel数据自动分类与标签管理

    答案:通过内置规则、AI智能打标、多维度交叉分类及手动修正四步实现ChatExcel自动分类与标签管理。首先设定字段匹配规则自动归类数据;其次启用智能打标功能分析文本生成语义标签;再通过组合多个属性构建交叉分类矩阵实现精细化管理;最后支持人工干预修正异常项并同步更新数据库,提升分类准确性与管理效率。…

    2026年9月22日
    000
  • VSCode配置C++项目环境 新手必看VSCode搭建C++教程

    答案:在VSCode中配置C++环境需安装MinGW-w64编译器并将其路径加入系统环境变量,安装VSCode的C/C++扩展以支持代码补全和调试,通过tasks.json配置编译任务,指定g++路径及编译参数,再通过launch.json配置调试任务,设置gdb调试器路径和程序输出路径,确保头文件…

    2026年9月22日
    200
  • 如何使用DeepSpeed训练AI大模型?大规模模型训练的优化技巧

    DeepSpeed通过ZeRO等技术突破显存限制,实现大模型高效训练。它采用ZeRO-1/2/3分级优化,分别对优化器状态、梯度和参数进行分区,显著降低单卡显存占用;结合混合精度、梯度累积和CPU/NVMe卸载进一步节省资源。同时集成流水线并行与张量并行,支持多维并行策略协同,使万亿参数模型训练在普…

    2026年9月22日
    100
  • Sublime使用MySQL实现数据权限控制模块_根据用户角色限制访问范围

    Sublime使用MySQL实现数据权限控制模块_根据用户角色限制访问范围Sublime使用MySQL实现数据权限控制模块_根据用户角色限制访问范围Sublime使用MySQL实现数据权限控制模块_根据用户角色限制访问范围Sublime使用MySQL实现数据权限控制模块_根据用户角色限制访问范围

    在sublime中实现数据权限控制模块的核心在于根据用户角色动态拼接sql语句,具体步骤如下:1. 建立角色表、用户表和权限规则表,明确角色与数据的对应关系;2. 用户登录后获取其角色id,并查询该角色可访问的数据范围;3. 根据权限动态构建sql查询条件,限制访问范围;4. 使用python等语言…

    2026年9月22日 • 用户投稿
    200
  • PHP 表单验证:确保 HTML select 下拉菜单已正确选择非默认选项

    本文将详细介绍如何在 PHP 后端对 HTML select 下拉菜单进行有效验证,确保用户选择了非默认选项。我们将探讨常见的验证误区,并提供一个简洁高效的解决方案,通过检查 $_POST 数据来判断用户是否已做出有效选择,从而避免表单提交无效数据,提升用户体验和数据准确性。 在构建 web 表单时…

    2026年9月22日
    200
  • python 基准测试(cProfile kcachegrind line_profiler memory_profiler)

    learn from 《python高性能(第2版)》 类似工具:pycharm profile对函数调用效率进行测试 1. 例子 一个圆周运动的动画 代码语言:javascript代码运行次数:0运行复制 from matplotlib import pyplot as pltfrom matpl…

    2026年9月22日
    200
  • NvidiaCanvas的AI混合工具如何使用?创作智能画作的详细教程

    NVIDIA Canvas是一款基于AI的智能图像生成器,它将用户涂鸦的材质色块实时转化为逼真风景,核心在于语义理解与风格化合成。其工作流程包括选择材质笔刷、在输入画布绘制概念图、利用图层与风格预设快速迭代,并导出成果。相比传统绘画工具,Canvas优势在于高效生成、降低创作门槛、支持快速探索与创意…

    2026年9月22日
    300
  • VSCode安装C/C++开发环境 最新VSCode配置C语言教程详解

    答案:搭建VSCode的C/C++环境需安装编译器、C/C++扩展并配置项目文件。首先安装MinGW(Windows)、Clang(macOS)或GCC(Linux),配置环境变量并验证;然后在VSCode中安装Microsoft的C/C++扩展;最后创建.c_cpp_properties.json…

    2026年9月22日
    300
  • 在Java中如何通过Stream实现交集与差集

    交集可通过filter结合contains获取两集合共有元素,差集则保留一个集合中不在另一集合的元素,示例使用list1.stream().filter(list2::contains)得[3,4],filter(e->!list2.contains(e))得[1,2],建议将list2转为H…

    2026年9月22日
    100
  • Java Swing中按钮与文本框事件处理的实践指南

    本文将深入探讨Java Swing中ActionListener的正确使用方法,指导开发者如何为GUI按钮和文本框实现事件监听,从而处理用户输入、执行计算并实时更新界面。文章将重点讲解如何在actionPerformed方法中获取用户输入、进行类型转换、处理潜在异常,并提供一个完整的计算器示例来演示…

    2026年9月22日
    200
  • MySQL查询缓存配置及性能_MySQL重复查询响应速度提升

    MySQL查询缓存配置及性能_MySQL重复查询响应速度提升MySQL查询缓存配置及性能_MySQL重复查询响应速度提升MySQL查询缓存配置及性能_MySQL重复查询响应速度提升MySQL查询缓存配置及性能_MySQL重复查询响应速度提升

    mysql查询缓存已不适用于现代应用场景,尤其在8.0版本中被彻底移除。它仅适合读多写少、数据几乎不变的静态查询,通过内存直接返回结果提升性能;但在数据频繁更新时,因基于表级的缓存失效机制,每次写操作都会清空相关缓存,导致频繁重建缓存并消耗大量cpu资源,形成性能瓶颈。此外,sql语句匹配严格、内存…

    2026年9月22日 • 用户投稿
    500
  • Linux平台下的Eclipse配置

    在linux平台上配置eclipse时,可能会遇到一些常见的问题和优化需求。本文将详细介绍如何解决这些问题,并提供优化eclipse的建议。 启动Eclipse报错 启动Eclipse时,如果遇到以下错误: A Java Runtime Environment (JRE) or Java Devel…

    2026年9月22日
    000
  • 怎样在iPhone情侣模式中分享视频?快速上传和同步的实用方法

    怎样在iPhone情侣模式中分享视频?快速上传和同步的实用方法怎样在iPhone情侣模式中分享视频?快速上传和同步的实用方法怎样在iPhone情侣模式中分享视频?快速上传和同步的实用方法怎样在iPhone情侣模式中分享视频?快速上传和同步的实用方法

    最实用的方法是使用iCloud共享相簿,它支持情侣间视频快速上传与实时同步。首先双方需开启iCloud照片中的共享相簿功能,然后创建专属相簿并邀请对方加入。此后,任一方添加的视频会自动同步至对方设备,且不占用个人iCloud空间。相比AirDrop(限近距离)、即时通讯工具(压缩画质)或云盘(占存储…

    2026年9月22日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信