udio

  • 【AI达人特训营第三期】时频图分类项目

    【AI达人特训营第三期】时频图分类项目【AI达人特训营第三期】时频图分类项目【AI达人特训营第三期】时频图分类项目【AI达人特训营第三期】时频图分类项目

    本项目基于ResNet50,将其BottleneckBlock模块中conv2特征层的标准卷积替换为DCN可变性卷积,构建ResNet50-DCN模型,用于科大讯飞24类语音时序图谱分类。使用2143条训练样本、429条验证样本训练,90轮后验证集最高准确率79%,未深入调优,有提升空间,还包含数据…

    2025年11月6日 用户投稿
    000
  • Higgs Audio V2— 开源语音大模型,能模拟多人互动场景

    Higgs Audio V2— 开源语音大模型,能模拟多人互动场景Higgs Audio V2— 开源语音大模型,能模拟多人互动场景Higgs Audio V2— 开源语音大模型,能模拟多人互动场景Higgs Audio V2— 开源语音大模型,能模拟多人互动场景

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 豆包大模型 字节跳动自主研发的一系列大型语言模型 834 查看详情 Higgs Audio V2是什么 higgs audio v2 是由李沐及其领导的 boson ai 团队推出的一款开源语音…

    2025年11月6日 用户投稿
    100
  • 【AI达人特训营第三期】Conv2Former:一种ViT风格的卷积模块

    【AI达人特训营第三期】Conv2Former:一种ViT风格的卷积模块【AI达人特训营第三期】Conv2Former:一种ViT风格的卷积模块【AI达人特训营第三期】Conv2Former:一种ViT风格的卷积模块【AI达人特训营第三期】Conv2Former:一种ViT风格的卷积模块

    本文复现了Conv2Former模型,其采用Transformer风格的QKV结构,以卷积生成权重加权,平衡全局信息提取与计算开销。在CIFAR-10数据集上,用Conv2Former-N参数({64,128,256,512}维度,{2,2,8,2}深度)训练50个epoch,验证集准确率达82%,…

    2025年11月6日 用户投稿
    200
  • 情人节:借助二次元老婆研究特征解耦

    情人节:借助二次元老婆研究特征解耦情人节:借助二次元老婆研究特征解耦情人节:借助二次元老婆研究特征解耦情人节:借助二次元老婆研究特征解耦

    本项目旨在实现二次元头像的特征解耦,让B头像风格影响A头像主体且保持A大体不变。采用Konachan动漫头像数据集,基于SPADE架构,A为内容主体,B为风格。通过Encoder-Decoder提取特征,利用KLDLoss、VGG损失等训练,使生成图融合A主体与B风格,测试显示能体现特征影响差异。 …

    2025年11月6日 用户投稿
    200
  • 【论文复现】 MnasNet复现以及一些感想

    【论文复现】 MnasNet复现以及一些感想【论文复现】 MnasNet复现以及一些感想【论文复现】 MnasNet复现以及一些感想【论文复现】 MnasNet复现以及一些感想

    本文围绕MnasNet复现展开,介绍了这一谷歌提出的轻量化网络,其通过自动搜索平衡精度与延迟,采用真实手机环境测延迟。复现基于PyTorch实现转为Paddle版本,调整了因硬件限制的参数,采用预热策略等,还提及训练中遇到的精度提升问题及解决办法,最后分享了复现收获。 ☞☞☞AI 智能聊天, 问答助…

    2025年11月6日 用户投稿
    1000
  • 使用pyecharts做自己的visualDL

    使用pyecharts做自己的visualDL使用pyecharts做自己的visualDL使用pyecharts做自己的visualDL使用pyecharts做自己的visualDL

    本文介绍用pyecharts构建类似visualDL的实时可视化工具,监控模型训练时的LOSS和ACC变化。先安装pyecharts,用paddle.vision的Cifar10数据集和mobilenet_v2模型,配置训练参数与优化器,定义折线图和仪表盘可视化函数,通过定期刷新本地HTML实现实时…

    2025年11月6日 用户投稿
    500
  • 【PaddlePaddle】基础理论教程 – 卷积神经网络概论

    本文围绕二维卷积及卷积神经网络展开,先讲解二维卷积运算的概念、原理及Paddle框架实现,介绍卷积算子的定义、参数。还阐述卷积神经网络的卷积层、汇聚层算子,最后以LeNet为例,说明其在手写体数字识别任务中的数据集构建、模型构建、训练、评价与预测过程。 ☞☞☞AI 智能聊天, 问答助手, AI 智能…

    2025年11月6日
    400
  • 【论文复现赛第六期-语义分割】CCNet

    【论文复现赛第六期-语义分割】CCNet【论文复现赛第六期-语义分割】CCNet【论文复现赛第六期-语义分割】CCNet【论文复现赛第六期-语义分割】CCNet

    本文复现了CCNet语义分割模型,其核心为Criss-Cross Attention模块,通过循环操作让像素建立联系以获取丰富语义。使用PaddleSeg复现,采用ResNet101骨干网,在Cityscapes验证集上mIoU达80.95%,已合入PaddleSeg,还提供了训练、验证等流程及复现…

    2025年11月6日 用户投稿
    000
  • 【PaddleHub模型贡献】一行代码实现蛇种识别

    【PaddleHub模型贡献】一行代码实现蛇种识别【PaddleHub模型贡献】一行代码实现蛇种识别【PaddleHub模型贡献】一行代码实现蛇种识别【PaddleHub模型贡献】一行代码实现蛇种识别

    该内容围绕蛇类识别模型展开,先安装PaddleX,解压数据集并划分,设置GPU后进行图像预处理与增强,定义数据迭代器,用ResNet50_vd_ssld模型训练,接着导出并转换模型为PaddleHub模块,测试单张和多张图片识别效果,最后介绍在GitHub提pr的步骤。 ☞☞☞AI 智能聊天, 问答…

    2025年11月6日 用户投稿
    000
  • 【AI达人创造营】菜市场常见鱼类分类从0到PaddleLite部署

    【AI达人创造营】菜市场常见鱼类分类从0到PaddleLite部署【AI达人创造营】菜市场常见鱼类分类从0到PaddleLite部署【AI达人创造营】菜市场常见鱼类分类从0到PaddleLite部署【AI达人创造营】菜市场常见鱼类分类从0到PaddleLite部署

    本项目针对30种菜市场常见鱼类,收集1917张图片构建数据集,用MobileNetV2模型训练分类模型,经35轮训练后保存模型。通过Paddle-Lite将模型转为.nb文件,在Android Studio中配置环境,基于Paddle-Lite-Demo修改相关文件实现安卓部署,可通过拍照或相册图片…

    2025年11月6日 用户投稿
    000
关注微信