udio
-
飞桨常规赛:PALM眼底彩照中黄斑中央凹定位-11月第1名方案
本文分享飞桨常规赛PALM眼底彩照黄斑中央凹定位11月第1名方案。介绍赛事与数据后,详述自定义数据集读取、新数据增强方法,给出具体实现代码,包括数据处理、模型组网、训练评估等,还提及结果投票集成,最后总结改善方向与飞桨使用建议。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 …
-
百度网盘AI大赛-文档检测优化赛第7名方案



该项目针对百度网盘AI大赛文档检测优化赛,采用回归方式处理,用Res2Net101_vd_26w_4s+注意力双分支Linear层结构回归文档四角坐标。经数据预处理、模型调优,对比不同backbone、损失函数等,发现注意力双支、L1Loss更优,最终模型在评测中表现良好。 ☞☞☞AI 智能聊天, …
-
美图影像节演讲实录:191次提及AI,发布7款影像生产力工具



6月19日,第二届美图影像节现场发布7款新品,围绕着“ai时代的影像生产力工具”主题,发布环节共191次提及ai关键词。 美图公司创始人、董事长兼首席执行官吴欣鸿回顾了近一年带领美图探索AI的心路历程,他认为工具价值将在AI时代迎来大爆发。 吴欣鸿表示,今天美图产品的工具属性已经发生变化。“在AI时…
-
美图发布国内首个“懂美学的”AI视觉大模型MiracleVision



美图于6月21日发布了国内首个“懂美学的”ai视觉大模型miraclevision。 此外,美图还发布ai视觉创作工具whee、ai口播视频工具开拍、桌面端ai视频编辑工具winkstudio、主打ai商业设计的美图设计室2.0、ai数字人生成工具dreamavatar、美图ai助手roboneo等…
-
美图秀秀发布7款AI产品:支持用户创作、商业创作



2023-06-25 14:19:19 作者:孟令曦 近日,美图秀秀举办了一场以“AI 时代的影像生产力工具”为主题的影像节,发布了涵盖普通用户和商业用户方向的7款AI产品。 普通用户方向的产品包括AI视觉创作工具WHEE、AI口播视频工具开拍和桌面端AI视频编辑工具WinkStudio。其中,WH…
-
基于PaddleOCR的FCENet复现



本文介绍基于PaddleOCR复现CVPR2021论文提出的FCENet文本检测算法。该算法用傅里叶变换建模任意形状文本框,采用ResNet+FPN架构,含分类和回归分支。文中说明CTW1500数据集情况,复现精度达Hmean 0.854,还介绍了AI Studio在线运行、训推一体流程及本地运行方…
-
中国最强AI研究院的大模型为何迟到了



☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 出品|虎嗅科技组 作者|齐健 编辑|陈伊凡 头图|FlagStudio “OpenAI会再开源大模型吗?” 当智源研究院理事长张宏江向线上参加2023年智源大会的OpenAI首席执行官Sam A…
-
AdaptSegNet:学习调整结构化输出空间进行语义分割
本文介绍AdaptSegNet的PaddlePaddle实现,该方法将语义分割从合成数据集(如GTA5)适配到真实数据集(如Cityscapes)。给出了复现指标、训练过程,说明数据集下载与目录结构,提供预训练模型链接,还详述了测试和训练的启动方式及相关参数,展示了模型在真实图片上的分割效果。 ☞☞…
-
【第十五届中国计算机设计大赛】智慧导盲组,手把手教你超越0.8



本文介绍了基于PaddleDetection的目标检测项目流程,包括克隆仓库、安装依赖、编译安装等步骤。还涵盖数据集准备,如查看COCO标注、解压和配置数据集,以及模型训练、预测、导出,最后说明代码提交及优化方法,如调整阈值等。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 …
-
谷歌AudioPaLM实现「文本+音频」双模态解决,说听两用大模型



大型语言模型以其强大的性能及通用性,带动了一批多模态的大模型开发,如音频、视频等。 语言模型的底层架构大多是基于Transformer,且以解码器为主,所以无需过多调整模型架构即可适应其他序列模态。 最近,谷歌发布了一个统一的语音-文本模型AudioPaLM,将文本和音频的token合并为一个多模态…