udio
-
通义千问再开源,Qwen1.5带来六种体量模型,性能超越GPT3.5



赶在春节前,通义千问大模型(qwen)的 1.5 版上线了。今天上午,新版本的消息引发了 ai 社区关注。 新版大模型包括六个型号尺寸:0.5B、1.8B、4B、7B、14B和72B。其中,最强版本的性能超越了GPT 3.5和Mistral-Medium。该版本包含Base模型和Chat模型,并提供…
-
谷歌Gemini1.5火速上线:MoE架构,100万上下文



今天,谷歌宣布推出 gemini 1.5。 Gemini 1.5是在谷歌基础模型和基础设施的研究与工程创新基础上开发的。这个版本引入了新的专家混合(MoE)架构,以提高Gemini 1.5的训练和服务的效率。 谷歌推出的是用于早期测试的Gemini 1.5的第一个版本,即Gemini 1.5 Pro…
-
鸿蒙+星闪:一场“1+1>2”的音频蝶变



☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 西方最伟大的著作《荷马史诗》,是游吟诗人荷马“吟”出来的;古老的东方,佛陀传法总以“谛听!谛听!当为汝说”开场,让大家认真听讲。 听觉,是人类最主要的审美来源和信息获取通道之一,但不知从何时起,…
-
谷歌发布“Vlogger”模型:单张图片生成10秒视频



谷歌发布了一个新的视频框架: 只需要一张你的头像、一段讲话录音,就能得到一个本人栩栩如生的演讲视频。 视频时长可变,目前看到的示例最高为10s。 可以看到,无论是口型还是面部表情,它都非常自然。 如果输入图像囊括整个上半身,它也能配合丰富的手势: ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索,…
-
揭开大型语言模型(LLM)的力量:初创企业如何通过精简集成彻底改变运营方式



大型语言模型 (LLM) 已成为各种规模企业的游戏规则改变者,但它们对初创企业的影响尤为显著。为了理解其中的原因,让我们来看看初创企业相对于老牌企业有哪些优势,以及为什么AI是它们的重要推动力。首先,与传统企业相比,初创企业有更大的灵活性。它们通常没有过多的层级和繁琐的决策程序,可以更迅速地适应市场…
-
颜水成挂帅,昆仑万维2050全球研究院联合NUS、NTU发布Vitron,奠定通用视觉多模态大模型终极形态



近日,由颜水成教授带队,昆仑万维2050全球研究院、新加坡国立大学、新加坡南洋理工大学团队联合发布并开源了vitron通用像素级视觉多模态大语言模型。 这是一款重磅的通用视觉多模态大模型,支持从视觉理解到视觉生成、从低层次到高层次的一系列视觉任务,解决了困扰大语言模型产业已久的图像/视频模型割裂问题…
-
闭源赶超GPT-4 Turbo、开源击败Llama-3-70B,歪果仁:这中国大模型真香



在发布一周年之际,阿里云通义千问大模型在闭源和开源领域都交上了一份满意的答卷。 国内的开发者们或许没有想到,有朝一日,他们开发的 AI 大模型会像出海的网文、短剧一样,让世界各地的网友坐等更新。甚至,来自韩国的网友已经开始反思:为什么我们就没有这样的模型? 这个「别人家的孩子」就是阿里云的通义千问(…
-
用 Deepseek 满血版和 Descript Audio,编辑专业音频作品



用 deepseek 满血版 + descript audio 组合可实现专业级音频后期处理。1. 先通过 whisper 生成字幕文本,再由 deepseek 整理成通顺文稿,确保语音识别准确并辅助剪辑;2. 在 descript 中导入整理后的文字,自动对齐音频并实现“文本质感”编辑,支持划掉口…
-
基于paddlehub2.4.0: 让动态视频生成漫画书!【一键运行】



该项目基于PaddleHub2.4.0,实现动态视频转漫画书功能。以人民美术出版社版《水浒传》连环画为风格学习数据,借助其预训练模型,通过安装依赖、处理数据、图片转漫画、视频关键帧转漫画等步骤,抽取视频关键帧并转为漫画风格,为视频创作提供新形式,展现了AI在文化创意领域的潜力。 ☞☞☞AI 智能聊天…
-
【新手入门】检索篇 – RAG技术深度实战与优化
本文围绕RAG技术展开深度解析,介绍其基础原理,即结合信息检索与文本生成,解决大模型知识截止、深度不足等问题。还阐述核心组件,如文档加载器等,讲解文档分块策略、向量化与相似度计算,以及检索策略优化、系统集成、性能优化和实际应用案例等内容。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无…