Pika放大招：今天起，视频和音效可以“一锅出”了！

程序猿 • 2025年11月11日 05:57:58 • 科技 • 阅读 1

就在刚刚，Pika发布了一项新功能：

很抱歉我们之前一直处于静音状态。

今天起，大家可以给视频无缝生成音效了——Sound Effects！

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

生成的方式有两种：

要么给一句Prompt，描述你想要的声音；要么直接让Pika根据视频内容自动生成。

并且Pika非常自信地说到：“如果你觉得音效听起来很棒，那是因为它确实如此”。

车鸣声、广播声、鹰叫声、刀剑声、欢呼声……可谓是声声不息，并且从效果上来看，也是高度与视频画面匹配。

不仅是发布的宣传片，Pika官网现在也放出了多个demo。

例如无需任何prompt，AI只是看了眼烤培根的视频，便可以配出毫无违和感的音效。

再如给一句prompt：

Super saturated color, fireworks over a field at sunset.
超饱和色彩，日落时田野上的烟火。

Pika便可以在生成视频的同时配上声音，从效果中不难看出，烟花绽放的瞬间，声音卡点也是相当的精准。

大周末的发布这样一个新功能，网友们在高呼Pika“够卷、够Awesome”的同时，也有人认为：

它正在为多模态AI创作收集所有的“无限宝石”。

那么Pika的Sound Effects具体要如何操作，我们继续往下看。

给视频“make some noise”

Pika给视频生成音效的操作也是极！其！简！单！

例如只需一句prompt，视频和音效就能“一锅出”：

Mdieval trumpet player.
中世纪小号手。

相比于此前生成视频的操作，现在只需开启下方“Sound effects”按钮即可。

第二种操作方式，就是在生成了视频过后，可以单独给它配音。

例如在下面这个视频，点击下方的“Edit”，再选择“Sound Effects”：

然后可以描述一下自己想要的声音，例如：

Race car revving its engine.
赛车正在发动引擎。

然后短短几秒后，Pika就可以根据描述和视频生成音效，而且还是6种声音可选的那种！

值得一提的是，Sound Effects功能目前只对超级合作者（Super Collaborator）和Pro用户开放测试。

不过Pika也表示：“我们很快就会向所有用户推出该功能！”

然后现在已经有一批网友在开始测试这个Beta版本了，并且表示：

音效听起来和视频很相配，而且增加了很多气氛。

什么原理？

至于Sound Effects背后的原理，虽然Pika此次并没有公开，但在此前Sora大火之后，语音初创公司ElevenLabs就出过类似的配音功能。

当时，英伟达高级科学家Jim Fan就对此做过较为深入的分析。

他认为，AI学习准确的视频到音频映射还需要对潜在空间中的一些“隐式”物理进行建模。

他详细说明了端到端Transformer在模拟声波时需要解决的问题：

识别每个物体的类别、材料和空间位置。识别物体间的高阶互动：例如，是木棍、金属或是鼓面？以什么速度击打？识别环境：是餐厅、空间站、还是黄石公园？从模型的内部记忆中检索物体和环境的典型声音模式。使用“软性”的、通过学习得到的物理规则来组合和调整声音模式的参数，甚至即时创造全新的声音。这有点像游戏引擎中的“程序化音频”。如果场景很复杂，模型需要根据物体的空间位置叠加多个声音轨道。

所有这些都不是显式的模块，而是通过大量的（视频，音频）对的梯度下降学习来实现的，这些视频和音频对在大多数互联网视频中自然地时间对齐。注意力层将在它们的权重中实现这些算法，以满足扩散目标。

除此之外，Jim Fan当时表示英伟达的相关工作并没有这样高质量的AI音频引擎，不过他推荐了一篇MIT五年前的论文The Sound of Pixels：

感兴趣的小伙伴可以戳文末链接详细了解一下。

One More Thing

在多模态这件事上，LeCun在最新访谈中的观点也很火爆，他认为：

语言（文本）是低宽带的：小于12字节/秒。现代LLM通常使用1×10^13个双字节标记（即 2×10^13 字节）进行训练。一个人阅读大约需要 100000 年（每天 12 小时）。

视觉的带宽要高得多：约20MB/s。两条视神经中的每一条都有 100 万根神经纤维，每根神经纤维每秒携带约10个字节。一个4岁的孩子在清醒状态下大约是16000小时，换算成字节大约是1×10^15。

视觉感知的数据带宽大约是文本语言数据带宽的1600万倍。

一个4岁孩子看到的数据，是互联网上公开的所有文本训练的最大LLM数据的50倍。

因此，LeCun总结到：

如果不让机器从高带宽的感官输入（如视觉）中学习，我们绝对不可能达到人类水平的人工智能。

那么，你赞成这种观点吗？

以上就是Pika放大招：今天起，视频和音效可以“一锅出”了！的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/619689.html

pika sora 人工智能机器学习

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

告别繁琐的手动调参，Optuna助您轻松实现超参数优化！

上一篇 2025年11月11日 05:57:47

LeCun最新专访：为什么物理世界终将成为LLM的「死穴」？

下一篇 2025年11月11日 05:58:10

好文分享

html搜索框如何跳转_实现HTML搜索框跳转搜索结果【结果】

HTML搜索框跳转失败多因表单action或参数错误，可通过五种方法解决：一、百度用form提交至https://www.baidu.com/s?q=关键词；二、Google类似，action为https://www.google.com/search；三、JavaScript拼接必应URL并loc…

程序猿
2025年12月23日
2000
好文分享

从OpenAI API JSON响应中高效提取生成文本内容

本教程详细指导开发者如何从openai api返回的json格式响应中准确提取生成的文本。通过利用`json.parse()`方法解析响应字符串，并访问`choices[0].text`属性，可以安全、高效地获取核心文本内容，从而避免直接字符串操作的潜在问题，确保api数据处理的健壮性。 OpenA…

程序猿
2025年12月23日
0000
好文分享

HTML语义化未来趋势有哪些_HTML语义化在Web发展中的趋势与展望

HTML语义化正朝着智能、高效、包容发展，深度融合结构化数据与ARIA属性，提升机器理解；2. 组件化趋势推动可复用语义结构普及，Web Components实现自定义语义标签；3. 语义化助力性能优化与可访问性，支持懒加载与内容优先级划分；4. AI工具将自动生成语义化代码并辅助检测，降低实践门槛…

程序猿
2025年12月23日
0000
好文分享

HTML数据如何用于机器学习 HTML数据预处理的特征工程方法

首先解析HTML提取文本与元信息，再从结构、文本、样式三方面构建特征：1. 用BeautifulSoup等工具解析HTML，提取标题、正文、链接及属性；2. 统计标签频率、DOM深度、路径模式等结构特征；3. 清洗文本并采用TF-IDF或词嵌入向量化；4. 提取class、id、样式、脚本等交互与视…

程序猿
2025年12月23日
0000
好文分享

HTML数据如何实现数据智能 HTML数据智能分析的技术架构

实现HTML数据智能分析需构建包含采集、解析、存储、分析与可视化的闭环系统，首先通过爬虫技术获取网页数据并进行清洗标准化，接着利用DOM树分析与NLP技术提取结构化信息，随后将数据存入合适数据库或数据仓库并建立元数据管理机制，进而应用AI模型开展分类、情感分析、趋势预测与知识图谱构建等智能分析，最终…

程序猿
2025年12月23日
0000
好文分享

HTML5 section怎么用_HTML5内容分区标签应用场景说明

在HTML5中，标签用于定义文档中具有明确主题的独立内容区块，需包含标题以体现其结构性与语义性，常用于文章章节、产品模块等场景，区别于无语义的和可独立分发的。在HTML5中，section 标签用于定义文档中的一个独立内容区块。它不是简单的容器，而是有语义的结构化标签，表示文档中一个主题性的分区，…

程序猿
2025年12月23日
0000
好文分享

htm算法前景如何_分析HTM算法应用前景

HTM算法在实时异常检测、预测性维护等时序数据场景中具备应用价值，其无需大量标注数据的特性适合工业监控、网络安防等领域；但受限于生态薄弱、性能不及主流模型及工程实现难度，短期内难以成为主流，更可能作为边缘计算或AI系统补充技术，在特定专业领域持续发展。 HTM（Hierarchical Tempor…

程序猿
2025年12月23日
0000
好文分享

HTML结构化数据怎么添加_Schema标记添加教程

Schema标记通过结构化数据帮助搜索引擎理解网页内容，提升搜索结果展示效果，如添加星级评分、价格等富文本信息。使用JSON-LD或Microdata格式将符合Schema.org标准的类型（如Article、Product）嵌入HTML中，可增强SEO，需通过Google Rich Results…

程序猿
2025年12月22日
0000
好文分享

如何实现自定义提示

掌握自定义提示需构建迭代工作流，通过明确目标、设定角色、提供上下文、结构化输出、示例引导、迭代优化、负面提示和链式思考，实现AI输出的精准控制与高效协同。实现自定义提示，核心在于理解与AI模型交互的本质，并将其从“提问”升级为“引导”。它不是简单的抛出问题，而是通过精心设计的语言结构、上下文信息、…

程序猿
2025年12月22日
0000
好文分享

标题标签：你想知道的一切

html，用于构建网页的语言，严重依赖于标头标签。它们用于排列和组织网页内容，使其更易于阅读和理解。标题标签范围从 h1 到 h6。 h1 是最重要的标题标签，而 h6 是最不重要的。这些标题标签有助于组织页面的内容，使其更易于阅读和导航。它们还用于告知用户和搜索引擎有关页面内容的信息，这对于 se…

程序猿
2025年12月21日
0000
好文分享

JavaScript机器学习与人工智能库应用

JavaScript在AI领域应用扩展，依托TensorFlow.js实现浏览器内模型推理与训练，利用WebGL加速；ML5.js提供高层接口，简化图像识别、风格迁移等功能调用；Brain.js支持轻量级神经网络开发，适用于前端智能场景如实时检测、自动补全等，虽性能不及Python，但在交互式轻量应…

程序猿
2025年12月20日
1000
好文分享

LangChain HNSWLib 向量存储机制与数据持久化指南

本文详细解析langchain中hnswlib向量存储的工作原理，明确其作为内存存储的特性，指出数据实际存储在项目部署的服务器上，而非langchain官方服务器。同时，文章将指导如何通过save_local()方法将内存中的向量数据持久化到本地文件，确保数据安全与可靠性，并探讨在实际应用中的注意事…

程序猿
2025年12月20日
0000
好文分享

使用LINE Bot与OpenAI API发送文本和贴图的完整教程

本文详细介绍了如何在LINE Bot中集成OpenAI API生成文本回复，并在此基础上发送LINE贴图。核心挑战在于LINE Messaging API的replyToken通常只能使用一次，导致连续发送文本和贴图时出现400错误。解决方案是利用API支持一次性发送多条消息的特性，将文本和贴图消息…

程序猿
2025年12月20日
0000
好文分享

如何用机器学习算法优化前端用户交互体验？

通过机器学习分析用户行为数据，可实现前端交互的个性化与自适应优化。1. 利用LSTM、XGBoost等模型预测用户操作，实现智能补全与实时推荐；2. 借助强化学习与聚类算法动态调整UI布局，提升操作效率；3. 使用孤立森林等无监督方法检测异常交互，优化流程设计；4. 通过时序模型预测页面跳转，结合S…

程序猿
2025年12月20日
0000
好文分享

C++机器学习入门线性回归实现示例

首先实现线性回归模型，通过梯度下降最小化均方误差，代码包含数据准备、训练和预测，最终参数接近真实关系，适用于高性能场景。想用C++实现线性回归，其实并不复杂。虽然Python在机器学习领域更常见，但C++凭借其高性能，在对效率要求高的场景中非常适用。下面是一个简单的线性回归实现示例，帮助你入门C+…

程序猿
2025年12月18日
0000
C++中如何构建机器学习框架_张量运算实现

要构建高效的c++++机器学习框架张量运算模块，需遵循以下核心步骤：1. 设计支持泛型的tensor类，包含内存管理与基础接口；2. 实现运算符重载以简化加减乘除操作；3. 采用simd、多线程及缓存优化提升性能；4. 使用openmp实现并行化加法；5. 利用strassen或winograd算法…

程序猿
2025年12月18日 • 好文分享
0000
怎样在C++中实现决策树_机器学习算法实现

决策树在c++++中的实现核心在于通过递归构建树节点，使用“如果…那么…”逻辑进行数据分裂，最终实现分类或预测。1. 数据结构方面，定义包含特征索引、分裂阈值、左右子节点、叶子节点值及是否为叶子的treenode结构；2. 分裂准则包括信息增益（id3）、信息增益率（c4.5）和基尼指数（cart）…

程序猿
2025年12月18日 • 好文分享
0000
好文分享

C语言数据结构：数据结构在人工智能中的关键作用

C 语言数据结构：数据结构在人工智能中的关键作用概述在人工智能领域，数据结构对于处理大量数据至关重要。数据结构提供了一种组织和管理数据的有效方法，优化算法和提高程序的效率。常见的数据结构立即学习“C语言免费学习笔记（深入）”； C 语言中常用的数据结构包括：数组：一组连续存储的数据项，具有…

程序猿
2025年12月18日
0000
好文分享

C语言算法问答集：将算法应用于人工智能

搜索算法：二分查找，高效地在数组中查找元素。排序算法：快速排序，将数据序列按特定顺序排列。图形算法：dijkstra 算法，寻找两个节点间最短路径。机器学习算法：线性回归，训练模型对数据进行预测。 C 语言算法问答集：将算法应用于人工智能前言算法在人工智能（AI）中扮演着至关重要的角色，可为 A…

程序猿
2025年12月18日
0000
好文分享

人工智能如何提升 C 代码安全性检查

答案：人工智能（ai）通过数据流分析、启发式检测和代码重构建议等方式提升了 c 代码安全性检查的效率。数据流分析：识别数据流并发现安全漏洞，如缓冲区溢出。启发式检测：学习已知漏洞模式并识别类似模式。代码重构建议：提供将不安全代码转换为安全替代方案的建议。人工智能提升 C 代码安全性检查简介C 语…

程序猿
2025年12月18日
0000

发表回复

登录后才能评论