把Transformer当通用计算机用,还能执行in-context learning算法,这项研究脑洞大开

Transformer 已成为各种机器学习任务的热门选择,并且取得了很好的效果,那它还能怎么用?脑洞大开的研究者竟然想用它来设计可编程计算机!

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

这篇论文的作者来自普林斯顿大学和威斯康星大学,标题为《Looped Transformers as Programmable Computers》,旨在探索如何用 Transformer 来实现通用计算机。

具体来说,作者提出了一个将 transformer 网络用作通用计算机的框架,方法是使用特定权重对它们进行编程并将它们置于循环(loop)中。在这个框架中,输入序列充当穿孔卡片,由指令和用于数据读 / 写的内存组成。

作者证明了恒定数量的编码器层可以模拟基本计算块。使用这些构建块,他们模拟了一个小型指令集计算机。这使得他们能够将迭代算法映射到可以由循环的(looped)13 层 transformer 执行的程序。他们展示了这个 transformer 如何在其输入的指导下模拟一个基本的计算器、一个基本的线性代数库和使用反向传播的 in-context learning 算法。这项工作突出了注意力机制的多功能性,并证明即使是浅层 transformer 也可以执行成熟的通用程序。

论文概述

Transformer (TF) 已成为各种机器学习任务的热门选择,它在自然语言处理和计算机视觉等领域很多问题上取得了最先进的成果。Transformer 成功的一个关键原因是能够通过注意力机制捕捉 higher-order 关系和 long-range 依赖关系。这使得 TF 可以对上下文信息进行建模,并使其在机器翻译和语言建模等任务中更加有效,在这些任务中 Transformer 的表现一直优于其它方法。

GPT-3(175B 参数)和 PaLM(540B 参数)等具有上千亿参数的语言模型在许多自然语言处理任务上都取得了最先进的性能。有趣的是,这些大型语言模型 (LLM) 中的一些还可以执行 in-context learning (ICL) ,根据简短 prompt 和一些示例即时适应和执行特定任务。LLM 的 ICL 能力是在没有可以训练的情况下就具备,并允许这些大型模型有效地执行新任务而无需更新权重。

 令人惊讶的是,通过 ICL,LLM 可以执行算法任务和推理,并且 [Nye et al. [2021], Wei et al. [2022c], Lewkowycz et al. [2022], Wei et al. [2022b], Zhou et al. [2022]] 等人的工作已经证明其可行性。[Zhou et al. [2022] ] 等的工作证明,当给出多位加法算法和一些加法示例的 prompt 时,LLM 可以成功地对未知用例进行加法运算。这些结果表明,LLM 可以根据算法原理并在推理时对给定输入执行 pre-instructed 的命令,就好像将自然语言解释为代码一样。

 有证据表明,Transformer 可以模拟具有足够深度的图灵机或 Attention 层之间的递归链接 [Pérez et al. [2021], Pérez et al. [2019], Wei et al. [2022a]]。这证明了 Transformer 网络精确遵循输入指定的算法指令的潜力。然而,这些构造相对笼统,无法深入理解如何创建能够执行特定算法任务的 Transformer。

然而更专业的设计可以让 TF 执行更高级的程序。如 [Weiss et al. [2021]] 设计了一种计算模型和一种编程语言,可将简单的选择和聚合命令映射到索引输入 token。这种语言可用于创建多种有趣的算法,例如 token 计数、排序、创建直方图和识别 Dyck-k 语言。然后可以将用受限访问序列处理语言 (RASP) 编写的程序映射到 Transformer 网络中,Transformer 网络的大小通常会随着程序的大小而变化。

 另一项研究展示了选择 Transformer 模型权重的方法,以用作动态学习线性回归模型的优化算法,在给定训练数据作为输入时在推理时执行隐式训练。这些方法通常需要与学习算法的迭代次数成比例的层数,并且仅限于一个损失函数和模型集合。

对 Transformer 模型进行编程以模拟图灵机的抽象计算的能力、RASP 等语言的专用命令以及 ICL 的特定算法,突出了 Transformer 网络作为多功能可编程计算机的潜力。

本文作者的研究旨在研究探索这一充满希望的前景,揭示 Attention 机制如何能够模拟受指令集架构启发的通用计算机。

将 Transformer 作为可编程计算机

在本文中,作者展示了 Transformer 网络可以通过使用特定权重对它们进行硬编码并将它们置于一个循环中来模拟复杂的算法和程序。作者通过对 Attention 进行逆向工程来模拟基本计算块来做到这一点,例如对输入序列的编辑操作、非线性函数、函数调用、程序计数器和条件分支。作者的论文证明了使用单个循环或递归将 Transformer 的输出序列连接回其输入的重要性,从而避免对深度模型的需要。

图片

论文地址:https://arxiv.org/pdf/2301.13196.pdf

作者通过设计一个 Transformer 来实现这一点,该 Transformer 可以执行以单个指令的通用版本编写的程序,称为 SUBLEQ (A,B,C),即如果小于或等于零,则相减并分支。SUBLEQ 是一种单指令语言,定义了单指令集计算机(one-instruction set computer,简写为 OISC)。SUBLEQ 由 3 个内存地址操作数组成,执行时用存储器地址 B 的值减去存储器地址 A 的值,结果存入 B。如果 B 的结果小于等于 0,则跳转到地址 C,否则继续执行下一条指令。但这条指令能够定义通用计算机。

作者构造了实现类似 SUBLEQ 程序的显式 Transformer,作者称之为 FLEQ 的更灵活的单指令,其形式为

图片

其中 f_m 可以从一组函数(矩阵乘法 / 非线性函数 / 多项式等)中选择,可以将其硬编码到网络中。可以执行 FLEQ 程序的循环 Transformer 的深度不依赖于程序的深度或代码的行数,而是取决于实现单个 FLEQ 指令所需的深度,这是不变的。这是通过在输入序列上循环运行 Transformer 来实现的,类似于 CPU 的运行方式。

作者使用这个框架,展示了在推理时模拟各种函数的能力,包括一个基本的计算器、一个基本的线性代数库(矩阵转置、乘法、求逆、幂迭代)和在隐式完全连接网络上实现反向传播的 ICL。输入序列或 prompt 可当成穿孔卡片,包括 Transformer 需要执行的指令,同时为存储和处理程序中使用的变量提供空间。用于执行这些程序的 Transformer 网络的深度都小于或等于 13,并且提供了所有这些模型的权重矩阵。下面的定理总结了作者的主要发现:

定理 1:存在一个少于 13 层的循环 Transformer,它可以模拟通用计算机(文章第 5 节)、基本计算器(文章第 7 节)、数值线性代数方法,如近似矩阵逆和幂迭代(文章第 8 节),以及基于神经网络的 ICL 算法(如 SGD)(文章第 9 节)。

图片

图 1:循环 Transformer 架构示意图,其中输入序列存储命令,从中读取 / 写入数据的内存以及存储中间结果的暂存器。输入由网络处理,输出用作新输入,允许网络迭代更新隐式状态并执行复杂计算。

作者的研究强调了 Attention 机制的灵活性和单循环的重要性,这使得设计可以模拟复杂迭代算法和执行通用程序的模型成为可能。并进一步证明了 Transformer 模型高效执行复杂数学和算法任务的能力。可以想象,现代 Transformer (如 GPT-3),在执行各种任务时使用类似的内部子程序。在某种程度上,当给出上下文示例和说明时,可以启发这些模型特定技巧或算法的能力,类似于函数调用。然而,应该谨慎对待这个假设,因为作者设计结构的方式与现实世界语言模型的训练方式没有任何相似之处。

作者希望他们的研究能够鼓励进一步研究 Attention 机制的潜力,以及语言模型执行算法指令的能力。作者提出的设计可以帮助确定执行特定算法任务所需的最小 Transformer 网络规模。此外,作者还希望其发现有助于启发开发方法,从而通过利用更小的、逆向工程的 Transformer 网络来完成特定的算法任务,从而增强训练语言模型的能力。

构建面向通用计算的 Transformer 模块

 要使用 Transformer 网络构建通用计算框架,需要专门的计算块。将这些块组装来创建所需的最终功能。下面重点介绍 Transformer 层可以执行的各种操作。这些操作将为创建更复杂的例程和算法提供基础。这些操作的目的是彼此可互操作,利用 Attention 执行各种任务的能力,例如生成近似置换矩阵和通过 sigmoid 函数逼近一般函数。

图片

图 2: 用作实现小型指令集计算机构建块的三个 Transformer 块的示意图。这些块处理输入序列中的编辑操作(例如从一个块移动或复制到另一个块),跟踪程序计数器,并在满足指定条件时执行程序计数器跳转。

位置编码、程序计数器和数据指针

Transformer 通常需要执行迭代算法或执行一系列命令。为实现这一点,作者使用一个循环访问命令的程序计数器。计数器包含存储下一个命令的位置的编码。此外,命令可能具有指向命令需要读取和写入的数据位置的数据指针。程序计数器和数据指针都使用与前一段中讨论的相同的位置编码。

图片

作者的位置编码方案也可用于指向特定数据位置以进行读取或写入,这将在下一节论述。这是通过使用相同的二进制向量作为程序计数器和数据指针的位置编码来实现的。此外,这种指向特定数据位置的技术使 Transformer 能够在执行算法或构建以实现的命令序列期间有效地读取 / 写入数据。

读 / 写:将数据、指令复制到暂存器或从暂存器取出

图片

算家云 算家云

高效、便捷的人工智能算力服务平台

算家云 37 查看详情 算家云

图 3: 读取操作的示意图。箭头显示从分配给暂存器命令的输入部分复制的命令块。一条指令是一组指针。位置编码和计数器用于跟踪什么内容被复制到哪里。

下面的引理说明,程序计数器指向的命令或当前命令中指定位置的数据可以复制到暂存器以供进一步计算。程序计数器的位置通常位于暂存器内容的正下方,但可以任意更改。在整个计算过程中将其保持在特定位置有助于保持结构的良好组织。

下一个引理解释了存储在暂存器中的向量 v 可以复制到存储器中的指定位置,如暂存器本身指定的那样。这允许将数据从暂存器传输到内存中的特定位置以供进一步使用或存储。

图片

图 4: 写操作的示意图。箭头显示数据块正在从暂存器复制到分配给内存的输入部分中的指定位置。位置编码用于跟踪目标位置并确保数据写入正确的内存位置。

图片

条件分支

在这一部分,作者实现一个条件分支指令,该指令评估条件并在条件为真时将程序计数器设置到指定位置,或者在条件为假时将程序计数器递增 1。 

命令的形式如下:如果 mem [a]≤0,则转到 i,其中 mem [a] 是输入序列的内存部分中某个位置的值。该命令有两部分:判断不等式和修改程序计数器。

模拟通用单指令集计算机

SUBLEQ Transformer

Mavaddat 和 Parhami 早在 1988 年已经证明存在一条指令,任何计算机程序都可以转换为由这条指令的实例化组成的程序。这种指令的一个变体是 SUBLEQ,能访问不同的寄存器或内存位置。

SUBLEQ 的工作方式很简单。它访问内存中的两个寄存器,获取它们内容的差异并将其存储回其中一个寄存器,然后如果结果为负,则它跳转到不同的预定义代码行,或者继续执行当前行的下一条指令。为执行 SUBLEQ 程序而构建的计算机称为单指令集计算机,并且是通用计算机,即,如果可以访问无限内存,它就是图灵完备的。

图片

下面描述了一个循环 Transformer 的构造,它可以执行用特定指令集编写的程序。Transformer 跟踪代码行、内存位置和程序计数器,将输入的内存部分用作内存寄存器,将命令部分用作代码行 / 指令。暂存器用于记录每条指令涉及的加法和指针,读、写、条件分支操作等。

图片

图 5: 实现 OISC 指令块的图形表示。前两个块将数据 / 命令传输到暂存器,第二个和第三个执行减法并存储结果,而最后一个执行完成指令的 if goto 命令。

FLEQ:更灵活的基于 Attention 的计算机

在这一节,作者对 FLEQ 进行介绍,它是对 SUBLEQ 的推广,它定义了一种更灵活的精简指令集计算机。这一隐含的附加指令集基于 SUBLEQ 的更高级版本,允许在同一 Transformer 网络中实现多种功能。作者使用术语 FLEQ 来指代指令、语言和它定义的基于 Attention 的计算机。

FLEQ 的设计允许通过生成比简单减法更通用的函数来实现复杂的算法,如矩阵乘法、平方根计算、激活函数等。

 基于 Attention 的计算机执行周期。在循环 Transformer 的每次迭代中,根据程序计数器从输入中的指令集中提取一条指令。然后指令被复制到暂存器。根据要实现的功能,使用不同的功能块位置在局部记录该功能的结果。一旦计算出结果,它就会被复制回指令提供的指定内存位置。

执行周期类似于上一节中的单指令集计算机 (OISC),主要区别在于,对于每条指令,可以从预先选择的函数列表中进行选择,这些函数以任意数组的形式输入,如矩阵、向量和标量。

输入序列的格式。如图 6 所示,循环 Transformer 的输入 X,它可以执行一系列 FLEQ 指令构成的程序(X 由暂存器、存储器、指令等三部分构成)。

基于 Transformer 的功能块的格式。每个功能块都位于输入 X 的左下部分,如图 6 所示。

图片

图 6: 执行 FLEQ 命令的输入 X 的结构

更多技术细节和示例请参阅原论文。

以上就是把Transformer当通用计算机用,还能执行in-context learning算法,这项研究脑洞大开的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/563028.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
windows11如何为不同虚拟桌面设置不同壁纸_Windows 11虚拟桌面个性化设置
上一篇 2025年11月10日 02:05:05
iPhone16灵动岛功能深度解析 iPhone16灵动岛设置与日常使用指南
下一篇 2025年11月10日 02:05:13

相关推荐

  • 如何使用DeepSpeed训练AI大模型?大规模模型训练的优化技巧

    DeepSpeed通过ZeRO等技术突破显存限制,实现大模型高效训练。它采用ZeRO-1/2/3分级优化,分别对优化器状态、梯度和参数进行分区,显著降低单卡显存占用;结合混合精度、梯度累积和CPU/NVMe卸载进一步节省资源。同时集成流水线并行与张量并行,支持多维并行策略协同,使万亿参数模型训练在普…

    2026年9月22日
    200
  • TensorFlow的AI混合工具怎么操作?构建机器学习模型的详细步骤

    TensorFlow的混合编程核心在于结合Keras的高级抽象与TensorFlow底层API的灵活性,实现高效模型开发。首先使用tf.data构建高性能数据管道,通过map、batch、shuffle和prefetch等操作优化数据预处理;接着利用Keras快速搭建模型结构,同时通过继承tf.ke…

    2026年9月21日
    400
  • VSCode的悬浮提示信息如何自定义?

    通过JSDoc或docstring添加注释可直接影响VSCode悬浮提示内容,如JavaScript/TypeScript中使用/* /格式、Python中使用三引号文档字符串,配合Pylance等扩展增强显示;安装语言支持扩展可提升提示丰富度;高级场景可通过开发自定义语言服务器,在textDocu…

    2026年9月20日
    500
  • 魅族 22 核心配置曝光:80W+5500mAh 支持 UWB 技术

    魅族 22 核心配置曝光:80W+5500mAh 支持 UWB 技术魅族 22 核心配置曝光:80W+5500mAh 支持 UWB 技术魅族 22 核心配置曝光:80W+5500mAh 支持 UWB 技术魅族 22 核心配置曝光:80W+5500mAh 支持 UWB 技术

    8 月 19 日,一位数码博主透露了魅族 22 的关键配置信息。据悉,该机型将搭载 80w 有线快充,电池容量约为 5500mah,部分特别版本还将支持 uwb(超宽带)技术。 魅族 22 据该博主透露,魅族 22 已完成 CCC、SRRC 和 CTA 三大认证,进入发布前的最后准备阶段。在外观工艺…

    2026年9月9日 用户投稿
    000
  • 彩色背光技术:RGB-MiniLED/RGB MicroLED 解析——开启大屏显示新时代

    彩色背光技术:RGB-MiniLED/RGB MicroLED 解析——开启大屏显示新时代彩色背光技术:RGB-MiniLED/RGB MicroLED 解析——开启大屏显示新时代彩色背光技术:RGB-MiniLED/RGB MicroLED 解析——开启大屏显示新时代彩色背光技术:RGB-MiniLED/RGB MicroLED 解析——开启大屏显示新时代

    在当下的显示设备市场,显示方案的选择早已不是当年等离子和液晶技术那样的技术路线之争,而是 ” 画质表现 ” 与 ” 成本 ” 之间的权衡。传统背光和 mini led 背光供应链成熟、成本可控,却始终受制于技术先天带来的画质瓶颈;自发光阵营的 micr…

    2026年9月9日 用户投稿
    400
  • AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!AI赋能蛋白质研究:SaprotHub让蛋白质AI模型训练和调用不再有门槛!

    编辑 | scienceai 近年来,AI 技术在蛋白质研究领域发挥了越来越重要的作用。从 AlphaFold2 在结构预测任务上的脱颖而出,到各类蛋白质语言模型(PLMs)在功能预测方面的重大进展,生物研究者们可以利用各式各样的 AI 模型来辅助他们的研究。 然而,随着模型变得越来越复杂,如何训练…

    2026年9月7日 用户投稿
    200
  • 在ThinkPHP6中使用Docker技术

    随着云计算和容器技术的快速发展,docker 成为了构建、部署和管理应用程序的最流行方式之一。在软件开发和部署方面,docker 为我们提供了一种轻量级、可移植、可重复使用的解决方案,可以有效地优化我们的开发过程。 而在 ThinkPHP6 中,开发者们可以使用 Docker 技术来优化他们的开发流…

    用户投稿 2026年9月7日
    100
  • 在ThinkPHP6中使用Auth授权技术

    随着互联网应用的不断发展,web应用程序的安全性成为越来越重要的问题,如何保证程序的安全性,已经成为所有开发者面临的难题。auth授权技术是一种流行的解决方案,可以提供基于角色的访问控制。 在这篇文章中,我们将探讨如何在ThinkPHP6中使用Auth授权技术。首先,我们需要明确一下Auth授权的工…

    用户投稿 2026年9月7日
    000
  • 清华大学研究组首次在双重编码量子比特之间实现高保真度量子纠缠门

    清华大学科研团队在双重编码量子比特量子逻辑门研究中取得突破性进展,成功在钡离子超精细能级中实现了双重编码量子比特间的直接纠缠逻辑门。这项研究成果显著降低了量子线路复杂度,为未来量子纠错和离子-光子量子网络应用铺平了道路。 离子阱技术是构建大规模通用量子计算机的热门选择,已成功实现高保真量子比特操作。…

    2026年9月6日
    000
  • 在ThinkPHP6中使用Pjax技术

    随着web技术的不断发展,网站的访问速度变得越来越快。但是,对于一些需要频繁刷新页面的应用程序,如博客、新闻站点或社交媒体,即使有快速的网站,用户仍然需要等待每个页面完全加载才能获取信息或执行一些操作。pjax技术可以帮助解决这个问题,而在thinkphp6中使用pjax也相当容易。 Pjax是什么…

    用户投稿 2026年9月6日
    100
  • 实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊

    实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊实现5Å全原子RMSD,普渡大学深度学习方法准确预测RNA三级结构,登Nature子刊

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | 萝卜皮 非编码 RNA 在各种生物功能中发挥着调控作用,并且与人类健康、药物设计等领域息息相关。 了解功能的机械机制需要三级结构信息,然而,通过实验确定 RNA 三维结构成本高昂且耗时…

    2026年9月5日 用户投稿
    100
  • AI for Science:北大、东方理工等团队用人工智能在实验数据中挖掘潜在规律

    AI for Science:北大、东方理工等团队用人工智能在实验数据中挖掘潜在规律AI for Science:北大、东方理工等团队用人工智能在实验数据中挖掘潜在规律AI for Science:北大、东方理工等团队用人工智能在实验数据中挖掘潜在规律AI for Science:北大、东方理工等团队用人工智能在实验数据中挖掘潜在规律

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | ScienceAI‍‍ 科学研究的核心之一是发现能够描述自然现象的规律性方程。这些方程不仅能加深我们对自然的理解,还能为复杂问题的解决提供明确指导。 然而,许多领域,尤其是材料和化学等…

    2026年9月4日 用户投稿
    300
  • 70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    人人都在做垂直 AI 产品,为什么要反其道而行? Scaling Laws 是否失灵,这个话题从 2024 年年尾一直讨论至今,也没有定论。 Ilya Sutskever 在 NeurIPS 会上直言:大模型预训练这条路可能已经走到头了。上周的 CES 2025,黄仁勋有提到,在英伟达看来,Scal…

    2026年9月4日 用户投稿
    200
  • 利用WebMan技术打造优质的在线学习平台

    利用WebMan技术打造优质的在线学习平台 随着互联网的快速发展,在线学习方式日益普及。然而,市场上的在线学习平台千差万别,用户体验和功能的不同常常让人犯难。为了解决这个问题,我们可以利用WebMan技术来打造一个更加优质的在线学习平台。 WebMan是一种基于Web技术的应用开发方式,可以帮助我们…

    2026年9月3日
    000
  • 刚刚,奥特曼剧透GPT-4.5、GPT-5重大更新,o3取消独立发布

    刚刚,奥特曼剧透GPT-4.5、GPT-5重大更新,o3取消独立发布刚刚,奥特曼剧透GPT-4.5、GPT-5重大更新,o3取消独立发布刚刚,奥特曼剧透GPT-4.5、GPT-5重大更新,o3取消独立发布刚刚,奥特曼剧透GPT-4.5、GPT-5重大更新,o3取消独立发布

    奥特曼深夜一则推文,在网络上掀起了讨论狂潮。 没有一点点预告,奥特曼亲自公布自家产品路线图,并承认公司最近发布的一些产品有些混乱。 推文透露,OpenAI 的下一步是发布 GPT-4.5,这是其最后一个非思维链 (CoT) 模型。它的内部代号是 Orion,不过奥特曼没有解释 GPT-4.5 将具有…

    2026年9月2日 用户投稿
    100
  • 从概念到应用,清华团队开发DeepTFBU工具包助力基因表达精准调控

    从概念到应用,清华团队开发DeepTFBU工具包助力基因表达精准调控从概念到应用,清华团队开发DeepTFBU工具包助力基因表达精准调控从概念到应用,清华团队开发DeepTFBU工具包助力基因表达精准调控从概念到应用,清华团队开发DeepTFBU工具包助力基因表达精准调控

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | 萝卜皮 增强子通过与转录因子 (TF) 相互作用,在各种生物过程中充当基因表达的关键调节器。虽然转录因子结合位点 (TFBS) 被广泛认为是 TF 结合和增强子活性的关键决定因素,但其…

    2026年8月31日 用户投稿
    900
  • 注册Deepseek账号时,哪些信息是必填的?

    必填信息:1、邮箱注册;2、手机号码注册;3、第三方社交平台注册。注册成功后通常还需要填写一些基本个人信息,如昵称、性别、生日等。 1、DeepSeek官网入口☜☜☜☜☜点击保存 2、DeepSeek官方登录入口☜☜☜☜☜点击保存 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用…

    2026年8月29日
    100
  • 耶鲁、剑桥等开发MindLLM,将脑成像直接转换为文本

    耶鲁、剑桥等开发MindLLM,将脑成像直接转换为文本耶鲁、剑桥等开发MindLLM,将脑成像直接转换为文本耶鲁、剑桥等开发MindLLM,将脑成像直接转换为文本耶鲁、剑桥等开发MindLLM,将脑成像直接转换为文本

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 编辑 | 萝卜皮 将功能性磁共振成像 (fMRI) 信号解码为文本一直是神经科学界面临的一项重大挑战,它有望推动脑机接口的发展,并加深对大脑机制的了解。然而,现有的方法往往存在预测性能不佳、任务…

    2026年8月28日 用户投稿
    000
  • 高通牵手诺基亚贝尔实验室,展示无线网络中可互操作的多厂商AI的价值

    高通牵手诺基亚贝尔实验室,展示无线网络中可互操作的多厂商AI的价值高通牵手诺基亚贝尔实验室,展示无线网络中可互操作的多厂商AI的价值高通牵手诺基亚贝尔实验室,展示无线网络中可互操作的多厂商AI的价值高通牵手诺基亚贝尔实验室,展示无线网络中可互操作的多厂商AI的价值

    ai赋能无线网络:高通与诺基亚联合展示多厂商ai互操作性 本文介绍高通和诺基亚在2024年世界移动通信大会(MWC 2024)上展示的成果:一个基于AI的、可互操作的多厂商无线网络系统。该系统显著提升了网络吞吐量,并在不同物理环境中展现出强大的鲁棒性。 关键发现: AI模型在各种物理环境(包括室内外…

    2026年8月28日 用户投稿
    100
  • 除了Transformer架构,还有哪些常用的大模型架构

    常见大模型架构多样。RNN 处理序列,却因梯度问题难应对长序列;其变体 LSTM 借门控机制改善,GRU 则简化结构提效率。CNN 从计算机视觉起步,借卷积等提取特征,后拓展应用。GAN 用于生成,借生成与判别对抗训练。VAE 融合自编码器与变分推断生成多样样本 。 ☞☞☞AI 智能聊天, 问答助手…

    2026年8月25日
    000

发表回复

登录后才能评论
关注微信