(来源:麻省理工科技评论)

2017 年夏天,Google 的 AI 研究人员发表了影响深远的论文《Attention Is All YouNeed》,提出了一种新的神经网络架构——Transformer。九年过去,Transformer 已经成为几乎所有主流大语言模型的核心架构。

“整个 AI 行业都建立在 Transformer 之上。”AI 初创公司 Subquadratic 联合创始人兼 CEO贾斯汀·丹格尔(Justin Dangel)说,“它是计算机科学史上最重要的创新之一,也真正改变了世界。”

但如今,Transformer 开始显露出局限。近几年,大语言模型的能力不断提升:推理模型开始兴起,模型一次能够处理的信息也越来越多。但这些进步并不完全来自 Transformer 本身的突破。很多时候,研究人员其实是在通过各种工程手段,绕开或弥补这一架构原有的问题。

于是,一个问题开始摆到台面上:Transformer 之后,下一代大模型会是什么样?

一批初创公司已经开始押注不同的技术路线,希望突破 Transformer 的能力边界。比起成熟的大企业,这些创业者包袱更少,也更愿意尝试激进的新方案。

Transformer 目前的问题首先出在它最核心的机制:注意力机制(让模型判断输入信息之间哪些部分彼此相关的一种计算方式)。目前,Transformer 最常用的是“稠密注意力”(dense attention)。简单来说,模型会把输入中的每个 token,都和其他 token 逐一进行比较。

token 是大模型处理文字时的基本单位,可以是一个完整的词,也可以只是一个词的一部分。通过比较这些 token 之间的关系,模型可以判断一段文字中哪些内容彼此相关,进而理解整段文本的含义。这套方法效果很好,但代价也很高。

文本越长,需要进行的计算就越多,而且增长速度非常快。一篇大约 1 万词的文档,可能就需要 Transformer 完成约 5000 万次乘法运算。

这也是今天大语言模型如此耗电的重要原因之一。成本随之水涨船高。OpenAI 总裁格雷格·布罗克曼(Greg Brockman)表示,公司今年计划在算力上投入 500 亿美元。国际能源署则预计,到 2030 年,全球数据中心的总用电量将比现在翻一番。

更麻烦的是,Transformer 恰恰不太擅长处理如今越来越重要的一类任务:同时追踪大量信息。模型一次能够处理的信息范围,被称为“上下文窗口”。但随着输入越来越长,Transformer 要同时维护的信息也越来越多,很快就会遇到算力和效率上的瓶颈。

而大模型想要完成更复杂的任务,就必须处理更多信息。它可能需要一次读完一整个文档库、一套完整代码库;如果是 AI 智能体,还要不断接受其他模型、工具和外部环境返回的新结果。

推理模型进一步放大了这个问题。这类模型通常会先生成一段中间推理过程,再读取这些内容继续推理。换句话说,模型不仅要记住用户输入的内容,还要不断处理自己刚刚生成的“思考记录”。随着大模型越来越大、任务越来越复杂,Transformer 原本最重要的优势,也开始成为限制它继续扩展的瓶颈。

目前,至少有四条值得关注的技术路线正在尝试解决这个问题。它们可能让未来的大语言模型更快、更省算力,甚至获得今天模型还不具备的能力。

最直接的办法,就是从注意力机制本身下手。其中一种思路,是用“稀疏注意力”(sparse attention,即只计算一部分重要 token 之间的关系)取代稠密注意力。传统的稠密注意力几乎要比较所有 token 之间的关系,而稀疏注意力只挑出其中真正重要的一部分进行计算,因此可以大幅减少算力消耗。事实上,研究人员多年来已经提出过不少稀疏注意力方案。

问题在于,这些方法过去虽然更省算力,但理解文本的能力通常不如稠密注意力。如今,这种情况可能正在改变。总部位于迈阿密的初创公司 Subquadratic 宣称,它开发出了第一种能够在部分任务上与主流顶级大模型竞争的稀疏注意力机制,包括搜索和编程任务。

Subquadratic 表示,它开发的模型 SubQ 会针对每一段输入内容,实时判断哪些词真正重要、哪些可以忽略,再把算力集中到关键部分。公司称,目前已有数千人加入产品候补名单,并计划很快向更多用户开放模型。

与此同时,旧金山初创公司Manifest AI选择了另一条更激进的路线。它不是改造注意力机制,而是试图直接用另一套机制取代它。Manifest AI 将这项技术称为“power retention”。核心思路很简单:模型没有必要一直记住此前出现过的所有信息,只需要留下当前任务真正用得上的部分。

传统注意力机制要求模型持续追踪整个上下文窗口中的信息。像SubQ这样的稀疏注意力模型虽然会忽略很多不重要的 token,但仍然要保留此前内容的大致结构。power retention 则更像是在不断更新一份“滚动摘要”。新的信息进入后,已经不再重要的内容会被压缩甚至丢弃,模型只保留当前最相关的信息。

Retention(保留机制,即把重要信息压缩成内部状态并持续保存)并不是一个全新的概念,相关研究已经存在了大约十年。Manifest AI 认为,经过新的改进后,这类方法第一次有机会真正与 Transformer 大模型竞争。

公司还表示,现有 Transformer 模型不需要从头训练,只需经过少量重新训练,就可以改造成采用 power retention 的模型。为了证明这一点,Manifest AI 把开源编程模型 StarCoder 改造成了 PowerCoder。公司还发布了一款名为 Brumby 的模型,并称其能力可以与阿里巴巴部分 Qwen 模型相比。Manifest AI 希望,这项技术未来能够成为大模型处理超长信息的一种主流方案。

公司联合创始人兼 CTO 卡莱斯·格拉达(Carles Gelada)此前举过一些例子:模型可以一次分析数小时的视频,或者让 AI 智能体连续数周执行同一项任务,而不用反复读取此前发生过的一切。

另一条路线,并不是彻底抛弃 Transformer,而是把它和其他神经网络架构组合起来。从 MIT 独立出来的 Liquid AI 就选择了这种思路。这家位于马萨诸塞州剑桥的公司,把 Transformer 与自己开发的“液态神经网络”(liquid neural networks,一种能够根据新输入动态调整内部状态的神经网络)结合起来。

公司联合创始人兼 CEO 拉明·哈萨尼(Ramin Hasani)把这类模型称为“液态基础模型”(Liquid Foundation Models,简称 LFM)。相比大多数大语言模型,Liquid AI 的模型体积小得多,能耗也更低。公司已经为包括梅赛德斯在内的汽车制造商开发模型,可以直接运行在汽车内部的小型芯片上。最新版本甚至可以运行在售价约 50 美元、算力和功耗都十分有限的树莓派上。

对于年收入低于 1000 万美元的机构,Liquid AI 免费开放这些模型。哈萨尼表示,目前公司的模型累计下载量已经接近 3400 万次。

液态神经网络最初的灵感来自蠕虫的大脑。它是在另一类比 Transformer 更早出现的神经网络基础上发展而来的,即卷积神经网络(convolutional neural network,一类擅长从局部信息中提取特征的神经网络,过去尤其常用于图像识别)。

液态神经网络的一大特点,是能够根据新的输入不断调整自身状态。也就是说,模型在运行过程中,仍然可以适应新的信息。传统 Transformer 很难做到这一点。模型一旦训练完成,核心参数基本就固定下来,不会因为新的输入自动改变自身。

Liquid AI 早期的模型能力还比较有限,主要用于控制无人机或驾驶车辆。如今,公司希望通过 LFM 把这套技术扩展到大语言模型,与主流模型正面竞争。Liquid AI 表示,它最新的模型能够以大约四分之一的参数规模,达到一些大型竞品相近的性能,包括阿里巴巴 Qwen 和 Google 开源模型 Gemma 的部分版本。

传统大语言模型通常由一层层 Transformer 模块堆叠而成。Liquid AI 最近推出的 LFM 则采用混合架构,其中大约 20% 是 Transformer,另外 80% 使用液态神经网络。

更有意思的是,这个比例并不是工程师手动确定的。Liquid AI 还开发了一套专门用来“设计 AI 的 AI”。这套系统会自动测试大量不同的神经网络组合,包括液态神经网络、卷积神经网络和 Transformer 等,再从中寻找性能和效率最平衡的架构。“这现在是我们公司最核心的技术。”哈萨尼说。

在他看来,Transformer 或许只是 AI 架构创新的起点。“人的大脑某种程度上就是一个 AGI 系统,但功耗只有大约 20 瓦。”他说,“这是怎么做到的?我们显然还有很大的创新空间。”

今天几乎所有大语言模型,都是一个 token 接一个 token 地输出内容。这很符合人类说话和写字的方式,但对计算机来说,并不一定高效。如果模型能够一次生成整个句子,甚至整段文字,生成速度和成本都有可能明显改善。

总部位于加州帕洛阿尔托的初创公司 Inception,就在尝试这种路线。它使用“扩散模型”(diffusion model,一种从随机噪声开始,通过不断修正逐渐生成最终结果的模型)来构建大语言模型。

扩散技术更为人熟知的应用,是今天大量图像和视频生成模型。这类模型生成图片时,通常会从一幅类似老式电视雪花屏的随机噪声开始,然后同时调整大量像素,一步步把杂乱的画面变成清晰图像。事实证明,同样的思路也可以用于文本。

Inception 训练模型从一串随机的词开始,不断修改其中的内容,直到最终形成完整、有意义的句子。这类扩散式大语言模型仍然会使用 Transformer 来理解和编码语义,但它不必严格按照顺序逐个预测 token,而是可以同时生成和修改一整块文本。

“Inception 仍然在使用大型 Transformer,但我们可以一次预测很多 token。”联合创始人兼 CEO 斯特凡诺·埃尔蒙(Stefano Ermon)说,“这就是为什么我们的模型比目前大多数方案快得多,成本也更低。”

真正困难的地方,是怎么把原本为图像设计的扩散技术搬到文字上。埃尔蒙举了一个例子。在图像里,如果一个像素要从蓝色变成红色,中间还可以经过紫色等一系列过渡颜色。但文字不是连续变化的。“如果你有‘猫’和‘狗’两个词,它们之间并不存在一个自然的中间状态。”

埃尔蒙同时也是斯坦福大学研究人员。2024 年,他和两名斯坦福同事找到了一套数学方法,让扩散模型真正能够用于文本生成。他们训练出的扩散模型在性能上达到了 OpenAI 2019 年发布的 GPT-2 水平,但速度快了 10 倍。这项成果最终促使埃尔蒙创办了 Inception。

如今,他已经把目标瞄准更先进的模型。Inception 宣称,最新模型 Mercury 2 的表现可以达到 OpenAI 部分 GPT-4 模型的水平,同时依然保持大约 10 倍的速度优势。“我们非常看好这条路线,因为我们认为它能够继续扩展。”埃尔蒙说。

在他看来,未来真正决定模型竞争力的,最终还是速度和成本。“最后真正重要的指标,会是每一美元能买到多少智能。”Inception 并不是唯一押注扩散式语言模型的公司。Google 也在探索类似方向,并开发了一款名为 Diffusion Gemma 的大语言模型原型。不过,埃尔蒙并不担心 Google 入局。“我反而觉得,这验证了我们的判断。”他说,“这就是未来。”

同样位于帕洛阿尔托的初创公司 Pathway,可能是这批公司中走得最远的一家。它提出的问题更加根本:AI 为什么一定要通过语言来“思考”?Pathway 开发了一款名为 Dragon Hatchling 的模型。

这个名字来自特里·普拉切特(Terry Pratchett)的小说《魔法的色彩》(The Color of Magic)。小说中的龙,只要被人足够强烈地想象,就会真正出现。目前,这款模型最引人注目的成绩来自一项数独测试。

这套基准包含超过 25 万道高难度数独题。Dragon Hatchling解出了其中超过 97%,而一些顶尖 AI 实验室的主流大语言模型甚至一道都没有解出来。Pathway 想用这个结果说明一个问题:

今天的大语言模型虽然已经能完成很多令人惊讶的任务,但仍然有一些重要的问题,是它们天然不擅长处理的。数独只是其中一个例子。

Pathway 联合创始人兼 CEO 祖赞娜·斯塔米罗夫斯卡(Zuzanna Stamirowska)认为,如果希望 AI 真正提出新的解决方案,而不只是从已有知识中寻找答案,就需要进一步突破 Transformer 的限制。

原因之一在于,Transformer 几乎迫使模型把所有问题都转化成文字来处理。但有些推理,本来就不适合用语言表示。“如果要一个词一个词地描述一张数独棋盘,会非常困难。”斯塔米罗夫斯卡说。

Pathway 的办法,是改变 Transformer 背后的数学结构。它用一种叫作“状态空间”(state space,一种把大量信息压缩成内部状态,并随着新输入不断更新这种状态的数学表示方式)的结构,替代传统的注意力机制。

Transformer 更习惯沿着 token 序列逐步处理信息,而状态空间可以把信息压缩成更加抽象的内部表示。这样一来,Dragon Hatchling 仍然可以理解和生成文字,同时也能够进行一些不依赖文字序列的推理。

理论上,这不仅可以提高模型效率,还可能让它解决一些传统大语言模型难以处理的问题。斯塔米罗夫斯卡举了国际象棋和数学的例子。人在思考这类问题时,并不会真的在脑海里逐字生成一长串句子。

“你脑海里突然出现的那个‘啊哈’时刻,并不一定是语言。”她说,“我们的观点是,如果必须用语言推理,那本身就可能是一种限制。”她也承认,一个主流大语言模型当然可以先读一本数独教程,再写一段程序去解题。

但 Pathway 想做的,是一种不只会调用已有知识的 AI。“我们对 AI 的期待并不是让它解决数独,”斯塔米罗夫斯卡说,“而是希望它有一天能够治愈癌症。但怎么治愈癌症,并没有一本现成的书可以读。”在她看来,Transformer 从来都不应该被视为 AI 的终极架构。

她说,“Transformer 只是我们偶然找到的一种工程上很好用的方法。后来整个行业几乎把它变成了一种信仰。但如果认为未来不会再出现新的技术突破,那才是不合理的。”

https://www.technologyreview.com/2026/08/10/1141511/these-startups-are-chasing-the-next-big-thing-in-llms/