ChengRang

人人都能懂的科普:大模型常说的"架构"和"注意力",到底是什么

人人都能懂的科普 约 10 分钟阅读

你多半在新闻里见过这类说法:某家大模型 2.8 万亿参数,全球最大的开源模型;这家公司新发布的模型用了新的注意力机制,推理成本降了一半。

参数、架构、注意力,这几个词天天在 AI 新闻里出现,但很少有文章会停下来解释它们到底指什么。看完感觉好像很厉害,可具体厉害在哪,说不上来。

这篇不讲任何数学公式,用一个类比把架构和注意力这两个词讲清楚:它们分别是什么,分别影响什么。

这是人人都能懂的科普系列第六篇,前几篇讲了谁在干活什么是 agentAI 为什么忘事什么是 Harness。本文不依赖前文,但读过会更顺。

把一个大模型想象成一家咨询公司

全文用一个类比:一个大模型,就像一家大型咨询公司。

你(用户)向这家公司提一个需求,比如帮我分析一下这份合同有没有问题,公司内部调动资源处理,最后交给你一份报告。这份报告就是 AI 的回答。

架构和注意力,是这家公司内部运作的两个不同层面。架构管的是公司整体是怎么组织的:有多少人,每层楼里的部门怎么设置,一个需求进来该走哪几道流程。注意力管的是公司里的人在做具体一份报告时,怎么去查阅、参考你给的那些背景资料。

先讲架构,再讲注意力。

架构:这家公司是怎么搭起来的

骨架从哪里来

大模型内部这套公司架构图纸最初是 2017 年被设计出来的,业内给它起了个名字,叫 Transformer。原版图纸分两部分(编码器 + 解码器),后来 GPT 系列开创的路线把编码器砍掉、只保留了解码器。你现在听过的主流对话大模型,ChatGPT、Claude、DeepSeek、Kimi、通义千问,基本都用的是这个半张图纸的简化变体。

也有极少数模型比如 Mamba、RWKV 在尝试完全跳出 Transformer 这套路线,走另一种设计,但目前市面上你能用到的绝大多数产品,都还在这张图纸上。

Transformer 具体代表什么技术细节其实不重要,你只需要知道一件事:真正让各家不一样的,不是图纸本身,是图纸里每层楼具体怎么装修。下面要讲的参数、专家团队、注意力,讲的都是同一张图纸下的不同装修方案。

参数:公司到底签了多少人

新闻里常说这家模型有 671B 参数(B 是"十亿"的意思,671B 就是 6710 亿;看到"万亿",1 万亿 = 1000B)。这个数字,你可以粗略理解成这家咨询公司总共签了多少名顾问。

打比方而已。参数其实是神经网络里的一堆数字,也就是权重,不是真的独立个体。用顾问人数来比喻,是为了方便理解规模这件事,不是说参数真的一个个坐在办公室里。下面所有顾问、事业部的说法,也都要放到这个前提下理解。

签的顾问越多,公司懂的东西越多、越聪明,但这里有一个反直觉的地方:签了很多顾问,不代表每次干活都要全部出动。

你经常会同时看到另一个数字,叫激活参数,比如总参数 671B、激活参数 37B。这句话翻译过来就是:公司一共签了 671 亿人力单位的顾问,但接到一个具体项目时,只会实际派出 37 亿人力单位的人去做这一单。

公司值不值钱、能力上限有多高,看的是签了多少人(总参数);这一次找它办事花多少钱、等多久,看的是这一单实际派了几个人(激活参数)。这两个数字经常被混着说,新闻标题里的 XX 万亿参数听起来很唬人,但决定你体验和成本的,往往是激活参数那个小得多的数字。

模型聪明不聪明,也不是签了多少人单独决定的。训练时喂了多少高质量数据、训练方法本身好不好、公司内部各部门配合得怎么样,这些同样重要。同样规模的模型,训练得好就是聪明得多。参数只是能力上限的一个可能天花板,不能自动兑换成实力。

专家团队:公司怎么决定派谁上场

那么公司怎么知道该派哪些人?这就要看内部具体怎么组织。业内有两种做法。

老办法叫 Dense(稠密架构)。公司只有一个全能顾问组,不管你要做财务分析还是要写一首诗,全组人都要一起上、全程参与。问题是,公司一旦签了更多顾问(想变得更聪明),每一单都要全员出动,成本会跟着暴涨。

新办法叫 MoE(混合专家)。公司把每一层楼里的加工部门改组成很多个专业事业部(比如 192 个),每个事业部只擅长某一类问题。哪个事业部具体擅长什么,不是人为规定的,是公司在长期培训磨合中自己形成的。每来一份需要加工的材料,由一位前台派单经理判断该交给哪几个事业部,通常只调动其中一小部分(比如 8 个)参与,剩下的事业部这一单完全不用出动。

这里说的"专家"跟你平时在豆包、Coze、Dify 里见过的那种"专家 Agent""AI 专家人设"不是一回事。后者是产品层面搭建的对话角色,用户能自己创建、也能直接选来用;本文说的 MoE 专家是模型内部的一堆权重参数,深埋在架构底层,你在产品界面上看不到,也没法直接操作。两者只是碰巧共用了"专家"这个词。

反直觉的现象到这里就有了解释:公司可以签很多顾问(总参数很大)却不算贵,因为每次真正干活的,只是派单经理挑出来的那一小部分人(激活参数)。

不过 MoE 不管所有事,它只管加工报告这个环节。公司内部还有查资料(也就是等一下要讲的注意力)等其他环节,那些环节走的是另一条流程,不归 MoE 的派单经理管。这两个环节在公司里是一前一后串在一起的:先查资料(注意力),再加工(MoE),不是两个平行独立的部门。

MoE 也不是白捡便宜。虽然每次只派几个事业部上场,但所有 192 个事业部都得一直待命,所有专家的参数都要常驻在显存里。所以 MoE 模型的硬件门槛(显存占用)反而比同等激活规模的稠密模型更高,只是跑起来的成本更便宜。所以你看到很多人在网页上用 DeepSeek、Kimi 这种大 MoE 模型聊天很流畅,但自己想部署一份就会很吃力。网页版是服务商替你扛了硬件成本。

架构影响什么

架构决定了两件你能直接感受到的事。

第一件是模型能有多聪明、懂多少东西。公司签的顾问越多、专业事业部分得越细,能力上限就越高。当然,要真的聪明,还得看训练数据和方法配不配得上。

第二件是用起来贵不贵、跑得快不快。这不是看公司签了多少人,是看每次实际派了多少人上场。所以现在很多新模型的宣传里会同时强调总参数很大和激活参数很小,前者夸公司很强,后者夸用起来很便宜。这两句话在夸不同的事。

注意力:公司的人怎么查资料

先破一个误解

注意力这个词很容易被理解成 AI 在认真思考、仔细琢磨,其实不是。它的实际含义要具体得多:顾问在处理你的需求时,需要判断这句话里的每一个词,该重点参考前面哪些内容。

比如你让公司分析这句话:小花明天过生日,她想要一个蛋糕。顾问读到"她"字的时候,得判断"她"跟前面每一个词分别有多相关:跟"小花"有多相关,跟"生日"有多相关,跟"明天"有多相关,全部都要算一遍。算下来"小花"这项分数最高,"她"就跟"小花"关联起来了。这个"跟前面每个词都算一遍相关度"的动作,就是注意力机制在做的事。

麻烦的地方在于,这个"算一遍相关度"不是随便扫一眼,是每一个新词都要跟前面所有的词各自算一遍。资料越长,工作量涨得越吓人:文本长度翻一倍,比对次数变成 4 倍(是平方关系,不是等比例增长)。所以处理长文档特别烧钱,不是多花一点钱,而是多花很多倍钱。

两条不同的省钱思路

这件事既然这么贵,各家公司自然想了不同的办法来降本。这些办法可以分成两条完全不同的路线。

路线一:把资料室整理得更省地方

顾问每处理一个新词,都得从资料室里翻出前面所有词的记录来比对(这个资料室在技术上叫 KV 缓存)。资料室占多大地方,直接决定了硬件成本。业内的做法是逐步优化的。

最早的做法是每个部门(每个注意力头)都在资料室里放一整套自己专用的档案柜,资料完整但特别占地方。后来改成让几个部门共用一套档案柜,档案柜数量少了很多,几乎不影响查阅质量,现在绝大多数主流模型都用这个做法。更激进的方案是不存完整档案,只存一份压缩摘要卡片,顾问要用的时候现场把摘要还原展开成接近完整的信息。DeepSeek 用的就是这套方案,资料室占地进一步压缩,还原出来的信息几乎不丢失细节。

这条路线解决的问题是资料室太占地方,也就是显存占用问题。

路线二:干脆少翻一些资料

除了让资料室更小,还有另一条思路:别每个词都跟前面所有词一一比对了,聪明地跳过大部分不相关的。比如让顾问只重点看最近的 100 个词,或者只看跟当前话题最相关的 50 个词,其他的直接不管。这条路线在技术上叫稀疏注意力,各家有各家的具体做法,名字很多,思路都类似。

这条路线解决的问题是每次比对次数太多,也就是计算量问题。它也有代价:只看最近或最相关的一部分内容,意味着主动放弃了对其他内容的完整关注。所以处理超长文档时,AI 有时会看到后面漏掉中间某些细节。当然这不是唯一的原因,AI 处理长文档漏细节还有两个更常见的原因:一是对话或文档太长塞爆了上下文窗口,最早的内容被踢出去,AI 看不见了;二是就算装得下,AI 对一段长文本的注意力天生就不均匀,开头和结尾记得最牢,中间那部分最容易被略过(研究上叫 Lost in the Middle)。稀疏注意力只是让这个"漏细节"问题多了一个源头。

这些技术方案具体叫什么名字其实不重要,你只需要知道:让资料室更省地方和让比对次数更少是两条独立的优化路线,可以叠加使用。最近这两年,很多大模型突然都能一口气读一整本书了,就是因为这两条路线都在被持续改进。

注意力影响什么

注意力决定了两件事。

一件是能不能处理长文档。查资料的方式越高效,公司能同时摆开的资料就越多,你贴一份很长的合同或者一整本书给它,它才不会看到后面忘了前面。

另一件是处理长文档贵不贵、快不快。查资料的方式越笨,资料越长就越烧钱;方式越聪明,同样的资料量花的成本更低。

架构和注意力是什么关系

到这里两个词都讲完了,很多人容易把它们混在一起。用最简单的两句话把区别说清楚:

架构解决的是模型整体怎么干活、上限多大、成本基数多少。注意力解决的是模型怎么读懂上下文、能记多长、读长内容烧不烧钱。

从属关系也用一句话理清楚:架构是这家公司整体的组织设计图,有多少层楼、每层楼里有哪些环节、需求进来要走什么流程;注意力则是每一层楼里查资料这一个具体环节的做法。

所以注意力是架构这张大图里的一个组成部分,不是跟架构平行的另一个东西。前面讲的专家团队(MoE),则是每层楼里紧接着的下一步,也就是加工报告这一步的做法。

同一层楼里的流程是先查资料(注意力),再交给加工组处理(MoE 或普通加工组),加工完的结果再传给下一层楼。这个流程要重复很多层,很多层楼一层层堆叠着做完,最后才输出一份完整报告给你。

写在最后

看到 XX 万亿参数先别激动。那是总参数,跟你实际花的钱、等的时间关系不大。真正影响体验的是激活参数(这一单派了几个人上场),后者通常小得多。

参数量不等于智商。训练数据、训练方法、内部配合,任何一项拉胯,参数再多也白搭。同规模模型之间的差距,主要不是靠多签几个人拉开的。

专家团队不是新玩意。MoE 思路 2023 年前后就成熟了,最近两年才成了几乎所有主流旗舰的标配。新闻里总参数几万亿、激活几百亿这种句式突然到处都是,就是这个原因。

MoE 省的是跑起来的钱,不是部署的钱。所有专家都得常驻显存待命,硬件门槛反而更高。你在网页上觉得它又聪明又便宜,是服务商替你扛了这部分成本。

换 MoE 不算改骨架。Transformer 图纸没变,只是加工报告这一步的做法换了。真正跳出这套骨架的模型(Mamba、RWKV 之类)目前还是小众,你日常用到的产品基本都在这张图纸上。

注意力优化的各种缩写,可以一律忽略。不管新闻里叫什么名字,本质都在做两件事之一:要么让资料室更省地方(存储优化),要么让比对次数更少(计算优化)。记住这两条路线就够了。

架构是一家公司整体怎么分工运转,决定了模型能有多聪明、跑起来贵不贵;注意力是每层楼里查资料参考背景信息这一个具体环节,决定了模型能不能处理长文档、处理长文档贵不贵。两者不是平行的两件事,注意力是架构这张大图里的一个环节,跟加工报告(MoE)在同一层楼里前后串联。

← 返回目录