大模型推理工作原理:人脑与大模型,1

人气:246 ℃/2024-01-07 02:12:27

头条特供,基于迭代版本:2,约8.9千字

大模型,即“大型语言模型”(Large Language Model,LLM),其所展现出的人工智能,与我们的人类智能相比,有着超乎寻常的相似性,以及超乎想象的可比性,甚至初具条件的替代性

这意味着,人类并不特殊,人脑也并不特殊——如今“提问”就是“念咒”“提示语”就是“咒语”“咒语水平”就是“魔法水平”,而这仅仅只是“魔法世界”的开始。

本文,将会追随着架构思想运作机制,去深入探讨人脑大模型之间的深刻关联,并揭开类脑系统的技术细节与涌现奥秘,以及突破语言模型的智能进化——最终我们还将在,超越现有科学工程的基础上,进行更广泛宏大且激进大胆的叙事推演

其中涉及到了,数学、物理学、生物学、脑科学、心理学、哲学,与本能、智能、心智、意识、演化、宇宙及编程,等等学科领域的交织联结

相信,本系列的视角观点,能够让我们彻底看清透彻理解——人脑与大模型、人类与人工智能之间的底层逻辑本质关系

主题目录如下:

质变点

首先,是专用人工智能(Artificial Narrow Intelligence,ANI),也可称为狭义人工智能,或窄域人工智能(Narrow AI),即:一个模型可以处理一个特定的任务,如:图像识别、机器翻译、语音助手、棋类游戏、推荐系统、自动驾驶等。

其次,是通用人工智能(Artificial General Intelligence,AGI),也可称为广义人工智能,或全域人工智能(Full AI),即:一个模型可以处理所有类型的任务,并能进行人类智能水平的因果推理(不仅是概率推理),以及像人类一样学习思考理解认知

最后,是超级人工智能(Artificial Super intelligence,ASI),即:一个模型可以产生自我觉知、自我改进、自我创造,并具有超越人类智能水平的推理能力,以及与人类相同或完全不同的“自我意识”

那么,以自我意识为分界点,则可以分为:弱人工智能(Weak AI)与强人工智能(Strong AI)——前者没有人类水平的自我意识,后者拥有同等及超越人类水平的自我意识

值得指出的是,有智能不一定有意识,甚至有超级智能也不一定有自我意识,相反有意识一般都有智能,但自我意识可以兼容从低级到高级的不同智能

因为,智能需要学习训练,意识(很可能)需要递归自指(即递归构成自我指涉的结构)——所以,有强意识但不学习,智能也不会高,有强智能但没自指,意识也不存在。

例如,在无自我意识(或极其减退)的状态下,我们仍可以运用智能,如:心流的创造与冥想的智慧。

大模型

可以看到,目前的“大模型”,如ChatGPT(背后是GPT-3.5或GPT-4),已经处在了专用智能通用智能之间的水平,即:越过专用,仍不通用。

而类比人脑来看,要达到通用智能,就不能仅处理生成语言文本信息——因为,不同类型的任务必然会涉及到不同形式的信息,如文本、图片、视频等,而人脑就是综合处理多种感官信息的典范,如视觉、听觉、嗅觉等。

所以,在通向通用智能的道路上,大模型自然需要实现——多模态(Multi-Modal)与跨模态(Cross-Modal)。

所谓模态(Modal)——简单来说,就是不同模式下的特定状态,如:不同的交互界面就是不同的模态、不同的感官体验就是不同的模态、不同的沟通方式就是不同的模态,甚至开机与关机,清醒与睡眠,站立与奔跑也都是不同的模态。

那么,多模态——就是可以处理不同形式的输入信息,如:文本、图片、视频,以及传感器信息等;跨模态——就是可以在不同形式的信息之间相互转换,如:文本转图片、视频转文本、图片转视频,以及传感器信息建模环境等。

例如,人类看电影再写影评,前者是多模态处理电影的字幕、画面、声音,后者是跨模态转换电影为影评文本。

类比人脑来看,人类的心智模型其实是一个动态演化“世界模型”(World Model),它映射了我们所认知世界的万事万物与方方面面——可以说,它就是人脑的“生物大模型”,其包含了各种各样相互关联的“子模型”,如:认知模型、思维模型、记忆模型、感知模型、计算模型,等等。

由此可见,“机器大模型”中其实也会隐藏有大量的“子模型”——等待着被塑造、发掘与调用,这需要向其正确地“输入咒语”(Prompt),就像人脑通过输入信息来塑造、发掘与调用心智模型一样。

当然,“世界模型”源自“世界知识”(World Knowledge)的建构,后者包括——经验、常识、认知;事实、规律、理论;模式、秩序、规则,以及各种隐性知识,等等。

最后,“类脑大模型”的特点就是:大就是不同,快就是不同,又大又快,则“完全不同”——这对应了物理学上的“多即是不同”(More Is Different),以及复杂性科学上的“涌现”(Emergence)。

参看:More Is Different(论文PDF)

规模

对比人脑大模型,来看:

第一,人脑的智能水平,不仅在于其参数规模,还在于其训练质量,即:再有天赋的大脑,如果没有高质量的“输入信息”,也就没有高质量的“输出信息”

这意味着,大模型的规模增长,会存在边际效用递减,即在一定规模之后,必须要有高质量的“大数据”投喂训练,才能继续迭代进步。

第二,人脑负责智能思考的大脑皮层(运行理性思维与感性思维),大约有140~160亿个神经元,每个神经元大约有7000个连接,每个连接位置都有一个突触,每个突触都是一个可调整连接强度的权重参数,即:人类智能的参数规模,大约是100万亿的数量级。

这意味着,大模型的规模,达到100万亿参数的数量级时,就有可能涌现出人类水平的通用智能

参看:维基百科神经元(成年人约有100~500万亿个突触连接)

注意,权重是一种特殊的参数,不是所有的参数都是权重,一般有影响力的参数权重,而所有的参数都可以通过设定或学习来改变。

例如,在数学函数中,常量是参数,变量的系数是权重——对于线性函数f(x) = wx b来说,x是变量(提供图像信息)、w是权重参数(改变图像形状)、b是偏置参数(改变图像位置)。

例如,在神经元连接的突触中——变量是神经递质的种类与比例(传递信息),常量是前膜递质储备量与后膜受体储备量(控制强度),并且这个常量是具有可塑性的,所以是可调整的权重

第三,人脑进行学习训练的过程中,培养锻炼推理思辨的能力,是提高智能水平的关键,而这需要通过逻辑思维的训练来达成,如解题与编程。

这意味着,大模型可以使用“先喂代码、再喂数学”的方式,来渐次提高其内在的智能水平——因为这两者的“语言系统”,即数学语言与编程语言,都内含了严谨完备自洽的逻辑性,并用于书写人类最高质量的“逻辑信息”

最后,一个神经元,既是“计算晶体管”又是“计算方程组”,而每个连接的突触都是一个方程参数,那么一个“神经元方程组”就大约有7000个方程参数。

而对比来看,大模型的计算晶体管在“硬件芯片”上,其计算方程组在“软件程序”上——这意味着,大模型的智能算力是可以分离开的,即:“智能软件”可以复制到不同的“算力硬件”上,并发挥不同程度(上限以下)的智能水平

那么,对于大模型粗略来说,其隐藏层的维度,就相当于神经元的数量,而每个神经元又会连接其它所有神经元,即:每个神经元的连接数为层的维度,每层之间的参数量为维度的平方

隐藏层(Hidden Layer)——是指位于输入层和输出层之间的,一系列不同功能的神经元(或说函数),其功能:是对输入进行加权计算并生成输出;其作用:是对输入进行特征提取与抽象表示,并输出隐藏在输入中的结构与规律,以支撑分类与预测。

例如,GPT-3大模型,其隐藏层的每层维度是12288,即:一个神经元有12288个参数,每层传递12288^2约1.5亿参数——注意,GPT-3的隐藏层内部,还有各种的功能子层学习参数,并没有统计进去。

参看:GPT-3的论文(Language Models are Few-Shot Learners)

而类比来说,一个函数就是一个神经元,函数的输入就是神经元的参数,神经元的连接,就是一个函数的输出,作为另一个函数的输入——但这个函数输入,必须是可学习调整权重参数,否则只是数学上固定计算的公式参数。

例如,GPT-3大模型,总共有1750亿个参数,以及96层且每层约有12个学习函数——词嵌入1个变换、位置编码1个变换、自注意力3个变换、多头自注意力1个变换、前馈网络2个变换、归一化2个变换、输入输出2个变换——所以,平均每个神经元(即变换学习函数)的连接参数,约有1750亿 / (96 * 12) ≈ 1.5亿。

顺便一提的是,隐藏层的“层数”,就是神经网络的“深度”,所以称之为“深度学习”(Deep Learning),而大模型学习到的知识及能力,就存储在隐藏层的“神经元参数”之中——因为这些参数,在数学空间约束了信息排列组合的方式,从而建构出了特定的语义逻辑

最后,我们也要考虑到,超大规模的不同复杂结构,对于涌现力的不同参数阈值,即:大模型在“结构优化”上,可能不需要达到人脑的参数规模,就可以涌现出人脑的智能水平

原理

简化来看,人类智能 = 神经网络 人类语言 强化学习。

其中,神经网络结构规模支撑了后两者,而人类的强化学习则包括了——微观多巴胺主导的反馈式趋利避害,宏观经验者施予的反馈式纠错指导,以及沐浴在人类文明千百年所积累的高质量信息之中。

人类语言包括了,自然语言人工语言,后者如:数学语言、编程语言与逻辑语言,以及旋律语言、镜头语言、建筑语言、设计语言、色彩语言、交互语言、肢体语言,等等等。

由此可见,语言模型 强化学习,就是“开关网络”模拟人类智能的两大基石,其它的都只是工程技术的细节。

那么,人脑中其实有很多思维模型,一些是本能先天内置的,一些是智能后天学习的,这些思维模型是智能的快捷方式,但也会限制智能对信息的排列组合,即也限制了想象力创造力,可谓是一把“双刃剑”

大模型从人类语言中,就可以学习到人类的各种思维模型,这不仅会使它更接近人类思维,也会使它受限于人类思维——因此,要想大模型可以获得更多的人类智能,而不是人类本能,就需要投喂更多的“逻辑信息”,而不是“情绪信息”

当然,智能高不代表就可以理解人类——类似于高智商难以理解非理性行为——如果投喂大量人类的“情绪信息”,想必大模型就会学习到人类的“情绪化”。

那么,要想大模型的输出,符合人类要求及需求的价值观世界观偏好预期,就需要它从人类的交互反馈中去学习迭代,即:人类反馈式强化学习——这也被称为大模型“人类对齐”(Human Alignment),即:大模型与人类的“价值对齐”

人类反馈式强化学习(Reinforcement Learning from Human Feedback,RLHF)——是用人类评价作为奖惩规则,来驱动智能体强化学习,来更新自己的行为策略

当然,更高效的方法是,利用人类的奖惩反馈,训练出一个奖励模型,并把这个奖励模型作为一个奖励函数,来指导智能体的强化学习——这其实是在利用一个人工智能来给另一个人工智能提供反馈指导,即:人工智能反馈式强化学习(Reinforcement Learning from AI Feedback,RLAIF)。

显然,人工智能模拟人类智能的关键,是要从人脑上寻找“灵感”——因为,人脑是演化“试错跑通”的成功范本,而人脑的核心内涵,是其在物理学、生物学、脑科学及心理学上运作的“数学模型”

从某种角度说,物理学——可以看到宇宙的底层逻辑,即能量转化生物学——可以看到人类的底层逻辑,即生命演化;这两条线,一个是能量一个是生命,就是这个世界的“第一原理”,而结合这两者,就可以看穿一切——再来点数学,就可以跨越高维宇宙以及平行宇宙

或许,所有的现实,都可以用物理学(第一原理)与生物学(迭代试错),来双线叙事——当然,化学是技术细节。

架构

结合前文来看,大模型的能力来自于——规模、架构、训练,对于GPT大模型来说,其字母T就代表了——Transformer(转换器)架构。

那么,对比Transformer架构人脑运作,就会发现一些关于人类智能的——有趣线索机制

第一,概括来看Transformer的结构,即:输入信息 => 编码 => 解码 => 输出信息。

这里使用“先编码再解码”来处理信息,是为了可以对信息进行“数学计算”,进而得出输入信息“统计概率”,而这可用于输出信息“概率预测”,或说“概率推理”

在数学上,这个过程可以理解为——先将输入信息映射到高维数学空间,再对信息与模型之间的复杂关系进行数学计算,最后把数学空间高维关系转化为输出信息

事实上,人脑也会对感官信息,在神经网络中进行(抽象来看):

其中,编码是将信息转换成电化学信号,解码是将电化学信号翻译为体验,转码是不同形式的编码。

例如,我们用语言描述体验,或是通过语言产生体验,都涉及到人脑对语言的编码解码

第二,概括来看Transformer的流程(省略技术细节),即:

参看:Transformer论文(Attention Is All You Need)

参看:Transformer架构(The Transformer Architecture)

参看:Transformer图解(The Illustrated Transformer)

从提出Transformer的论文标题——“注意力就是全部的魔法”(Attention Is All You Need)可见,注意力机制就是这个架构(支撑GPT大模型)产生强力效用的核心所在。

那么,所谓自注意力(Self-Attention)——就是计算出词向量之间的距离关系,即相关关系的依赖强度,包括每个单词(含标点符号)与其它所有单词的注意力关系,它代表着一种视角下的注意力分布,或说权重分布

词向量(Word Vector)——是指标记转换成的向量。

词嵌入(Word Embedding)——是指将标记嵌入到向量空间,即转换成词向量

标记(Token)——是指文本被分割成的基本单位,即:1 token ≈ 4个字符 ≈ 0.75个单词 ≈ 2个汉字。

多头注意力(Multi-Head Attention,MHA)——就是计算出词向量之间不同类型的关系,即每一种关系对应一种注意力,如语法规则、词汇搭配、短语从句、语义内涵、对象联系、实体逻辑等等,也就是每个“头”关注向量序列中,不同位置之间的逻辑关系。

例如,GPT-3大模型,拥有96头注意力,每头注意力128维,权重矩阵为128 x 12288(列维度与词向量维度对齐)——这意味着,每头注意力关注词向量的某方面,有128维(12288 / 96)的学习参数,即:词向量乘以权重矩阵的结果是128维,而96头注意力关注同一个词向量,就会有96个128维的结果,那么拼接所有注意力的结果,其输出维度(96 * 128 = 12288)刚好与词向量一致。

从数学角度来看,多头注意力可以在向量空间,捕捉单词之间不同角度的依赖关系,尤其是长距离上,如跨越句子段落上下文范围内的模式关系,据此就可以构建出全面深刻数学模型,即:在向量空间全面理解输入信息。

事实上,人脑运用人类智能的过程,就会不断控制注意力,去关注不同信息之间的不同关系,同时提取它们的抽象特征,进行不同层面的连接推理——反向,某些信息以及某些连接,也会主动引起我们更多的注意力,从而推动我们的推理整合

例如,注意力可以让我们关注,在时间线与空间线上完全不同的事物,然后排列组合它们之间的抽象特征,这其实就是创新创造的源泉。

顺便一说,我们注意力的转移概率,应该是取决于一个颅内信息,所激发的神经脉冲的强度与范围——也就是说,一个信息越是能激活更强更多的神经连接,就越是能吸引我们的注意力,以及维持我们的注意力

第三,除了注意力之外,Transformer架构还有两个类脑特性,即:堆叠与非线性。

对于堆叠来说,Transformer的编码器解码器,都是多个串联堆叠的,即前一个的输出是后一个的输入。

需要指出的是,GPT-3大模型虽然基于Transformer架构,但它并没有编码器,只有解码器,一共堆叠了96层——由此可见,重要的是自注意力机制(Self-Attention),而不是解码器使用编码器的特征向量,因为两者的功能结构一样,解码器能够通过堆叠隐含编码器的效用。

参看:维基百科GPT-3

参看:GPT的结构(Language Understanding Paper,PDF)

事实上,人脑的高级功能,也是依靠神经元堆叠来实现的。

例如,视觉皮层通过堆叠六个层,来提取整合不同的视觉特征,即:每层针对一种或多种特征信息进行提取(如边缘、方向、颜色、亮度等),然后传递给后续一个或多个层进行整合(如形状、深度、运动、空间等),最后融合成复杂丰富的视觉感知

参看:维基百科视觉皮层

值得指出的是,人脑视觉的堆叠处理,可以一个层输出给多个层(多个层不一定连续),或多个层可以输入给一个层——如:某种视觉信息可以穿过三个层,进而实现渐进的复杂处理,以及一个层可以同时处理三种视觉信息——其功效就在于,视觉信息可以被渐次提取不同角度特征信息,并且这些特征信息还可以进行不同维度连接组合联结融合

细想就会发现,Transformer的自注意力机制,就能够在向量空间,进行长距多维连接,同时自注意力层的堆叠,则能够在向量空间,进行长距多维联结——那么结合这两者,就能够从局部到整体,获得有丰富内涵的特征信息

对于非线性来说,Transformer的每个自注意力层都会输出到一个前馈神经网络层(Feed-Forward Neural Network,FFNN),也就是每个编码器解码器都有一个前馈神经网络,而其内部也是一个三层堆叠结构,即:

那么,前馈神经网络的作用,就是负责在高维数学空间提取整合特征向量——也就是,捕捉更深入丰富的逻辑信息、连接更复杂隐藏的语义关系、生成更准确连贯的输出信息——而其中的非线性层,就是多层网络强大功能的关键所在。

对此,图灵奖得主、卷积神经网络之父——杨立昆(Yann LeCun),在《科学之路》中,指出:

“网络,就是这样由两种类型的层交替形成的,即:执行加权和线性层和应用激活函数(即非线性函数)的非线性层。……这两个连续的操作构成了一个单元,即一个神经元,也就是说,一层线性函数接连着一层激活函数即可构成一层神经元。……许多定理表明,由「线性、非线性、线性」堆栈组成的网络是一个「通用逼近器」:如果中间层具有足够多的单元,它就能无限地逼近我们预期的函数。”

线性层——每个输出都是输入的线性变换,如加权求和。

非线性层——每个输出都是输入的非线性变换,如平方函数、指数函数。

而类比人脑来看,神经元在接收信号后,会进行“整流”(Rectification)操作,即在信号强度达到一定阈值时,才会激活自身传递信号给下一个神经元——这种非线性神经元行为,可以通过非线性激活函数(即决定是否激活输出到下一层的函数)来模拟实现,如:整流线性单元(Rectified Linear Unit,ReLU)。

ReLU函数为:f(x) = max(0, x),其中x表示输入信号,当x大于0时,函数返回原始值,当x小于等于0时,函数返回0。

可见,正是通过模拟人脑的——堆叠非线性,从而才进一步增强了——Transformer的表达能力训练效果

第四,Transformer架构的预测输出,是一次一个词(即一个词向量),而每次预测的输入,都是已经预测输出的全部词汇,以及加上原始输入。

这种自回归(Autoregressive)预测,自增了上下文信息,并不断(通过注意力)审视挖掘上下文中的连接关系,同时在整个向量空间(知识库)中,不断根据上下文的注意力分布(权重分布),连接匹配最优的预测概率,即:前者是构建局部连接,后者是构建整体连接,最终连接分布(连接匹配各种分布)则决定了预测质量

类比人脑来看,在神经网络中,词汇会与记忆逻辑感受相关联,即:一个词语会激活相关的记忆,也会激活相关的感受,而词语的语义则会激活逻辑,从而影响甚至改变感受——同时这些记忆、逻辑、感受,又会连接更多的记忆、逻辑、感受,直到神经脉冲衰减至静默状态

例如,追问为什么就是寻找逻辑性,这个逻辑可以影响改变我们的感受

所以,人脑不是直接预测一个词或一句话,而是在记忆空间,通过词汇激活感受感受匹配词汇,以此循环,并在语义逻辑的反馈调整下,最后形成感受最恰当的表达——而这个感受表达就隐含了人脑的心智预测

具体来说,感受记忆空间连接词汇,会有多个备选,每个备选都会对感受产生不同的作用——有些强化、有些弱化、有些调整、有些改变——此时逻辑会约束感受感受会引导逻辑,两者相互影响校准,共同对词汇进行排列组合,以输出融合统一的感受、语义与逻辑。

例如,阅读或收听,即连词成句的过程,会不断根据词汇产生感受、根据语义产生逻辑、根据逻辑调整感受,最终统整出相协调的感受逻辑——相当于编码出感受逻辑

例如,说话或书写,即遣词造句的过程,会不断根据感受匹配词汇,根据逻辑监督语义、根据感受引导逻辑,最终表达出相统一的感受逻辑——相当于解码出感受逻辑

例如,遣词造句的优化,可以在语句的局部或整体,反复连词成句,以校准或调整感受逻辑,进而迭代词汇语义——相当于循环解码提高表达质量。

简而言之,人脑是根据感受记忆空间寻找最优的预测,即感受主导了我们的思考、思维与思想,而最终的预测则混合了本能智能的心智逻辑。

这其实也佐证了,人脑所固有的一个本能偏差,即:总是根据感受想法,根据想法观点,根据观点理由——如先入为主、后见之明、强加因果、自利解读、利己解释等,都是基于感受运作的结果——相反,想要基于逻辑来预测,则需要刻意练习用认知对抗感受才行。

第五,Transformer架构的技术细节,肯定仍有很多缺陷和改进空间,但也必然走在了正确的方向上。

那么综上可见,正确模拟人脑的关键要素就是——多头注意力、高维向量空间、堆叠、非线性。

有趣的是,人脑在不同层次的神经回路中,拥有循环结构可以对信息循环处理,以及递归能力(递归是一种特殊的循环),即使用相同的规则模式重复处理嵌套结构,并且侧重于分布式表示并行计算——其中,递归似乎带来了意识,而意识则串行了分布式并行

值得思考的是,Transformer架构并没有循环,即信息流只能单向处理,这也是前馈网络中“前馈”(Feed Forward)的内涵所在——不过,从效用角度来看,前馈网络的堆叠,似乎充当了循环的作用,即:每堆叠一层就相当于循环一次

或许,我们应该给大模型加入——循环结构递归调用,即:递归整合并行形成中心化的信息共享处理的循环结构

最后,人脑与大模型的同构性,即都是一台“预测机器”

百科

More+
首页/电脑版/网名
© 2026 NiBaKu.Com All Rights Reserved.