AI 真正的进化史:今天的一切,究竟是谁铺出来的
作者:Havenlon Labs
如果只从今天回头看,人工智能很容易被理解成一件突然发生的事:2012年AlexNet在ImageNet竞赛中大幅领先,2016年AlphaGo战胜李世石,2017年Transformer提出,2020年GPT-3展示出规模带来的能力变化,2022年底ChatGPT进入公众视野,随后多模态、推理模型与Agent接连出现。曲线看上去在最近十几年陡然上扬。
但把时间轴拉长,就会发现今天几乎每一项令人意外的能力,背后都有一条长得多的技术祖先链。在ChatGPT出现七十多年前,人类已经开始认真讨论机器能否表现出智能;在GPU被用来训练神经网络的几十年前,已经有人尝试把神经元写成可以执行逻辑运算的形式模型;在Transformer之前,研究者用了数十年处理梯度、记忆、表示、序列与注意力的问题;而在Agent开始调用工具、执行代码、操作浏览器之前,强化学习研究者已经追问了几十年另一个问题——一个主体如何从环境反馈中学会行动。
所以真正的AI进化史不是一部“谁发明了人工智能”的英雄史,它更像一条由许多人分段铺设、且彼此并不知道终点在哪里的长路。有人处理计算的问题,有人处理学习的问题,有人处理数据的问题,有人处理算力的问题,有人处理语言的问题;还有一些机构当时做的事情看起来与人工智能关系并不直接,却最终成为整个时代不可缺少的基础设施。
理解这条历史,重要的不是记住年份,而是理解:人工智能究竟一步一步跨过了哪些门槛。
一、1936—1950:在制造智能之前,人类首先必须回答“机器究竟能计算什么”
现代人工智能的故事很难绕开Alan Turing,但他的重要性并不只在于后来那个被称作Turing Test的设想。1936年提交、次年正式发表的《On Computable Numbers,with an Application to the Entscheidungsproblem》处理的是一个更根本的问题:能否构造一种足够一般的形式化机器,通过有限规则完成计算,并由此界定哪些问题原则上可计算、哪些不可计算。这项工作当时属于数理逻辑而非人工智能,但它为后来的软件、算法乃至机器智能提供了最底层的地基——如果一个过程能够被完全形式化,它就有可能被机器执行。
1950年,Turing在Mind发表《Computing Machinery and Intelligence》,开篇提出“Can machines think?”,随即指出“思考”一词很难得到无争议的定义,于是把这个哲学问题替换成一个可以观察的行为问题,也就是文中的Imitation Game。需要说明的是,Turing本人并没有使用“Turing Test”这一名称,它是后来学界对这一设想的通称,而且今天流行的简化版本与原文设定并不完全一致。Turing既没有证明机器拥有意识,也没有宣称能对话即有智能。他做的事情更基础:把一个长期属于哲学的问题,转换成了可以由工程和实验讨论的问题。
与此同时,另一条更直接通向神经网络的线索也已出现。1943年,神经生理学家Warren McCulloch与逻辑学家Walter Pitts发表《A Logical Calculus of the Ideas Immanent in Nervous Activity》,把神经元抽象为具有阈值和开关性质的理想化单元,并论证由这类单元构成的网络可以表达命题逻辑中的运算。这不是今天意义上的神经网络——模型中没有学习机制,权重也不会调整——但神经活动第一次被抽象为一种可以执行逻辑计算的形式模型,并由此表达出一种后来反复出现的思想:复杂的认知行为未必需要某个神秘的“智能核心”,而可能来自大量简单单元之间的连接。
Claude Shannon的信息论、von Neumann参与推动的存储程序计算机结构以及早期数字计算机的工程进展,则从另外的方向完成了条件准备。他们并不是人工智能的创始人,但正是在这一时期,“计算”“信息”“逻辑”“神经活动”第一次被放进同一个可以数学化讨论的世界。
本章金句:AI的第一步不是让机器拥有智能,而是让人类开始相信——智能的一部分,也许可以被形式化。
二、1955—1956:人工智能被作为一个独立工程目标提出
“Artificial Intelligence”成为一个明确的研究项目,发生在1950年代中期。1955年8月31日,John McCarthy、Marvin Minsky、Nathaniel Rochester与Claude Shannon联合提交了《A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence》。当时McCarthy在Dartmouth任教,Minsky在Harvard,Rochester来自IBM,Shannon来自Bell Labs;“Artificial Intelligence”这一提法通常被认为由McCarthy在筹备过程中选用,部分原因是为了与当时已有的cybernetics等方向区分开来。
提案中真正重要的不是名字,而是那个大胆的假设:学习的每一个方面以及智能的其他特征,原则上都可以被精确描述到机器能够模拟的程度。研究者希望让机器使用语言、形成抽象与概念、解决当时只有人类能解决的问题,并改进自身。以此为基础的Dartmouth Summer Research Project于1956年夏天举行,参与者陆续来去,会期内并没有诞生某个决定性成果,它之所以被视为人工智能作为独立研究领域的重要起点,更多来自它确立的议程和人际网络,而不是某一天发生的“正式发明”。
今天重读这份提案会有一点恍惚:七十年前列出的语言、抽象、概念、问题求解与自我改进,几乎完整地出现在今天大型语言模型和Agent的研究议程中。只是最初的研究者对解决这些问题所需的时间,远比现实乐观。
这一时期也形成了后来被称为Symbolic AI的传统。Allen Newell、Herbert Simon与J.C.Shaw在1955—1956年前后完成Logic Theorist,使程序能够证明《Principia Mathematica》中的部分命题,并在Dartmouth会议上展示;随后他们发展出General Problem Solver,把手段—目的分析作为一种通用的问题求解策略。McCarthy则推进形式逻辑与知识表示,并在1958年前后设计LISP,其奠基性论文于1960年发表在Communications of the ACM。这条路线的基本信念是:如果智能活动可以分解为符号、规则、搜索与逻辑推理,机器就有可能通过操作符号产生类似智能的行为。
把Symbolic AI描述成“失败的旧路线”并不准确。搜索、规划、知识表示、自动定理证明、约束求解,乃至今天一些Agent系统中的planner,都能看到这条传统的延续。它真正遇到的困难在于:现实世界的复杂性远远超过人类能够显式写出的规则数量。机器可以执行规则,真正的难题逐渐变成——规则从哪里来?
本章金句:第一代AI试图把人的智能写进机器,此后整个历史却缓慢转向另一条道路——让机器自己从世界中学出来。
三、1957—1969:Perceptron提出了一种新的知识来源
这条路线最重要的早期人物之一是Frank Rosenblatt。1957年,他在Cornell Aeronautical Laboratory的技术报告中提出Perceptron;1958年在Psychological Review发表《The Perceptron:A Probabilistic Model for Information Storage and Organization in the Brain》,随后主持建造了Mark I Perceptron这一硬件实现。模型本身今天看来非常简单:输入经过加权求和,依据阈值产生输出,并根据错误调整权重。但它代表的范式变化很重要。
传统程序中,知识主要由程序员显式写入:
Human Rules→Program→Output
Perceptron代表的路径则是:
Data+Error→Weight Update→Behavior
两者都运行在计算机上,但知识来源完全不同。前者告诉机器答案应该如何得到,后者允许机器通过样本逐步调整内部参数,也就是learning from examples。
当时的媒体报道确实存在明显夸张。1958年围绕Perceptron演示的公开报道中,出现过这类系统将能够行走、说话、书写乃至具有自我意识之类的预期,这些说法远超研究本身的实际内容,也为后来的落差埋下伏笔。
现实限制很快出现。单层Perceptron所能表示的函数类型有限,当时既缺乏训练多层网络的成熟方法,也没有足够的算力和数据。1969年,Marvin Minsky与Seymour Papert出版《Perceptrons》,以数学方式系统分析了这类模型的表达能力边界,其中对异或等问题的讨论后来被广泛引用。
但后来流行的叙事——“一本书杀死了神经网络并制造了AI Winter”——并不严谨。这一时期AI遭遇的困难远不止Perceptron:1966年美国的ALPAC报告对机器翻译的实际进展给出负面评价并影响了相关资助;语音理解项目未能兑现承诺,导致1970年代中期DARPA相关经费收紧;1973年英国的Lighthill报告对AI研究的总体价值提出质疑,影响了英国的资金格局;同时算力与存储极其有限,许多项目在真实复杂环境中无法工作。神经网络研究在此后十余年相对边缘化,是学术注意力、方法瓶颈、算力条件与资助环境叠加的结果,不能简单归因于单一事件。
更值得记住的是一条此后反复出现的规律:一个思想在逻辑上成立,并不意味着它已经具备工程上成立的条件。
本章金句:很多技术并不是因为思想错误而失败,而是因为它比支撑它的时代早到了几十年。
四、1965—1980s:当通用智能太难,人类先把专家知识装进机器
神经网络退居边缘时,另一条路线开始产生现实成果:Expert Systems。
1965年前后,Edward Feigenbaum与Joshua Lederberg等人在Stanford启动DENDRAL项目,试图利用计算机从质谱数据推断有机分子结构,Bruce Buchanan、Carl Djerassi等人也是关键参与者。DENDRAL成为专家系统发展史中的代表性项目之一,并推动出一种影响深远的工程判断:一个系统的能力,很大程度上取决于它掌握多少领域知识,而不只取决于推理算法有多通用。这一取向后来被称为knowledge-based approach。
1970年代,Edward Shortliffe等人开发的MYCIN进一步展示了这种模式:在边界清晰的专业领域中,把专家经验编码为数百条规则,由推理引擎组合运用,并处理不确定性。1980年代,专家系统进入商业高潮,DEC使用的配置系统R1/XCON是被反复引用的案例。
这是AI历史上第一次重要的现实主义转向。早期研究者希望尽快解决通用语言与类人推理,工程实践却发现,暂时放弃“什么都懂”、让系统只在一个高度专业化的领域工作,反而更快产生价值。
但成功同时暴露出结构性问题:知识需要专家与工程师一条条获取和编码,规则数量增加后一致性维护越来越困难,现实中的例外不断出现,系统本身缺乏从新经验中自动更新知识的能力。当环境变化,唯一的办法是继续手工修补。1980年代末,随着专用硬件市场萎缩与商业预期回落,这一波热潮明显降温。
专家系统证明了知识的重要性,却没有解决知识如何自动获得的问题。这个问题最终又把AI拉回了learning。
本章金句:专家系统证明知识能够产生智能,也让人类看清——真正昂贵的不是推理,而是把整个世界提前写成规则。
五、1986:机器开始学习自己的内部表示
1986年是现代神经网络史上的关键节点。David Rumelhart、Geoffrey Hinton与Ronald Williams在Nature发表《Learning representations by back-propagating errors》,系统展示了用误差反向传播训练多层网络的做法:输出与目标之间产生误差,误差信号沿网络反向传播,据此调整连接权重。
这里必须严谨。Backpropagation并非1986年才第一次出现。其数学核心是链式法则在多层复合函数上的反复应用,相关思想在控制论与最优化领域早有前身,例如1960年代Henry Kelley与Arthur Bryson等人在最优控制中的工作;Seppo Linnainmaa在1970年的硕士论文中给出了后来被称为reverse-mode automatic differentiation的一般方法;Paul Werbos在1974年的博士论文中提出把这类方法用于神经网络;1980年代中期David Parker与Yann LeCun也各自给出过相近结果。
1986年这篇论文的历史意义,不在于发明了一个算法,而在于它在connectionist与神经网络社区中产生了巨大影响,使这一训练方法被广泛接受和使用,并且清楚地展示了一件事:当多层网络通过误差训练时,中间的hidden units会逐渐形成对任务有用的内部特征表示。
这意味着范式的更深变化。传统计算机视觉中,工程师需要告诉机器什么是边缘、角点与纹理;传统语言处理中,研究者需要手工设计特征。而如果网络能自己学出中间表示,机器就不只是在学最终答案,而是在学应该怎样表示这个世界。Representation Learning由此成为现代深度学习的思想核心之一。
Geoffrey Hinton、Yann LeCun、Yoshua Bengio此后几十年的工作都可以放进这条脉络理解,但三人的贡献并不相同。LeCun在1989年将卷积结构与反向传播结合用于手写数字识别,并在1998年的LeNet-5工作中形成较完整的CNN方案;Hinton长期研究分布式表示、玻尔兹曼机与多层网络的学习机制,2006年前后关于深层网络逐层训练的工作重新激起对深度模型的兴趣;Bengio在神经语言模型方面推进较早,2003年发表的《A Neural Probabilistic Language Model》是用神经网络学习词的分布式表示与语言模型的重要工作。2018年的ACM Turing Award授予三人,表彰他们使深度神经网络成为计算领域的关键组成部分。
真正值得记住的不是“三巨头”这个称号,而是他们在长期非主流的处境下共同坚持的一个判断:世界中重要的特征,不一定需要由人类提前定义。
本章金句:深度学习改变的不只是机器如何得到答案,而是机器开始自己决定——世界应该被表示成什么。
六、1980s—1990s:另一群研究者在追问机器怎样学会行动
与此同时,另一条在“大模型发展史”中常被略过、却对今天的Agent极其重要的路线正在成熟:Reinforcement Learning。
监督学习的问题通常是:给定输入与正确答案,学习两者之间的映射。强化学习面对的问题不同:一个主体进入环境,采取行动,环境返回新状态与回报,主体必须从可能长期延迟的结果中判断,过去哪些行动是好的。这里同时包含credit assignment与exploration–exploitation两个困难。
Richard Sutton与Andrew Barto是这条路线最关键的奠基者。1983年,Barto、Sutton与Charles Anderson的工作确立了后来被称为actor–critic的结构;1988年Sutton在Machine Learning发表《Learning to Predict by the Methods of Temporal Differences》,系统讨论如何利用相邻预测之间的差异进行学习;1989年Christopher Watkins在博士论文中提出Q-learning,并与Peter Dayan在1992年给出收敛性证明;1998年出版的《Reinforcement Learning:An Introduction》成为这一领域的标准教材。2025年3月5日,ACM宣布将2024年A.M.Turing Award授予Barto与Sutton,表彰他们为强化学习建立概念与算法基础。
这条路线的意义在今天格外清晰。一个模型会识别猫、会翻译语言、会预测下一个词,并不等于它能在现实中持续行动。行动意味着状态会改变,前一个动作会影响后一个动作,回报可能延迟,而模型必须面对自己行为造成的新环境。AI的问题因此从What is this?扩展到What should I do next?
这条路线后来与深度神经网络汇合,成为DQN、AlphaGo以及许多决策系统的重要基础。
本章金句:预测让机器理解世界的统计结构,强化学习则开始系统追问——机器如何为自己行动的后果负责。
七、1997:LSTM让神经网络更认真地面对时间
对语言、语音以及任何连续过程而言,还有一个长期存在的困难:记忆。前馈网络处理完一次输入就结束了,但语言的含义依赖上下文,时间序列依赖过去,句子开头的内容可能在很久之后才决定某个词的意义。为此研究者发展了recurrent neural network,希望让网络保留过去的状态。
然而训练RNN会遇到梯度在时间上反复相乘而衰减或爆炸的问题。Sepp Hochreiter在1991年的毕业论文中对这一现象作了系统分析,Yoshua Bengio等人1994年的论文也从理论上说明了用梯度下降学习长期依赖的困难。
1997年,Hochreiter与Jürgen Schmidhuber在Neural Computation发表Long Short-Term Memory,提出带有门控机制的记忆单元,使误差能够在更长的时间跨度上保持相对稳定的回流。后续工作继续改进这一结构,例如Felix Gers等人在2000年前后引入forget gate。
需要准确表述的是:LSTM显著缓解了长期依赖的训练困难,扩展了可处理的时间跨度,但并没有“彻底解决记忆问题”,它在极长依赖、并行效率等方面仍有明显限制。即便如此,LSTM在此后十余年支撑了语音识别、机器翻译与大量序列建模任务,是当时最实用的方案之一。
Transformer之后,LSTM不再处于生成式AI的中心位置,但它处理的是智能系统一个根本问题:过去如何继续存在于现在。
本章金句:没有记忆,机器只能处理一个个孤立的瞬间;能把过去带进现在之后,它才开始面对序列世界。
八、2006—2012:算法、数据与算力第一次同时跨过阈值
如果AI史只按论文写,会漏掉一家公司:NVIDIA。
GPU最初是为图形计算设计的硬件。2006年11月,NVIDIA随G80架构公布CUDA,使开发者能够用接近C的方式编写运行在GPU上的通用并行程序,而不必再把计算伪装成图形操作;首个公开SDK于2007年初发布,CUDA 1.0在2007年正式推出。因此“2006年推出、2007年正式发布”这两种说法并不矛盾,前者指架构与编程模型的公布,后者指正式版本的交付。
这件事当时并不是为了训练语言模型。但神经网络的核心计算恰好是大规模矩阵与向量运算,天然适合大量简单计算单元同时工作的结构;GPU的高并行度与高内存带宽,使原先需要数周的训练缩短到可接受的范围。一个为图形世界演化出来的处理器,就这样成为神经网络训练的合适平台。CUDA并不是为ChatGPT准备的,但它让此前只存在于论文中的模型规模变得工程可行。
另一边,数据条件也在变化。2009年,Jia Deng、Wei Dong、Richard Socher、Li-Jia Li、Kai Li与Fei-Fei Li在CVPR发表《ImageNet:A Large-Scale Hierarchical Image Database》。论文报告当时的ImageNet已包含约5247个synset、约320万张按WordNet层级组织的图像,并计划扩展到数千万张;大规模人工标注依托众包完成。Fei-Fei Li在这一项目中起到关键推动作用,但ImageNet是一项团队工程,其规模来自众多研究者与标注者的持续投入。2010年起举办的ImageNet Large Scale Visual Recognition Challenge(ILSVRC)则提供了统一的评测标准,这一竞赛持续到2017年。
ImageNet真正改变的是研究问题的尺度。此前视觉算法可能只在几千、几万张图像上验证;此后研究者第一次拥有足够庞大且结构化的数据,可以检验模型能否从大规模现实样本中学到视觉表示。
到2012年,三个长期独立发展的条件同时成熟:可训练的深层网络、足够大的数据集、足够强的并行计算。Alex Krizhevsky、Ilya Sutskever与Geoffrey Hinton的AlexNet在ILSVRC-2012上把top-5错误率降到15.3%,而第二名约为26.2%。该网络包含五个卷积层与三个全连接层,约6000万参数与65万个神经元,使用两块GTX 580 GPU并行训练,并结合了ReLU、dropout与数据增强等做法。
AlexNet的意义因而不只是一篇效果更好的分类论文。它让一种工程判断变得可信:如果模型能够自己学习表示,那么数据规模与计算规模本身就可能成为能力变量。深度学习从此不再只是一小群研究者坚持的学术路线。
本章金句:2012年被证明的不是某种网络突然变聪明,而是算法、数据与算力一旦同时越过阈值,能力可以被工程化地放大。
九、1997与2016:从搜索到学习,从感知到决策
2012年之后,深度学习首先征服的是感知问题:识别图像、理解语音、处理文本。DeepMind则试图把另一条历史路线接进来——Deep Learning与Reinforcement Learning的结合。
在此之前,机器在博弈上的代表性胜利来自另一种技术传统。1997年5月,IBM的Deep Blue在六局比赛中以3.5比2.5战胜Garry Kasparov(1996年的首次对弈由Kasparov获胜)。Deep Blue依靠专用棋类芯片构成的大规模并行硬件、alpha-beta搜索,以及包含大量人工设计项、并借助特级大师对局调校参数的评估函数,同时配合开局库与残局库。把它简化为“纯暴力搜索”并不准确——它的评估函数相当复杂——但其中的知识主要由人类设计与调参,而不是从数据中学出来的。
2016年1月,David Silver等人在Nature发表《Mastering the game of Go with deep neural networks and tree search》。AlphaGo把policy network与value network同Monte Carlo Tree Search结合:先用人类棋谱进行监督学习,再通过自我博弈的强化学习改进策略,并训练价值网络评估局面,从而在搜索中大幅削减需要展开的分支。论文发表时,AlphaGo已在2015年10月以5比0战胜欧洲冠军樊麾;2016年3月与李世石的五局比赛以4比1结束,让公众第一次直观感受到这条路线的力量。DeepMind由Demis Hassabis等人创办,Silver是该项目的主要负责人之一。
AlphaGo的意义不在于“机器终于赢了人类”,而在于系统的判断能力越来越多来自学习而非人工编码。它不需要有人提前写完每种局面应当如何应对,而是通过棋谱、自我博弈与反馈不断调整策略。从AlexNet到AlphaGo,AI完成了一次重要跨越:Perception→Decision。
本章金句:改变世界的智能从来不只需要看懂现实,它最终必须在无数可能之中选出一个行动。
十、2003—2017:从词向量到Attention,机器学会动态决定什么值得关注
Transformer之前,自然语言处理已经走过很长的路。用连续向量表示词的思想有更早的前身,包括分布式表示、潜在语义分析等传统;Bengio等人2003年的神经概率语言模型把词向量与语言建模放进同一个神经网络框架;2013年Tomas Mikolov等人提出的word2vec因训练高效、效果直观而使word embeddings被广泛使用,但它更准确的定位是让这一思想规模化与普及化,而不是最早提出者。
2014年,Ilya Sutskever、Oriol Vinyals与Quoc Le的Sequence to Sequence工作展示了用多层LSTM把一个序列编码、再解码生成另一个序列的通用方法;同年Kyunghyun Cho等人也提出了类似的encoder–decoder结构。但这种设计有明显瓶颈:把整个源句压缩进一个固定长度向量,长句信息容易损失。
同年,Dzmitry Bahdanau、Kyunghyun Cho与Yoshua Bengio在《Neural Machine Translation by Jointly Learning to Align and Translate》中提出,让解码器在生成每个输出时对输入序列各位置计算权重,动态选取当前最相关的部分。选择性关注的思想在认知科学与更早的神经网络研究中已有多种形式,这项工作的主要历史意义在于,它成为现代neural attention在序列建模中最具影响力的早期工作之一,此后Luong等人的工作又给出了多种变体。
Attention的核心思想由此显现:处理复杂信息时,机器不必平等地记住一切,而可以根据当前需要决定哪些关系更重要。
2017年,Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N.Gomez、Łukasz Kaiser与Illia Polosukhin发表《Attention Is All You Need》,提出Transformer:完全以self-attention与前馈层构成,去掉recurrence与convolution,并用位置编码补充顺序信息。论文当时的实验主要针对机器翻译。
Transformer的成功不能只解释为“比RNN更聪明”。它在建模能力上的优势——任意两个位置之间可以直接建立联系,路径更短——固然重要,但同样关键的是它的计算结构:序列内的大量计算不再必须严格逐时间步串行,训练可以高度并行。当这种架构遇上不断扩大的GPU/TPU集群、日益成熟的分布式训练系统和更大的数据集时,一个正反馈循环开始形成。需要补充的是,self-attention的计算量随序列长度平方增长,这也是后来长上下文研究的主要动机之一。
本章金句:Transformer的关键不只在于它更会处理关系,而在于这种处理关系的方式恰好可以被大规模计算放大。
十一、2018—2020:问题从“如何解决一个任务”变成“能否先训练一个通用模型”
Transformer出现后,多个研究团队沿不同方向探索同一个问题:是否还需要为每个NLP任务单独训练一套模型?
2018年6月,Alec Radford、Karthik Narasimhan、Tim Salimans与Ilya Sutskever在《Improving Language Understanding by Generative Pre-Training》中提出GPT:先用大规模无标注文本训练自回归语言模型,再针对具体任务做监督微调。同年10月,Google的Jacob Devlin、Ming-Wei Chang、Kenton Lee与Kristina Toutanova提出BERT,用masked language model与下一句预测目标训练双向Transformer表示,并展示一个预训练模型经过较少的任务特定改动即可在多项基准上取得强结果。
两者的架构选择与训练目标不同——一个偏生成、单向,一个偏理解、双向——但它们共同指向同一个变化。AI的生产方式正在从:
One Task→One Model
转向:
Pretrain Once→Adapt to Many Tasks
这是一场工程组织方式上的改变。过去一家机构若需要情感分类、问答、摘要与实体识别,往往需要不同的数据、模型与训练流程;预训练范式成熟后,越来越多任务建立在共享的基础模型之上。模型由此开始从“工具”接近“基础设施”,Foundation Model的说法也在此后逐渐出现。
本章金句:基础模型改变的不是某一个任务的准确率,而是能力的生产方式——从一次性工程变成可以反复调用的底座。
十二、2020:Scale成为一个显式的工程变量
2020年1月,Jared Kaplan等人发表《Scaling Laws for Neural Language Models》。研究发现,在实验覆盖的范围内,语言模型的cross-entropy loss与模型参数量、数据量和训练计算量之间呈现相对稳定的幂律关系,且趋势跨越多个数量级。同年5月,Tom Brown等人发表《Language Models are Few-Shot Learners》,介绍了拥有1750亿参数的GPT-3,并展示模型在不更新参数的情况下,仅凭提示中的少量示例即可完成多种任务,这种行为后来被称为in-context learning。
这对整个工程体系的冲击很大。此前人们通常认为能力突破首先来自更聪明的新算法;scaling的研究提出了另一种可能:在已有一个足够有效且可并行扩展的架构之后,增加计算、数据与模型规模本身也可能系统性地带来能力提升。
但必须说明这类结论的边界。Scaling laws描述的主要是在给定设置下损失随资源变化的经验规律,它不保证任意能力都会随规模自动出现,也不意味着规模可以替代数据质量与算法改进。2022年,DeepMind的Jordan Hoffmann等人在Chinchilla工作中指出,此前的大模型在给定计算预算下普遍训练不足,参数量与训练token数应大致同比例增长;他们用700亿参数、1.4万亿token训练的模型在多项评测上超过了参数量更大的模型。这说明所谓scaling并非“越大越好”,而是需要在参数、数据与计算之间寻找配比。
尽管如此,一个结构性变化已经发生:算法仍然重要,但芯片、数据中心、网络带宽、分布式训练、数据清洗、训练稳定性与能源供应,都成为“能力”的组成部分。这也是NVIDIA从一家GPU公司走到产业中心的原因之一。
本章金句:Scale的意义在于,它把一部分能力提升从偶然的算法突破,转化成了可以持续投入并测量的工程变量。
十三、2017—2022:能力与可用性并不是同一件事
规模继续扩大后,另一个问题变得突出:模型的语言能力越强,并不等于它知道人真正想要什么。预训练模型的优化目标来自数据分布与预测任务,而不是“成为一个可靠的助手”。Alignment因此从相对边缘的议题进入核心工程链路。
利用人类反馈训练策略的思想也有其历史。W.Bradley Knox与Peter Stone在2008年前后的TAMER工作探索了用人类评价信号塑造智能体行为;2017年,Paul Christiano等人在《Deep Reinforcement Learning from Human Preferences》中展示了用人类对轨迹片段的成对比较训练奖励模型,再用强化学习优化策略的完整方案;2019年Daniel Ziegler等人将这一框架应用于语言模型微调,2020年Nisan Stiennon等人用它改进摘要质量。因此RLHF并非在某一年由某一家机构发明,而是在偏好学习、逆强化学习与人机交互等多条线索上逐步成形。
2022年3月,Long Ouyang等人发表《Training Language Models to Follow Instructions with Human Feedback》,即InstructGPT。流程包括三步:先用人工编写的示范数据做supervised fine-tuning;再收集标注者对同一提示下多个输出的偏好排序,训练reward model;最后用PPO依据该奖励模型继续优化语言模型。论文报告了一个常被引用的结果:在其提示分布上的人工评估中,13亿参数的InstructGPT输出比1750亿参数的GPT-3更受标注者偏好。需要注意的是,这一比较依赖于特定的提示分布、标注者群体与评估方式,反映的是输出是否符合人类偏好,而不是模型在所有能力维度上的全面优劣。
这个结果提醒整个行业:**Capability≠Usability。**模型更强,不代表它天然理解人的真实意图。
本章金句:能力衡量机器能做什么,对齐衡量它是否在做人真正要求的事,这是两个不同的问题。
十四、2022:ChatGPT改变的是接口
2022年11月30日,OpenAI发布ChatGPT。它并不是一种与此前完全不同的新神经网络,而是在GPT系列、instruction tuning、人类反馈与对话式交互等多条路线逐渐成熟之后,把这些能力以极低的门槛暴露给普通人。
以前使用AI往往意味着数据集、模型、代码、训练任务与专业团队;此后使用AI可以只是说一句话。这一变化容易被低估,因为它看起来不像技术突破。但技术只有在调用成本足够低时,才会真正进入社会结构。ChatGPT的历史意义,很大程度上在于它把几十年积累的机器能力,通过自然语言接口交到了大量非专业使用者手中。
本章金句:ChatGPT的突破未必是机器突然变聪明,而是几十年积累的能力第一次可以被任何人直接调用。
十五、2023—2026:从生成信息到产生行动
ChatGPT之后,模型能力迅速向多模态、长上下文、代码、推理与工具调用扩展,Agent成为被反复讨论的形态。
这部分必须保持克制。我们距离这些变化太近,今天看起来重要的模型名称、产品形态甚至公司格局,十年后未必仍在技术史主干上;正如1980年代一批炙手可热的AI公司最终没有构成长期主线一样。Reasoning Models、Multimodal Models、Tool Use与Agents之中,哪些是长期结构、哪些只是阶段性形态,还需要时间判断。
但有一个方向值得单独提出。过去大部分AI系统本质上停留在:
Input→Model→Output
即使输出很聪明,它主要仍在产生信息。而Agent形态更接近一个闭环:
Observe→Reason/Plan→Tool→Action→New State
模型可以调用搜索、数据库、程序、浏览器与各类系统接口。一次输出不再只是提供答案,而可能成为下一次调用、一次代码执行或一次系统状态变化的输入。AI因此开始跨过一条边界:Information→Execution。
这实际上把此前几十年的多条支流重新汇合:可计算性界定了机器能做什么;符号传统留下搜索与规划;神经网络解决从数据中学习;Representation Learning解决内部表示;LSTM与Transformer处理序列与关系;GPU与大规模数据使规模化成为可能;预训练把能力变成通用底座;人类反馈开始处理意图问题;而长期研究行动与反馈的强化学习,在这一阶段重新显示出它的位置。
需要说明的是,今天的Agent远未实现完全自主,其可靠性、错误累积与可控性仍是未解问题,本文也无意由此推出任何关于通用人工智能的判断。但问题的性质确实在变化。
本章金句:当AI的输出能够直接改变现实,问题就从“答案是否正确”扩展到“这个行动是否应该发生”。
十六、回头看八十年:AI从来不是一个人的发明
如果一定要在这八十年里找出一个“AI发明者”,大概率会失败。
Turing没有训练过神经网络;McCulloch与Pitts没有见过GPU;Rosenblatt不知道ImageNet;Rumelhart不知道Transformer;Hochreiter与Schmidhuber不知道ChatGPT。Fei-Fei Li与ImageNet团队建设那个数据集时,目标是推动视觉识别研究,而不是训练语言模型。NVIDIA推动CUDA时,面向的是通用并行计算和科学计算,不可能完整预见几十年后的AI数据中心。《Attention Is All You Need》的八位作者最初处理的是机器翻译,而不是一个能写代码、看图片、调用工具的通用助手。
GPT、BERT、AlphaGo、AlexNet也都不是从零开始的奇迹。每一次看似突然的突破,向下挖都是几十年的沉积:AlexNet之下是CNN、backpropagation、ImageNet与GPU;Transformer之下是分布式表示、word embeddings、seq2seq与attention;GPT之下是Transformer、语言模型、无监督预训练与分布式计算;ChatGPT之下又有GPT、instruction tuning、人类反馈与几十年强化学习留下的方法。
所谓革命,多数时候不是凭空发明,而是此前彼此独立发展的条件终于同时成熟。
因此这段历史更像几条河流汇入同一水系:计算理论让机器成为可能;符号系统让推理成为程序;神经网络让知识可以从数据中学习;强化学习让机器开始研究行动与后果;数据与计算基础设施让学习得以规模化;预训练与人类反馈让这些能力成为普通人可以直接调用的系统。而正在发生的Agent化,也许会加入第七条支流:Execution。
结语:AI真正进化的,也许一直不是“智商”
只看benchmark,人工智能的历史很容易被读成一条智力曲线:机器越来越会下棋、识图、翻译、答题、写程序、做数学。但从更长的尺度看,真正的演进发生在更深的地方。
最早,人类证明计算可以被机器执行;随后证明逻辑可以被机器操作;接着发现知识可以被机器学习;之后发现表示本身也可以被机器学习;再后来,机器获得了记忆、注意力与从环境反馈中调整行为的能力。GPU、大规模数据与分布式系统把这些算法推到人类无法手工设计的尺度;Transformer与Foundation Model让分散在无数任务中的能力进入同一个模型;人类反馈开始让能力靠近意图;而Agent正把这些能力从信息空间向现实延伸。
八十多年里,人类其实在不断把原本必须由自己明确编写和执行的认知过程交出去。最初我们亲自写每一条程序;后来不再写所有规则;再后来不再设计所有特征;然后不再为每个任务单独训练模型;今天我们开始允许模型自己分解问题、选择工具、组织步骤并产生行动。从rules到features,到representations,到tasks,再到reasoning与planning,并逐渐进入actions——这才是这段历史更值得记住的主线。它不是机器越来越“像人”,而是人类不断找到新的工程方法,把过去只能由人完成的认知过程,转换成可以被学习、组合与规模化的结构。
所以ChatGPT不是人工智能历史的开始,Transformer不是,深度学习也不是。它们更像一些罕见的汇合时刻:此前散落在数学、神经科学、计算机科学、芯片、数据、语言学与控制理论中的积累,在某个节点同时成熟,于是世界在很短时间里看到一次能力跃迁。
这也解释了为什么真正的技术变革在发生之前往往很难被看见。站在历史现场的人通常只能看到自己正在解决的那个小问题:Turing在研究可计算性,Shannon在研究信息,Rosenblatt在研究Perceptron,Hinton在研究网络如何形成内部表示,ImageNet团队在建设一个更大的视觉数据集,NVIDIA在制造更适合并行计算的处理器,一群研究者在改进机器翻译。他们未必知道几十年后这些东西会连接起来。
我们今天称之为“人工智能”的东西,从来不是某一个天才创造出来的未来,而是一代又一代人把自己能够解决的那一小块未知向前推进,最后在他们彼此都看不见的远方,拼成了一个时代。
主要史料与论文
如果只从今天回头看,人工智能很容易被理解成一件突然发生的事:2012年AlexNet在ImageNet竞赛中大幅领先,2016年AlphaGo战胜李世石,2017年Transformer提出,2020年GPT-3展示出规模带来的能力变化,2022年底ChatGPT进入公众视野,随后多模态、推理模型与Agent接连出现。曲线看上去在最近十几年陡然上扬。
但把时间轴拉长,就会发现今天几乎每一项令人意外的能力,背后都有一条长得多的技术祖先链。在ChatGPT出现七十多年前,人类已经开始认真讨论机器能否表现出智能;在GPU被用来训练神经网络的几十年前,已经有人尝试把神经元写成可以执行逻辑运算的形式模型;在Transformer之前,研究者用了数十年处理梯度、记忆、表示、序列与注意力的问题;而在Agent开始调用工具、执行代码、操作浏览器之前,强化学习研究者已经追问了几十年另一个问题——一个主体如何从环境反馈中学会行动。
所以真正的AI进化史不是一部“谁发明了人工智能”的英雄史,它更像一条由许多人分段铺设、且彼此并不知道终点在哪里的长路。有人处理计算的问题,有人处理学习的问题,有人处理数据的问题,有人处理算力的问题,有人处理语言的问题;还有一些机构当时做的事情看起来与人工智能关系并不直接,却最终成为整个时代不可缺少的基础设施。
理解这条历史,重要的不是记住年份,而是理解:人工智能究竟一步一步跨过了哪些门槛。
一、1936—1950:在制造智能之前,人类首先必须回答“机器究竟能计算什么”
现代人工智能的故事很难绕开Alan Turing,但他的重要性并不只在于后来那个被称作Turing Test的设想。1936年提交、次年正式发表的《On Computable Numbers,with an Application to the Entscheidungsproblem》处理的是一个更根本的问题:能否构造一种足够一般的形式化机器,通过有限规则完成计算,并由此界定哪些问题原则上可计算、哪些不可计算。这项工作当时属于数理逻辑而非人工智能,但它为后来的软件、算法乃至机器智能提供了最底层的地基——如果一个过程能够被完全形式化,它就有可能被机器执行。
1950年,Turing在Mind发表《Computing Machinery and Intelligence》,开篇提出“Can machines think?”,随即指出“思考”一词很难得到无争议的定义,于是把这个哲学问题替换成一个可以观察的行为问题,也就是文中的Imitation Game。需要说明的是,Turing本人并没有使用“Turing Test”这一名称,它是后来学界对这一设想的通称,而且今天流行的简化版本与原文设定并不完全一致。Turing既没有证明机器拥有意识,也没有宣称能对话即有智能。他做的事情更基础:把一个长期属于哲学的问题,转换成了可以由工程和实验讨论的问题。
与此同时,另一条更直接通向神经网络的线索也已出现。1943年,神经生理学家Warren McCulloch与逻辑学家Walter Pitts发表《A Logical Calculus of the Ideas Immanent in Nervous Activity》,把神经元抽象为具有阈值和开关性质的理想化单元,并论证由这类单元构成的网络可以表达命题逻辑中的运算。这不是今天意义上的神经网络——模型中没有学习机制,权重也不会调整——但神经活动第一次被抽象为一种可以执行逻辑计算的形式模型,并由此表达出一种后来反复出现的思想:复杂的认知行为未必需要某个神秘的“智能核心”,而可能来自大量简单单元之间的连接。
Claude Shannon的信息论、von Neumann参与推动的存储程序计算机结构以及早期数字计算机的工程进展,则从另外的方向完成了条件准备。他们并不是人工智能的创始人,但正是在这一时期,“计算”“信息”“逻辑”“神经活动”第一次被放进同一个可以数学化讨论的世界。
本章金句:AI的第一步不是让机器拥有智能,而是让人类开始相信——智能的一部分,也许可以被形式化。
二、1955—1956:人工智能被作为一个独立工程目标提出
“Artificial Intelligence”成为一个明确的研究项目,发生在1950年代中期。1955年8月31日,John McCarthy、Marvin Minsky、Nathaniel Rochester与Claude Shannon联合提交了《A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence》。当时McCarthy在Dartmouth任教,Minsky在Harvard,Rochester来自IBM,Shannon来自Bell Labs;“Artificial Intelligence”这一提法通常被认为由McCarthy在筹备过程中选用,部分原因是为了与当时已有的cybernetics等方向区分开来。
提案中真正重要的不是名字,而是那个大胆的假设:学习的每一个方面以及智能的其他特征,原则上都可以被精确描述到机器能够模拟的程度。研究者希望让机器使用语言、形成抽象与概念、解决当时只有人类能解决的问题,并改进自身。以此为基础的Dartmouth Summer Research Project于1956年夏天举行,参与者陆续来去,会期内并没有诞生某个决定性成果,它之所以被视为人工智能作为独立研究领域的重要起点,更多来自它确立的议程和人际网络,而不是某一天发生的“正式发明”。
今天重读这份提案会有一点恍惚:七十年前列出的语言、抽象、概念、问题求解与自我改进,几乎完整地出现在今天大型语言模型和Agent的研究议程中。只是最初的研究者对解决这些问题所需的时间,远比现实乐观。
这一时期也形成了后来被称为Symbolic AI的传统。Allen Newell、Herbert Simon与J.C.Shaw在1955—1956年前后完成Logic Theorist,使程序能够证明《Principia Mathematica》中的部分命题,并在Dartmouth会议上展示;随后他们发展出General Problem Solver,把手段—目的分析作为一种通用的问题求解策略。McCarthy则推进形式逻辑与知识表示,并在1958年前后设计LISP,其奠基性论文于1960年发表在Communications of the ACM。这条路线的基本信念是:如果智能活动可以分解为符号、规则、搜索与逻辑推理,机器就有可能通过操作符号产生类似智能的行为。
把Symbolic AI描述成“失败的旧路线”并不准确。搜索、规划、知识表示、自动定理证明、约束求解,乃至今天一些Agent系统中的planner,都能看到这条传统的延续。它真正遇到的困难在于:现实世界的复杂性远远超过人类能够显式写出的规则数量。机器可以执行规则,真正的难题逐渐变成——规则从哪里来?
本章金句:第一代AI试图把人的智能写进机器,此后整个历史却缓慢转向另一条道路——让机器自己从世界中学出来。
三、1957—1969:PERCEPTRON提出了一种新的知识来源
这条路线最重要的早期人物之一是Frank Rosenblatt。1957年,他在Cornell Aeronautical Laboratory的技术报告中提出Perceptron;1958年在Psychological Review发表《The Perceptron:A Probabilistic Model for Information Storage and Organization in the Brain》,随后主持建造了Mark I Perceptron这一硬件实现。模型本身今天看来非常简单:输入经过加权求和,依据阈值产生输出,并根据错误调整权重。但它代表的范式变化很重要。
传统程序中,知识主要由程序员显式写入:
Human Rules→Program→Output
Perceptron代表的路径则是:
Data+Error→Weight Update→Behavior
两者都运行在计算机上,但知识来源完全不同。前者告诉机器答案应该如何得到,后者允许机器通过样本逐步调整内部参数,也就是learning from examples。
当时的媒体报道确实存在明显夸张。1958年围绕Perceptron演示的公开报道中,出现过这类系统将能够行走、说话、书写乃至具有自我意识之类的预期,这些说法远超研究本身的实际内容,也为后来的落差埋下伏笔。
现实限制很快出现。单层Perceptron所能表示的函数类型有限,当时既缺乏训练多层网络的成熟方法,也没有足够的算力和数据。1969年,Marvin Minsky与Seymour Papert出版《Perceptrons》,以数学方式系统分析了这类模型的表达能力边界,其中对异或等问题的讨论后来被广泛引用。
但后来流行的叙事——“一本书杀死了神经网络并制造了AI Winter”——并不严谨。这一时期AI遭遇的困难远不止Perceptron:1966年美国的ALPAC报告对机器翻译的实际进展给出负面评价并影响了相关资助;语音理解项目未能兑现承诺,导致1970年代中期DARPA相关经费收紧;1973年英国的Lighthill报告对AI研究的总体价值提出质疑,影响了英国的资金格局;同时算力与存储极其有限,许多项目在真实复杂环境中无法工作。神经网络研究在此后十余年相对边缘化,是学术注意力、方法瓶颈、算力条件与资助环境叠加的结果,不能简单归因于单一事件。
更值得记住的是一条此后反复出现的规律:一个思想在逻辑上成立,并不意味着它已经具备工程上成立的条件。
本章金句:很多技术并不是因为思想错误而失败,而是因为它比支撑它的时代早到了几十年。
四、1965—1980S:当通用智能太难,人类先把专家知识装进机器
神经网络退居边缘时,另一条路线开始产生现实成果:Expert Systems。
1965年前后,Edward Feigenbaum与Joshua Lederberg等人在Stanford启动DENDRAL项目,试图利用计算机从质谱数据推断有机分子结构,Bruce Buchanan、Carl Djerassi等人也是关键参与者。DENDRAL成为专家系统发展史中的代表性项目之一,并推动出一种影响深远的工程判断:一个系统的能力,很大程度上取决于它掌握多少领域知识,而不只取决于推理算法有多通用。这一取向后来被称为knowledge-based approach。
1970年代,Edward Shortliffe等人开发的MYCIN进一步展示了这种模式:在边界清晰的专业领域中,把专家经验编码为数百条规则,由推理引擎组合运用,并处理不确定性。1980年代,专家系统进入商业高潮,DEC使用的配置系统R1/XCON是被反复引用的案例。
这是AI历史上第一次重要的现实主义转向。早期研究者希望尽快解决通用语言与类人推理,工程实践却发现,暂时放弃“什么都懂”、让系统只在一个高度专业化的领域工作,反而更快产生价值。
但成功同时暴露出结构性问题:知识需要专家与工程师一条条获取和编码,规则数量增加后一致性维护越来越困难,现实中的例外不断出现,系统本身缺乏从新经验中自动更新知识的能力。当环境变化,唯一的办法是继续手工修补。1980年代末,随着专用硬件市场萎缩与商业预期回落,这一波热潮明显降温。
专家系统证明了知识的重要性,却没有解决知识如何自动获得的问题。这个问题最终又把AI拉回了learning。
本章金句:专家系统证明知识能够产生智能,也让人类看清——真正昂贵的不是推理,而是把整个世界提前写成规则。
五、1986:机器开始学习自己的内部表示
1986年是现代神经网络史上的关键节点。David Rumelhart、Geoffrey Hinton与Ronald Williams在Nature发表《Learning representations by back-propagating errors》,系统展示了用误差反向传播训练多层网络的做法:输出与目标之间产生误差,误差信号沿网络反向传播,据此调整连接权重。
这里必须严谨。Backpropagation并非1986年才第一次出现。其数学核心是链式法则在多层复合函数上的反复应用,相关思想在控制论与最优化领域早有前身,例如1960年代Henry Kelley与Arthur Bryson等人在最优控制中的工作;Seppo Linnainmaa在1970年的硕士论文中给出了后来被称为reverse-mode automatic differentiation的一般方法;Paul Werbos在1974年的博士论文中提出把这类方法用于神经网络;1980年代中期David Parker与Yann LeCun也各自给出过相近结果。
1986年这篇论文的历史意义,不在于发明了一个算法,而在于它在connectionist与神经网络社区中产生了巨大影响,使这一训练方法被广泛接受和使用,并且清楚地展示了一件事:当多层网络通过误差训练时,中间的hidden units会逐渐形成对任务有用的内部特征表示。
这意味着范式的更深变化。传统计算机视觉中,工程师需要告诉机器什么是边缘、角点与纹理;传统语言处理中,研究者需要手工设计特征。而如果网络能自己学出中间表示,机器就不只是在学最终答案,而是在学应该怎样表示这个世界。Representation Learning由此成为现代深度学习的思想核心之一。
Geoffrey Hinton、Yann LeCun、Yoshua Bengio此后几十年的工作都可以放进这条脉络理解,但三人的贡献并不相同。LeCun在1989年将卷积结构与反向传播结合用于手写数字识别,并在1998年的LeNet-5工作中形成较完整的CNN方案;Hinton长期研究分布式表示、玻尔兹曼机与多层网络的学习机制,2006年前后关于深层网络逐层训练的工作重新激起对深度模型的兴趣;Bengio在神经语言模型方面推进较早,2003年发表的《A Neural Probabilistic Language Model》是用神经网络学习词的分布式表示与语言模型的重要工作。2018年的ACM Turing Award授予三人,表彰他们使深度神经网络成为计算领域的关键组成部分。
真正值得记住的不是“三巨头”这个称号,而是他们在长期非主流的处境下共同坚持的一个判断:世界中重要的特征,不一定需要由人类提前定义。
本章金句:深度学习改变的不只是机器如何得到答案,而是机器开始自己决定——世界应该被表示成什么。
六、1980S—1990S:另一群研究者在追问机器怎样学会行动
与此同时,另一条在“大模型发展史”中常被略过、却对今天的Agent极其重要的路线正在成熟:Reinforcement Learning。
监督学习的问题通常是:给定输入与正确答案,学习两者之间的映射。强化学习面对的问题不同:一个主体进入环境,采取行动,环境返回新状态与回报,主体必须从可能长期延迟的结果中判断,过去哪些行动是好的。这里同时包含credit assignment与exploration–exploitation两个困难。
Richard Sutton与Andrew Barto是这条路线最关键的奠基者。1983年,Barto、Sutton与Charles Anderson的工作确立了后来被称为actor–critic的结构;1988年Sutton在Machine Learning发表《Learning to Predict by the Methods of Temporal Differences》,系统讨论如何利用相邻预测之间的差异进行学习;1989年Christopher Watkins在博士论文中提出Q-learning,并与Peter Dayan在1992年给出收敛性证明;1998年出版的《Reinforcement Learning:An Introduction》成为这一领域的标准教材。2025年3月5日,ACM宣布将2024年A.M.Turing Award授予Barto与Sutton,表彰他们为强化学习建立概念与算法基础。
这条路线的意义在今天格外清晰。一个模型会识别猫、会翻译语言、会预测下一个词,并不等于它能在现实中持续行动。行动意味着状态会改变,前一个动作会影响后一个动作,回报可能延迟,而模型必须面对自己行为造成的新环境。AI的问题因此从What is this?扩展到What should I do next?
这条路线后来与深度神经网络汇合,成为DQN、AlphaGo以及许多决策系统的重要基础。
本章金句:预测让机器理解世界的统计结构,强化学习则开始系统追问——机器如何为自己行动的后果负责。
七、1997:LSTM让神经网络更认真地面对时间
对语言、语音以及任何连续过程而言,还有一个长期存在的困难:记忆。前馈网络处理完一次输入就结束了,但语言的含义依赖上下文,时间序列依赖过去,句子开头的内容可能在很久之后才决定某个词的意义。为此研究者发展了recurrent neural network,希望让网络保留过去的状态。
然而训练RNN会遇到梯度在时间上反复相乘而衰减或爆炸的问题。Sepp Hochreiter在1991年的毕业论文中对这一现象作了系统分析,Yoshua Bengio等人1994年的论文也从理论上说明了用梯度下降学习长期依赖的困难。
1997年,Hochreiter与Jürgen Schmidhuber在Neural Computation发表Long Short-Term Memory,提出带有门控机制的记忆单元,使误差能够在更长的时间跨度上保持相对稳定的回流。后续工作继续改进这一结构,例如Felix Gers等人在2000年前后引入forget gate。
需要准确表述的是:LSTM显著缓解了长期依赖的训练困难,扩展了可处理的时间跨度,但并没有“彻底解决记忆问题”,它在极长依赖、并行效率等方面仍有明显限制。即便如此,LSTM在此后十余年支撑了语音识别、机器翻译与大量序列建模任务,是当时最实用的方案之一。
Transformer之后,LSTM不再处于生成式AI的中心位置,但它处理的是智能系统一个根本问题:过去如何继续存在于现在。
本章金句:没有记忆,机器只能处理一个个孤立的瞬间;能把过去带进现在之后,它才开始面对序列世界。
八、2006—2012:算法、数据与算力第一次同时跨过阈值
如果AI史只按论文写,会漏掉一家公司:NVIDIA。
GPU最初是为图形计算设计的硬件。2006年11月,NVIDIA随G80架构公布CUDA,使开发者能够用接近C的方式编写运行在GPU上的通用并行程序,而不必再把计算伪装成图形操作;首个公开SDK于2007年初发布,CUDA 1.0在2007年正式推出。因此“2006年推出、2007年正式发布”这两种说法并不矛盾,前者指架构与编程模型的公布,后者指正式版本的交付。
这件事当时并不是为了训练语言模型。但神经网络的核心计算恰好是大规模矩阵与向量运算,天然适合大量简单计算单元同时工作的结构;GPU的高并行度与高内存带宽,使原先需要数周的训练缩短到可接受的范围。一个为图形世界演化出来的处理器,就这样成为神经网络训练的合适平台。CUDA并不是为ChatGPT准备的,但它让此前只存在于论文中的模型规模变得工程可行。
另一边,数据条件也在变化。2009年,Jia Deng、Wei Dong、Richard Socher、Li-Jia Li、Kai Li与Fei-Fei Li在CVPR发表《ImageNet:A Large-Scale Hierarchical Image Database》。论文报告当时的ImageNet已包含约5247个synset、约320万张按WordNet层级组织的图像,并计划扩展到数千万张;大规模人工标注依托众包完成。Fei-Fei Li在这一项目中起到关键推动作用,但ImageNet是一项团队工程,其规模来自众多研究者与标注者的持续投入。2010年起举办的ImageNet Large Scale Visual Recognition Challenge(ILSVRC)则提供了统一的评测标准,这一竞赛持续到2017年。
ImageNet真正改变的是研究问题的尺度。此前视觉算法可能只在几千、几万张图像上验证;此后研究者第一次拥有足够庞大且结构化的数据,可以检验模型能否从大规模现实样本中学到视觉表示。
到2012年,三个长期独立发展的条件同时成熟:可训练的深层网络、足够大的数据集、足够强的并行计算。Alex Krizhevsky、Ilya Sutskever与Geoffrey Hinton的AlexNet在ILSVRC-2012上把top-5错误率降到15.3%,而第二名约为26.2%。该网络包含五个卷积层与三个全连接层,约6000万参数与65万个神经元,使用两块GTX 580 GPU并行训练,并结合了ReLU、dropout与数据增强等做法。
AlexNet的意义因而不只是一篇效果更好的分类论文。它让一种工程判断变得可信:如果模型能够自己学习表示,那么数据规模与计算规模本身就可能成为能力变量。深度学习从此不再只是一小群研究者坚持的学术路线。
本章金句:2012年被证明的不是某种网络突然变聪明,而是算法、数据与算力一旦同时越过阈值,能力可以被工程化地放大。
九、1997与2016:从搜索到学习,从感知到决策
2012年之后,深度学习首先征服的是感知问题:识别图像、理解语音、处理文本。DeepMind则试图把另一条历史路线接进来——Deep Learning与Reinforcement Learning的结合。
在此之前,机器在博弈上的代表性胜利来自另一种技术传统。1997年5月,IBM的Deep Blue在六局比赛中以3.5比2.5战胜Garry Kasparov(1996年的首次对弈由Kasparov获胜)。Deep Blue依靠专用棋类芯片构成的大规模并行硬件、alpha-beta搜索,以及包含大量人工设计项、并借助特级大师对局调校参数的评估函数,同时配合开局库与残局库。把它简化为“纯暴力搜索”并不准确——它的评估函数相当复杂——但其中的知识主要由人类设计与调参,而不是从数据中学出来的。
2016年1月,David Silver等人在Nature发表《Mastering the game of Go with deep neural networks and tree search》。AlphaGo把policy network与value network同Monte Carlo Tree Search结合:先用人类棋谱进行监督学习,再通过自我博弈的强化学习改进策略,并训练价值网络评估局面,从而在搜索中大幅削减需要展开的分支。论文发表时,AlphaGo已在2015年10月以5比0战胜欧洲冠军樊麾;2016年3月与李世石的五局比赛以4比1结束,让公众第一次直观感受到这条路线的力量。DeepMind由Demis Hassabis等人创办,Silver是该项目的主要负责人之一。
AlphaGo的意义不在于“机器终于赢了人类”,而在于系统的判断能力越来越多来自学习而非人工编码。它不需要有人提前写完每种局面应当如何应对,而是通过棋谱、自我博弈与反馈不断调整策略。从AlexNet到AlphaGo,AI完成了一次重要跨越:Perception→Decision。
本章金句:改变世界的智能从来不只需要看懂现实,它最终必须在无数可能之中选出一个行动。
十、2003—2017:从词向量到ATTENTION,机器学会动态决定什么值得关注
Transformer之前,自然语言处理已经走过很长的路。用连续向量表示词的思想有更早的前身,包括分布式表示、潜在语义分析等传统;Bengio等人2003年的神经概率语言模型把词向量与语言建模放进同一个神经网络框架;2013年Tomas Mikolov等人提出的word2vec因训练高效、效果直观而使word embeddings被广泛使用,但它更准确的定位是让这一思想规模化与普及化,而不是最早提出者。
2014年,Ilya Sutskever、Oriol Vinyals与Quoc Le的Sequence to Sequence工作展示了用多层LSTM把一个序列编码、再解码生成另一个序列的通用方法;同年Kyunghyun Cho等人也提出了类似的encoder–decoder结构。但这种设计有明显瓶颈:把整个源句压缩进一个固定长度向量,长句信息容易损失。
同年,Dzmitry Bahdanau、Kyunghyun Cho与Yoshua Bengio在《Neural Machine Translation by Jointly Learning to Align and Translate》中提出,让解码器在生成每个输出时对输入序列各位置计算权重,动态选取当前最相关的部分。选择性关注的思想在认知科学与更早的神经网络研究中已有多种形式,这项工作的主要历史意义在于,它成为现代neural attention在序列建模中最具影响力的早期工作之一,此后Luong等人的工作又给出了多种变体。
Attention的核心思想由此显现:处理复杂信息时,机器不必平等地记住一切,而可以根据当前需要决定哪些关系更重要。
2017年,Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N.Gomez、Łukasz Kaiser与Illia Polosukhin发表《Attention Is All You Need》,提出Transformer:完全以self-attention与前馈层构成,去掉recurrence与convolution,并用位置编码补充顺序信息。论文当时的实验主要针对机器翻译。
Transformer的成功不能只解释为“比RNN更聪明”。它在建模能力上的优势——任意两个位置之间可以直接建立联系,路径更短——固然重要,但同样关键的是它的计算结构:序列内的大量计算不再必须严格逐时间步串行,训练可以高度并行。当这种架构遇上不断扩大的GPU/TPU集群、日益成熟的分布式训练系统和更大的数据集时,一个正反馈循环开始形成。需要补充的是,self-attention的计算量随序列长度平方增长,这也是后来长上下文研究的主要动机之一。
本章金句:Transformer的关键不只在于它更会处理关系,而在于这种处理关系的方式恰好可以被大规模计算放大。
十一、2018—2020:问题从“如何解决一个任务”变成“能否先训练一个通用模型”
Transformer出现后,多个研究团队沿不同方向探索同一个问题:是否还需要为每个NLP任务单独训练一套模型?
2018年6月,Alec Radford、Karthik Narasimhan、Tim Salimans与Ilya Sutskever在《Improving Language Understanding by Generative Pre-Training》中提出GPT:先用大规模无标注文本训练自回归语言模型,再针对具体任务做监督微调。同年10月,Google的Jacob Devlin、Ming-Wei Chang、Kenton Lee与Kristina Toutanova提出BERT,用masked language model与下一句预测目标训练双向Transformer表示,并展示一个预训练模型经过较少的任务特定改动即可在多项基准上取得强结果。
两者的架构选择与训练目标不同——一个偏生成、单向,一个偏理解、双向——但它们共同指向同一个变化。AI的生产方式正在从:
One Task→One Model
转向:
Pretrain Once→Adapt to Many Tasks
这是一场工程组织方式上的改变。过去一家机构若需要情感分类、问答、摘要与实体识别,往往需要不同的数据、模型与训练流程;预训练范式成熟后,越来越多任务建立在共享的基础模型之上。模型由此开始从“工具”接近“基础设施”,Foundation Model的说法也在此后逐渐出现。
本章金句:基础模型改变的不是某一个任务的准确率,而是能力的生产方式——从一次性工程变成可以反复调用的底座。
十二、2020:SCALE成为一个显式的工程变量
2020年1月,Jared Kaplan等人发表《Scaling Laws for Neural Language Models》。研究发现,在实验覆盖的范围内,语言模型的cross-entropy loss与模型参数量、数据量和训练计算量之间呈现相对稳定的幂律关系,且趋势跨越多个数量级。同年5月,Tom Brown等人发表《Language Models are Few-Shot Learners》,介绍了拥有1750亿参数的GPT-3,并展示模型在不更新参数的情况下,仅凭提示中的少量示例即可完成多种任务,这种行为后来被称为in-context learning。
这对整个工程体系的冲击很大。此前人们通常认为能力突破首先来自更聪明的新算法;scaling的研究提出了另一种可能:在已有一个足够有效且可并行扩展的架构之后,增加计算、数据与模型规模本身也可能系统性地带来能力提升。
但必须说明这类结论的边界。Scaling laws描述的主要是在给定设置下损失随资源变化的经验规律,它不保证任意能力都会随规模自动出现,也不意味着规模可以替代数据质量与算法改进。2022年,DeepMind的Jordan Hoffmann等人在Chinchilla工作中指出,此前的大模型在给定计算预算下普遍训练不足,参数量与训练token数应大致同比例增长;他们用700亿参数、1.4万亿token训练的模型在多项评测上超过了参数量更大的模型。这说明所谓scaling并非“越大越好”,而是需要在参数、数据与计算之间寻找配比。
尽管如此,一个结构性变化已经发生:算法仍然重要,但芯片、数据中心、网络带宽、分布式训练、数据清洗、训练稳定性与能源供应,都成为“能力”的组成部分。这也是NVIDIA从一家GPU公司走到产业中心的原因之一。
本章金句:Scale的意义在于,它把一部分能力提升从偶然的算法突破,转化成了可以持续投入并测量的工程变量。
十三、2017—2022:能力与可用性并不是同一件事
规模继续扩大后,另一个问题变得突出:模型的语言能力越强,并不等于它知道人真正想要什么。预训练模型的优化目标来自数据分布与预测任务,而不是“成为一个可靠的助手”。Alignment因此从相对边缘的议题进入核心工程链路。
利用人类反馈训练策略的思想也有其历史。W.Bradley Knox与Peter Stone在2008年前后的TAMER工作探索了用人类评价信号塑造智能体行为;2017年,Paul Christiano等人在《Deep Reinforcement Learning from Human Preferences》中展示了用人类对轨迹片段的成对比较训练奖励模型,再用强化学习优化策略的完整方案;2019年Daniel Ziegler等人将这一框架应用于语言模型微调,2020年Nisan Stiennon等人用它改进摘要质量。因此RLHF并非在某一年由某一家机构发明,而是在偏好学习、逆强化学习与人机交互等多条线索上逐步成形。
2022年3月,Long Ouyang等人发表《Training Language Models to Follow Instructions with Human Feedback》,即InstructGPT。流程包括三步:先用人工编写的示范数据做supervised fine-tuning;再收集标注者对同一提示下多个输出的偏好排序,训练reward model;最后用PPO依据该奖励模型继续优化语言模型。论文报告了一个常被引用的结果:在其提示分布上的人工评估中,13亿参数的InstructGPT输出比1750亿参数的GPT-3更受标注者偏好。需要注意的是,这一比较依赖于特定的提示分布、标注者群体与评估方式,反映的是输出是否符合人类偏好,而不是模型在所有能力维度上的全面优劣。
这个结果提醒整个行业:Capability≠Usability。模型更强,不代表它天然理解人的真实意图。
本章金句:能力衡量机器能做什么,对齐衡量它是否在做人真正要求的事,这是两个不同的问题。
十四、2022:CHATGPT改变的是接口
2022年11月30日,OpenAI发布ChatGPT。它并不是一种与此前完全不同的新神经网络,而是在GPT系列、instruction tuning、人类反馈与对话式交互等多条路线逐渐成熟之后,把这些能力以极低的门槛暴露给普通人。
以前使用AI往往意味着数据集、模型、代码、训练任务与专业团队;此后使用AI可以只是说一句话。这一变化容易被低估,因为它看起来不像技术突破。但技术只有在调用成本足够低时,才会真正进入社会结构。ChatGPT的历史意义,很大程度上在于它把几十年积累的机器能力,通过自然语言接口交到了大量非专业使用者手中。
本章金句:ChatGPT的突破未必是机器突然变聪明,而是几十年积累的能力第一次可以被任何人直接调用。
十五、2023—2026:从生成信息到产生行动
ChatGPT之后,模型能力迅速向多模态、长上下文、代码、推理与工具调用扩展,Agent成为被反复讨论的形态。
这部分必须保持克制。我们距离这些变化太近,今天看起来重要的模型名称、产品形态甚至公司格局,十年后未必仍在技术史主干上;正如1980年代一批炙手可热的AI公司最终没有构成长期主线一样。Reasoning Models、Multimodal Models、Tool Use与Agents之中,哪些是长期结构、哪些只是阶段性形态,还需要时间判断。
但有一个方向值得单独提出。过去大部分AI系统本质上停留在:
Input→Model→Output
即使输出很聪明,它主要仍在产生信息。而Agent形态更接近一个闭环:
Observe→Reason/Plan→Tool→Action→New State
模型可以调用搜索、数据库、程序、浏览器与各类系统接口。一次输出不再只是提供答案,而可能成为下一次调用、一次代码执行或一次系统状态变化的输入。AI因此开始跨过一条边界:Information→Execution。
这实际上把此前几十年的多条支流重新汇合:可计算性界定了机器能做什么;符号传统留下搜索与规划;神经网络解决从数据中学习;Representation Learning解决内部表示;LSTM与Transformer处理序列与关系;GPU与大规模数据使规模化成为可能;预训练把能力变成通用底座;人类反馈开始处理意图问题;而长期研究行动与反馈的强化学习,在这一阶段重新显示出它的位置。
需要说明的是,今天的Agent远未实现完全自主,其可靠性、错误累积与可控性仍是未解问题,本文也无意由此推出任何关于通用人工智能的判断。但问题的性质确实在变化。
本章金句:当AI的输出能够直接改变现实,问题就从“答案是否正确”扩展到“这个行动是否应该发生”。
十六、回头看八十年:AI从来不是一个人的发明
如果一定要在这八十年里找出一个“AI发明者”,大概率会失败。
Turing没有训练过神经网络;McCulloch与Pitts没有见过GPU;Rosenblatt不知道ImageNet;Rumelhart不知道Transformer;Hochreiter与Schmidhuber不知道ChatGPT。Fei-Fei Li与ImageNet团队建设那个数据集时,目标是推动视觉识别研究,而不是训练语言模型。NVIDIA推动CUDA时,面向的是通用并行计算和科学计算,不可能完整预见几十年后的AI数据中心。《Attention Is All You Need》的八位作者最初处理的是机器翻译,而不是一个能写代码、看图片、调用工具的通用助手。
GPT、BERT、AlphaGo、AlexNet也都不是从零开始的奇迹。每一次看似突然的突破,向下挖都是几十年的沉积:AlexNet之下是CNN、backpropagation、ImageNet与GPU;Transformer之下是分布式表示、word embeddings、seq2seq与attention;GPT之下是Transformer、语言模型、无监督预训练与分布式计算;ChatGPT之下又有GPT、instruction tuning、人类反馈与几十年强化学习留下的方法。
所谓革命,多数时候不是凭空发明,而是此前彼此独立发展的条件终于同时成熟。
因此这段历史更像几条河流汇入同一水系:计算理论让机器成为可能;符号系统让推理成为程序;神经网络让知识可以从数据中学习;强化学习让机器开始研究行动与后果;数据与计算基础设施让学习得以规模化;预训练与人类反馈让这些能力成为普通人可以直接调用的系统。而正在发生的Agent化,也许会加入第七条支流:Execution。
结语:AI真正进化的,也许一直不是“智商”
只看benchmark,人工智能的历史很容易被读成一条智力曲线:机器越来越会下棋、识图、翻译、答题、写程序、做数学。但从更长的尺度看,真正的演进发生在更深的地方。
最早,人类证明计算可以被机器执行;随后证明逻辑可以被机器操作;接着发现知识可以被机器学习;之后发现表示本身也可以被机器学习;再后来,机器获得了记忆、注意力与从环境反馈中调整行为的能力。GPU、大规模数据与分布式系统把这些算法推到人类无法手工设计的尺度;Transformer与Foundation Model让分散在无数任务中的能力进入同一个模型;人类反馈开始让能力靠近意图;而Agent正把这些能力从信息空间向现实延伸。
八十多年里,人类其实在不断把原本必须由自己明确编写和执行的认知过程交出去。最初我们亲自写每一条程序;后来不再写所有规则;再后来不再设计所有特征;然后不再为每个任务单独训练模型;今天我们开始允许模型自己分解问题、选择工具、组织步骤并产生行动。从rules到features,到representations,到tasks,再到reasoning与planning,并逐渐进入actions——这才是这段历史更值得记住的主线。它不是机器越来越“像人”,而是人类不断找到新的工程方法,把过去只能由人完成的认知过程,转换成可以被学习、组合与规模化的结构。
所以ChatGPT不是人工智能历史的开始,Transformer不是,深度学习也不是。它们更像一些罕见的汇合时刻:此前散落在数学、神经科学、计算机科学、芯片、数据、语言学与控制理论中的积累,在某个节点同时成熟,于是世界在很短时间里看到一次能力跃迁。
这也解释了为什么真正的技术变革在发生之前往往很难被看见。站在历史现场的人通常只能看到自己正在解决的那个小问题:Turing在研究可计算性,Shannon在研究信息,Rosenblatt在研究Perceptron,Hinton在研究网络如何形成内部表示,ImageNet团队在建设一个更大的视觉数据集,NVIDIA在制造更适合并行计算的处理器,一群研究者在改进机器翻译。他们未必知道几十年后这些东西会连接起来。
我们今天称之为“人工智能”的东西,从来不是某一个天才创造出来的未来,而是一代又一代人把自己能够解决的那一小块未知向前推进,最后在他们彼此都看不见的远方,拼成了一个时代。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”
