基础模型为什么重要
在人工智能领域,大约在2021 年,斯坦福的一组教授写过一篇报告,第一次明确提出了今天大家都在使用的一个概念:
Foundation Model,也就是基础模型。
我们今天讲模型、讲大语言模型,但“基础模型”这个概念,是到2021 年才被这样明确提出的。它的重要性在于,它让我们意识到:数据不是简单地喂给模型的材料,而是模型能力形成的根基。
这也是我今天为什么要讲,科学数据应该被放进基础模型。
今天我们说“大模型”,在中文语境里,很多时候会把“大语言模型”里的“语言”两个字省掉。但事实上,完整地说,大语言模型是建立在文本数据上的基础模型。它的根本能力,来自人类对文本数据的长期积累和处理。但处理文本这件事情,并不是人工智能出现以后才有的。我们作为在中文环境里读书的人都知道,中国古代的典籍,最初是没有标点符号的,甚至也没有今天意义上的空格。中文是到一百多年以前,才逐渐开始系统使用标点符号。古拉丁文在早期也是如此,没有空格,也没有标点符号。没有标点符号会带来什么影响?一个人如果不把这句话读出来,就很难完成阅读和理解。所以,对文本进行处理这件事,早在人类文明史中就已经存在。用今天的观点看,在文本
之间加入空格和标点,某种程度上也可以理解为一种早期的Tokenization。
今天的大语言模型,把人类对文本的处理带到了一个前所未有的高度。Tokenization 是其中非常关键的一环。
基础模型为什么重要