大模型是什么
2026-09-25 · 彬城AI AI科普系列
我们平时天天用的豆包、DeepSeek,背后都是大模型。那你知道大模型是什么吗?它又为什么被叫做大模型呢?今天我们五分钟把它搞清楚。
大模型英文全称叫 Large Language Model,叫做大语言模型。我们把它每一个字母的首字母提取出来——LLM,这就是大模型的英文缩写。
那么要搞懂大模型是什么,我们只要知道两个核心的东西就行了。第一个叫做参数文件,第二个叫做运行代码。
那么我们都学过一个一元一次方程,比如说 y=kx+b。这个方程里面的 k 和这个 b,就是两个参数了。整个这个方程式,我们就可以把它理解成大模型的运行代码,这两个参数就是它的参数文件。只不过大模型,它的参数文件不止这两个,而是有成千上万亿个参数。
2018年6月 GPT-1 发布,当时它的参数量只有1.17亿。2019年 GPT-2 发布,它的参数量已经达到了15个亿。那么在2020年 GPT-3,它的参数量达到了恐怖的1750亿参数。人类的神经元大概是850亿,它的参数是我们神经元的两倍,是前一年 GPT-2 的116倍。
把一个参数写在一张A4纸上,把这些A4纸全部连起来,大概可以绕地球1300圈。全部叠起来,高度是珠穆朗玛峰的近2000倍。当时它的一次性训练成本460万美元,折合人民币约3300万元。要知道这在当时,2020年可是一笔天价的研发费用,可以全款买下近三架中型客机,仅仅只为跑一次训练模型。
这也就引出了我们的大模型,它这个"大"指的是哪两个大?第一,它的参数文件非常巨大。第二,消耗的算力和资源非常巨大。
值得一提的是,这恐怖的参数量,直接触发了大模型的涌现能力。什么是涌现能力呢?简单说就是量变引起质变。一杯水你把它在常温下慢慢降温,在零度之前,你都不会发现这个水有什么变化。但一旦你把温度降到零度以下,水就会瞬间结成冰,这就是量变引起质变。当参数量突破了某一个临界值,大模型的能力就会发生一个天翻地覆的变化。一旦参数突破到某个临界值,大模型会凭空诞生一些没有被专门训练过的能力,就好像被打通了任督二脉一样。它只给一两个简单案例训练,就可以解锁数学题、写代码的全新能力。这些能力全部都是海量的数据堆叠起来,突然出现的智能。
当然这不是我们这期视频的重点,我们接下来看大模型它具体是怎么被训练的。
大模型训练方法有三种。第一步,预训练。这一步训练主要是大模型从网上获得海量的数据以后,经过清洗,把这些数据当做样本数据。这一步训练的目标,是为了让大模型可以做到词语接龙。比如说我们有一段词叫"矿泉水",我们把"泉"字和"水"字遮起来,拿"矿"字去问大模型。你可以把这个"矿"字理解成我们这里带入的 x,那么我们需要它下一步预测的就是这个 y。如果测出来不是"泉"字怎么办?那么我们就通过调整参数的方法,让它的结果也就是这个 y 出现的概率越来越高,直到大模型出现我们想让它出现的这个值。预测下一个字也是以此类推,也是通过调整参数的方法让它计算出"水"字。这就是第一步预训练,就这么拿上亿个片段反复地去训练,上亿个训练反复地纠正,直到它出现我们想要的结果。
预训练有一个问题,它只会续写,但是不会回答问题。比如你问它1+1等于几,它可能不会回答"二",反而还会说"1+2等于几?1+3等于几?"所以第二步就需要我们的监督微调。这一步我们给它准备了大量的问题和答案,也就是问答对,让它学会我们人类的问答习惯。给它问问题,它就给我们答案。
会回答不代表回答得好,这就需要我们的第三步强化学习。当大模型给出回答以后,我们设置一个奖励模型,对它给出的回答进行排序打分。回答较好的给高分排在上面,回答较差的给低分排在下面。靠它反复打磨,直到高分越来越多,低分越来越少。这一步就是为了提高大模型的回答质量。
好了总结一下,大模型它实际上就是一个参数文件,非常巨大的一个运行代码。它的训练方法有三种:第一步叫预训练,让它做好接词的工作;第二步叫监督微调,让它学会回答;第三步强化学习,是为了提高它的回答质量。
本文整理自彬城AI《AI科普》系列科普视频,文字略有整理。更多内容见行业洞察。彬城AI(彬城工程咨询(南昌)有限公司)提供人工智能体开发、信息化系统建设与AI实战培训服务,业务交流请致电 182 7919 8383。