文章目录
-
-
- 前言
- 1 先搞懂:预训练到底在干一件什么事
-
- 1.1 打个最通俗的比方
- 1.2 核心是“自己当自己的老师”
- 2 三个阶段别搞混:预训练、微调、推理
-
- 2.1 各自的活儿是什么
- 2.2 一句话记明白
- 3 主流的两种预训练路子
-
- 3.1 自回归派:接龙专业户
- 3.2 掩码语言模型:完形填空高手
- 4 GPT具体是怎么练出来的?
- 5 训练数据都从哪来?
- 6 预训练到底有多烧钱?
-
- 6.1 规模是什么概念
- 6.2 成本有多夸张
- 6.3 为啥大家都玩命堆规模?
- 7 一整套工程流程,没那么简单
- 8 预训练完的模型,到底学会了啥?
- 9 普通人也能参与吗?
-
- 9.1 走微调路线,站在巨人肩膀上
- 9.2 做数据工程,这是被低估的风口
- 9.3 用好模型,比训模型更重要
-

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程
http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
前言
天天用各种大模型聊天,有没有人好奇过——这玩意儿刚“出生”的时候,其实根本不会聊天?
别不信,咱们现在随手用的对话AI,全是后天一步步“改造”出来的。它最初的形态,就是个只会“接下一句”的文本续写机器。
而把它从一张白纸练成续写机器的核心过程,就是今天要聊的:预训练。
1 先搞懂:预训练到底在干一件什么事
说穿了特别简单,跟人学说话的逻辑一模一样。
1.1 打个最通俗的比方
把一个人关进全是书的图书馆,不给手机不让唠嗑,就让他没日没夜翻书。
翻的时候他会下意识顺着文字往下想,下一个词该是什么。翻个几年下来,语法、常识、逻辑,甚至写文章的本事,自然就都有了。
搁正常人待俩月就得疯,模型待几个月,直接成语言大师,还不用管饭。
大模型的预训练,干的就是这件事。
1.2 核心是“自己当自己的老师”
很多人以为训练模型得人工标数据,标到天昏地暗。
预训练根本不用。文本本身就是答案,模型自己给自己出题。
要么猜下一个词,要么填被遮住的词,猜对了就算学会了,猜错了就调整自己的参数。
这种自己教自己的方式,行话叫自监督学习。说白了就是自学成才,不用家教,省了一大笔补课费。
2 三个阶段别搞混:预训练、微调、推理
很多人聊大模型张嘴就说“训练”,其实这事儿完整分三步,分工完全不一样。
2.1 各自的活儿是什么
第一阶段,预训练。喂万亿级的文本,靠自监督学习,练出基座模型。
第二阶段,微调。拿整理好的指令数据集,监督学习,让模型学会听指令。
第三阶段,推理。就是咱们平时用的过程,输入问题,模型输出答案。
2.2 一句话记明白
预训练就是埋头苦读万卷书,打牢基础。
微调就是老师带着刷真题,学答题套路。
推理就是上考场答题,给用户输出结果。
跟咱们上学考试一个流程,区别是模型不用熬夜背知识点,也不会考前焦虑,更不会考完试就全忘光。
咱们平时用的各种聊天AI,全是走完了这三步的成品,不是天生就会唠嗑的。
3 主流的两种预训练路子
别看现在大模型五花八门,预训练的核心玩法,其实就两大流派。
3.1 自回归派:接龙专业户
代表就是GPT系列,核心玩法就是预测下一个词。
给它“今天天气”,它就猜下一个是“很”;给它“今天天气很”,它就猜下一个是“好”。
跟咱们小时候玩的成语接龙、故事接龙一模一样,一路往下接,接得越顺越厉害。
现在咱们常用的对话、生成类大模型,基本走的都是这条路线。
3.2 掩码语言模型:完形填空高手
代表是BERT系列,玩法是把句子里的词遮住,让模型猜被遮住的是什么。
比如“今天[MASK]很好”,让模型填中间的“天气”。
这就不是接龙了,是标准的完形填空。这种训练出来的模型,特别擅长理解文本意思,分类、抽信息这类活手到擒来,但不擅长写东西。
简单说,一个擅长写,一个擅长读,分工明明白白。
4 GPT具体是怎么练出来的?
听着万亿参数很唬人,原理其实朴素得很。
就拿一句“今天天气很好”举例。
先拆成一个个最小的文本单元,也就是token。
然后给模型看“今天”,让它猜下一个是“天气”;给它看“今天、天气”,让它猜下一个是“很”;再给它看“今天、天气、很”,猜下一个是“好”。
猜错了就算误差,然后反向调整参数,下次争取猜对。
就这么一遍一遍猜,一遍一遍改,万亿次重复下来,语言规律就刻进参数里了。
说穿了就是题海战术,跟你刷一万道题就会做同类题一个道理,人家模型刷题速度比你快一万倍,还不用喝奶茶提神。
5 训练数据都从哪来?
一句话:网上能找到的正经文字,几乎都能拿来当素材。
网页、书籍、学术论文、代码、维基百科、论坛帖子……只要是成文的文本,都能喂给模型。
但不是抓过来直接喂。原始数据脏得很,重复的、垃圾的、低质量的,还有带隐私信息的,全都不能要。
得先清洗:去重、过滤、脱敏、筛掉没用的内容。
别小看清洗这一步,很多时候比训练本身还费工夫。就像你买菜回家,择菜洗菜的时间,往往比炒菜还久,洗不干净吃了还拉肚子,数据洗不干净,模型学歪了更麻烦。
6 预训练到底有多烧钱?
这么说吧,这事儿基本是大厂专属游戏,小公司连上桌的资格都难有。
6.1 规模是什么概念
数据量,万亿token起步。啥概念?一本红楼梦也就几十万字,万亿token相当于几万套红楼梦摞起来。
参数规模,几十亿到上万亿不等。
GPU数量,几千到几万张A100、H100起步。一张卡就得几十万,光硬件就是一笔天文数字。
训练时间,少则几周,多则几个月。几千张卡连轴转,那电费比一个小区的居民用电还猛,供电局看了都得乐开花。
6.2 成本有多夸张
早年的GPT-3,大概用了355 GPU·年,换算成钱,大几百万美元打不住。
到GPT-4这个级别,直接是数万GPU·年,成本直接冲到上亿美元。
硬件、电费、人力加起来,百万美元是起步,顶级模型得按亿算。
说白了,预训练拼的不止是算法,更是钱和资源。普通团队想从头练个大模型,跟你想自己造个火箭上天难度差不多,想想就行了,别真试。
6.3 为啥大家都玩命堆规模?
因为行业里有个铁律,叫Scaling Law,缩放定律。
简单说就是:模型参数、数据量、计算量,三者按比例一起涨,模型性能就会稳定提升。
模型扩大10倍,数据也跟着扩10倍,计算量就得扩大概100倍,效果就会肉眼可见地变好。
就跟你充游戏似的,充得越多战力越高,而且明码标价,童叟无欺,不存在暗箱操作。这也是当年大厂敢砸钱堆大模型的底气所在。
7 一整套工程流程,没那么简单
别以为预训练就是写几行Python代码跑起来就行,这是个完整的系统工程。
第一步,收集数据,全网扒各种文本素材。
第二步,清洗数据,去重、过滤、脱敏,把脏东西全筛掉。
第三步,训练分词器,把文字拆成标准化的小单元。
第四步,分词处理,把所有文本都转成模型能看懂的token。
第五步,构建训练样本,整理成一组组能用来训练的素材。
第六步,分布式训练,数据并行、张量并行、流水线并行一起上,把大模型摊到几千张GPU上跑。
第七步,保存存档,隔段时间存个进度,防止程序崩了全白干。
第八步,评估验证,时不时检验一下模型学得到底行不行。
这里面最复杂的就是分布式训练,不然万亿参数的模型,单张卡根本装不下,跑一年都跑不完。
8 预训练完的模型,到底学会了啥?
预训练结束的模型,叫基座模型,本事已经很大了,但有个致命问题:不会好好聊天。
语言能力、多语言翻译、语法语义,它都门儿清。
世界知识、常识事实,它肚子里也装了一大堆。
写代码、做基础逻辑推理、数学计算,也都能来两下。
但你跟它说“你好”,它大概率不会回“你好呀”,而是给你一段百科式的介绍,跟个只会背书的书呆子似的,主打一个答非所问。
所以还得经过后面的指令微调和人类对齐,把它从“书呆子”改成“会唠嗑的聊天搭子”。
9 普通人也能参与吗?
看到这儿可能有人觉得,这都是大厂的事,跟咱们普通人没关系。
还真不是。想掺和大模型赛道,门槛没你想的那么高,至少有三条路能走。
9.1 走微调路线,站在巨人肩膀上
现在开源的基座模型一抓一大把,人家已经花大价钱做完预训练了,你直接拿来用就行。
准备个几千到几万条自己业务的问答数据,找几张3090或者A100,用现成的框架跑几天,就能整出一个懂你业务的专属模型。
相当于别人已经把大学读完了,你给它做个岗前培训,就能上岗干活了,性价比拉满,比自己从头培养划算多了。
9.2 做数据工程,这是被低估的风口
模型好不好,数据质量是关键。而清洗数据、做高质量语料、设计指令数据集,恰恰是普通人能发力的地方。
写爬虫、搭清洗管道、去重过滤、做隐私脱敏,再到设计提示词模板、标注数据、做质量评估,全是行业刚需。
以后AI训练师、数据工程师这类岗位,只会越来越吃香。
9.3 用好模型,比训模型更重要
对绝大多数人来说,最有价值的参与方式,根本不是训练模型,而是用模型。
写代码、做文案、处理表格、搭知识库、做自动化客服……能把大模型揉进自己的工作流里,实实在在提升效率,就已经赢过大多数人了。
你不用自己从零造跑车,学会开车、会改装、懂保养,照样能在赛道上跑在前面。毕竟大街上跑的车,没几辆是车主自己造的。
最后一句话收个尾。
预训练,就是让模型在海量文本里,靠预测下一个词或者做完形填空的方式自学,练出语言能力和知识储备,造出基座模型。再经过微调和人类对齐,才变成咱们天天用的聊天AI。
预训练是大厂的战场,但应用和微调,是每个人的机会。
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。


