一、奠基期(2017–2020)
2017:Google提出Transformer,自注意力机制奠定大模型底层基础。 2018:OpenAI GPT-1(首个Decoder-Only预训练Transformer);ELMo、ULMFiT开启预训练语言模型浪潮;Word2Vec、GloVe为早期词向量底座。 2019:Google BERT(Encoder-Only,双向预训练引爆NLP),衍生RoBERTa、ALBERT、ELECTRA、DistilBERT、DeBERTa;OpenAI GPT-2,验证零样本文本生成;Google T5、BART(Encoder-Decoder架构);百度ERNIE,中文预训练模型落地。 2020:OpenAI GPT-3(175B参数),验证大模型少样本能力;XLNet,优化BERT的语言建模缺陷。
二、技术沉淀期(2021–2022)
2021:Google Switch Transformer,MoE混合专家模型规模化落地;GLM、mT5、T0完善Encoder-Decoder指令微调体系;EleutherAI发布GPT-Neo、GPT-J,开源复刻GPT技术栈。 2022:OpenAI InstructGPT,RLHF人类反馈强化学习落地,为ChatGPT铺垫;Google PaLM、LaMDA,验证思维链CoT;DeepMind Chinchilla,修正缩放定律,提出训练数据规模需匹配参数量;BLOOM、OPT,大规模开源大模型;CodeX,代码专用大模型;11月,ChatGPT(GPT-3.5)发布,大模型进入大众视野。
三、爆发期(2023)
OpenAI GPT-4,原生多模态,具备强推理能力;Meta LLaMA发布,开启开源大模型时代;Anthropic Claude1/2,主打超长上下文与宪法AI对齐;Google Bard、Flan系列迭代;国内文心一言、通义千问、讯飞星火、ChatGLM陆续上线;Mistral、Qwen开源系列模型兴起。
四、多模态与推理深化期(2024)
Google Gemini 1.5 Pro,百万token长上下文,原生多模态支持音视频;OpenAI GPT-4o实时多模态,o1模型主打深度推理;Anthropic Claude3系列,升级视觉与长文本;Llama3、Qwen2、DeepSeek开源模型性能逼近闭源;国内Kimi凭借超长上下文出圈,各大国产模型完成多模态升级。
五、Agent智能体时代(2025–2026.09)
核心方向转向Agent:模型具备规划、工具调用、迭代执行、自主纠错能力。 OpenAI迭代GPT-4.1、o3推理模型,强化复杂任务与计算机操作;Anthropic Claude Opus系列持续优化Agent稳定性与高分辨率视觉;Google Gemini2/3,融合多模态与智能体能力,落地机器人场景;开源Llama3.1、Qwen2.5、DeepSeek-R1推理模型普及;国内Kimi、通义、文心、GLM、DeepSeek、MiniMax、零一万物迭代长文本、Agent、多模态能力。 行业重心:不再比拼参数量,聚焦推理能力、Agent规划、统一多模态、推理成本、安全可控;大小模型混合部署、量化蒸馏技术成熟,模型从对话产品渗透到代码、科研、工业自动化场景。
六、三大架构分支
七、演进主线
八、写在最后
平台内已上线《大模型入门精品课》,纯干货一个月学完(没有冗余的理论,项目都是大型企业项目,非demo):覆盖 RAG、智能体、Lora微调实战项目、模型压缩(剪枝、量化、蒸馏),附带项目简历撰写和面试指导。感兴趣的小伙伴可以前往主页了解!课程地址:https://edu.csdn.net/course/detail/41422




